Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


1
¿Por qué la media aritmética es menor que la media de distribución en una distribución logarítmica normal?
Entonces, tengo un proceso aleatorio que genera variables aleatorias distribuidas normalmente XXX. Aquí está la función de densidad de probabilidad correspondiente: Quería estimar la distribución de unos pocos momentos de esa distribución original, digamos el primer momento: la media aritmética. Para hacerlo, dibujé 100 variables aleatorias 10000 veces para poder …




3
¿Cómo se pueden usar los modelos de aprendizaje automático (GBM, NN, etc.) para el análisis de supervivencia?
Sé que los modelos estadísticos tradicionales como la regresión de riesgos proporcionales de Cox y algunos modelos de Kaplan-Meier se pueden usar para predecir días hasta la próxima ocurrencia de un evento, por ejemplo, falla, etc., es decir, análisis de supervivencia Preguntas ¿Cómo se puede usar la versión de regresión …

2
Prueba t de muestras independientes: ¿los datos realmente necesitan distribuirse normalmente para muestras de gran tamaño?
Digamos que quiero probar si dos muestras independientes tienen medios diferentes. Sé que la distribución subyacente no es normal . Si entiendo correctamente, mi estadística de prueba es la media , y para tamaños de muestra lo suficientemente grandes, la media debería distribuirse normalmente incluso si las muestras no lo …

2
¿Cuáles son las aplicaciones prácticas existentes y conocidas de la teoría del caos en la minería de datos?
Mientras leía casualmente algunos trabajos de mercado masivo sobre la teoría del caos en los últimos años, comencé a preguntarme cómo se podrían aplicar varios aspectos de la minería de datos y campos relacionados, como redes neuronales, reconocimiento de patrones, gestión de incertidumbre, etc. Hasta la fecha, yo Me he …




1
Evaluar bosque aleatorio: OOB vs CV
Cuando evaluamos la calidad de un bosque aleatorio, por ejemplo, utilizando AUC, ¿es más apropiado calcular estas cantidades sobre las Muestras fuera de bolsa o sobre el conjunto de validación cruzada? Escuché que calcularlo a través de las muestras OOB ofrece una evaluación más pesimista, pero no veo por qué.

1
Descomposición de varianza sesgada
En la sección 3.2 de Reconocimiento de patrones y Aprendizaje automático de Bishop , analiza la descomposición de la variación de sesgo, indicando que para una función de pérdida al cuadrado, la pérdida esperada puede descomponerse en un término de sesgo al cuadrado (que describe qué tan lejos están las …


1
Teorema de Bayes con múltiples condiciones
No entiendo cómo se derivó esta ecuación. P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M1∩M2)≤P(I)P(I′)⋅P(M1|I)P(M2|I)P(M1|I′)P(M2|I′)P(I|M_{1}\cap M_{2}) \leq \frac{P(I)}{P(I')}\cdot \frac{P(M_{1}|I)P(M_{2}|I)}{P(M_{1}|I')P(M_{2}|I')} Esta ecuación fue del documento "Trial by Probability", donde se dio el caso de OJ Simpson como un problema de ejemplo. El acusado está siendo juzgado por doble asesinato y se presentan dos evidencias contra él. M1M1M_{1} es …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.