Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.






4
Aceptación de hipótesis nula
Esta es una pregunta de discusión sobre la intersección de las estadísticas y otras ciencias. A menudo me enfrento al mismo problema: los investigadores en mi campo tienden a decir que no hay ningún efecto cuando el valor p no es inferior al nivel de significancia. Al principio, a menudo …


3
Métodos para solucionar el problema de la falta de datos en el aprendizaje automático
Prácticamente cualquier base de datos que queremos hacer predicciones utilizando algoritmos de aprendizaje automático encontrará valores faltantes para algunas de las características. Existen varios enfoques para abordar este problema, para excluir líneas que tienen valores faltantes hasta que se llenen con los valores medios de las características. Me gustaría utilizar …

1
¿Cómo interpretar la entropía diferencial?
Recientemente leí este artículo sobre la entropía de una distribución de probabilidad discreta. Describe una buena manera de pensar en la entropía como los bits de número esperados (al menos cuando se usa en su definición de entropía) necesarios para codificar un mensaje cuando su codificación es óptima, dada la …


3
¿Cómo `predic.randomForest` estima las probabilidades de clase?
¿Cómo randomForestcalcula el paquete las probabilidades de clase cuando lo uso predict(model, data, type = "prob")? Estaba usando rangerpara entrenar bosques al azar usando el probability = Targumento para predecir probabilidades. rangerdice en la documentación que: Cultivar un bosque de probabilidad como en Malley et al. (2012) Simulé algunos datos, …

1
¿Qué método de comparación múltiple usar para un modelo lmer: lsmeans o glht?
Estoy analizando un conjunto de datos utilizando un modelo de efectos mixtos con un efecto fijo (condición) y dos efectos aleatorios (participante debido al diseño del sujeto y al par). El modelo se ha generado con el lme4paquete: exp.model<-lmer(outcome~condition+(1|participant)+(1|pair),data=exp). A continuación, realicé una prueba de razón de probabilidad de este …



2
ROC promedio para validación cruzada repetida 10 veces con estimaciones de probabilidad
Estoy planeando usar validación cruzada estratificada repetida (10 veces) en aproximadamente 10,000 casos usando el algoritmo de aprendizaje automático. Cada vez que la repetición se realizará con diferentes semillas al azar. En este proceso, creo 10 instancias de estimaciones de probabilidad para cada caso. 1 instancia de estimación de probabilidad …
15 roc 

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.