Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

1
AIC para modelos no anidados: normalización constante
El AIC se define como , donde θ es el estimador de máxima verosimilitud y p es la dimensión del espacio de parámetros. Para la estimación de θUn yoC= - 2 log( L ( θ^) ) + 2 pUNyoC=-2Iniciar sesión⁡(L(θ^))+2pagAIC=-2 \log(L(\hat\theta))+2pθ^θ^\hat\thetapagpagpθθ\theta, generalmente se descuida el factor constante de la densidad. …


6
¿Una medida robusta (no paramétrica) como Coeficiente de variación - IQR / mediana, o alternativa?
Para un conjunto dado de datos, la dispersión a menudo se calcula como la desviación estándar o como el IQR (rango intercuartil). Mientras que a standard deviationestá normalizado (puntajes z, etc.) y, por lo tanto, puede usarse para comparar la propagación de dos poblaciones diferentes, este no es el caso …




1
Regresión lineal con medidas repetidas en R
No pude descubrir cómo realizar una regresión lineal en R para un diseño de medida repetida. En una pregunta anterior (aún sin respuesta) me sugirieron que no usara lmsino que usara modelos mixtos. Utilicé lmde la siguiente manera: lm.velocity_vs_Velocity_response <- lm(Velocity_response~Velocity*Subject, data=mydata) (se pueden encontrar más detalles sobre el conjunto …




4
Selección de modelo de PCA usando AIC (o BIC)
Quiero usar el Criterio de información de Akaike (AIC) para elegir el número apropiado de factores para extraer en un PCA. El único problema es que no estoy seguro de cómo determinar el número de parámetros. Considere una matriz , donde representa el número de variables y el número de …



2
randomForest elige la regresión en lugar de la clasificación
Estoy usando el paquete randomForest en R y usando los datos del iris, el bosque aleatorio generado es una clasificación, pero cuando uso un conjunto de datos con alrededor de 700 características (las características son cada píxel en una imagen de 28x28 píxeles) y la columna de etiqueta se llama …
12 r  random-forest 

1
modelos bayesianos jerárquicos vs. Bayes empíricos
¿Consideraría que HBM vs EB son dos alternativas en las cuales los hiperparámetros están "en el juego" de ser muestreados / estimados / etc.? Claramente hay una conexión entre estos dos. ¿Consideraría que HBM es más "completamente bayesiano" que EB? ¿Hay algún lugar donde pueda ver cuáles son las diferencias …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.