Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


1
En un bosque aleatorio, ¿el% IncMSE mayor es mejor o peor?
Una vez que he construido un modelo de bosque aleatorio (regresión) en R, la llamada rf$importanceme proporciona dos medidas para cada variable predictiva, %IncMSEy IncNodePurity. ¿La interpretación de que las variables predictoras con %IncMSEvalores más pequeños es más importante que las variables predictoras con %IncMSEvalores más grandes ? ¿Qué tal …

2
¿Por qué se usa exactamente la información de Fisher observada?
En el ajuste estándar de máxima verosimilitud (iid muestra Y1,…,YnY1,…,YnY_{1}, \ldots, Y_{n} de alguna distribución con densidad fy(y|θ0fy(y|θ0f_{y}(y|\theta_{0} )) y en el caso de un modelo correctamente especificado, la información de Fisher viene dada por I(θ)=−Eθ0[∂2θ2lnfy(θ)]I(θ)=−Eθ0[∂2θ2ln⁡fy(θ)]I(\theta) = -\mathbb{E}_{\theta_{0}}\left[\frac{\partial^{2}}{\theta^{2}}\ln f_{y}(\theta) \right] donde se toma la expectativa con respecto a la densidad …




1
Informe de la varianza de la validación cruzada repetida k-fold
He estado utilizando la validación cruzada repetida de k veces y he estado informando la media (de la métrica de evaluación, por ejemplo, sensibilidad, especificidad) calculada como la gran media en los pliegues de diferentes corridas de la validación cruzada. Sin embargo, no estoy seguro de cómo debo informar la …


1
¿Cuál es la medida de asociación adecuada de una variable con un componente PCA (en un diagrama biplot / carga)?
Estoy usando FactoMineRpara reducir mi conjunto de datos de mediciones a las variables latentes. El mapa de la variable anterior es claro para mí de interpretar, pero estoy confundido cuando se trata de las asociaciones entre las variables y el componente 1. Mirando el mapa variables, ddpy covestá muy cerca …




2
Contrastes polinómicos para regresión
No puedo entender el uso de contrastes polinómicos en el ajuste de regresión. En particular, me refiero a una codificación utilizada por Rpara expresar una variable de intervalo (variable ordinal con niveles igualmente espaciados), descrita en esta página . En el ejemplo de esa página , si entendí correctamente, R …



Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.