Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

2
¿Cómo elegir la capacitación, la validación cruzada y los tamaños de los conjuntos de prueba para datos de tamaño de muestra pequeño?
Suponga que tengo un tamaño de muestra pequeño, por ejemplo, N = 100 y dos clases. ¿Cómo debo elegir la capacitación, la validación cruzada y los tamaños de los conjuntos de prueba para el aprendizaje automático? Yo elegiría intuitivamente Tamaño del set de entrenamiento como 50 Conjunto de validación cruzada …





2
¿Cómo se aproxima la estadística de Chi cuadrado de Pearson a una distribución de Chi cuadrado?
Entonces, si la estadística de Chi cuadrado de Pearson se da para una tabla , entonces su forma es:1×N1×N1 \times N ∑i=1n(Oi−Ei)2Ei∑i=1n(Oi−Ei)2Ei\sum_{i=1}^n\frac{(O_i - E_i)^2}{E_i} Entonces, esto se aproxima a , la Distribución Chi-Cuadrada con grados de libertad, a medida que el tamaño de la muestra aumenta . χ2n−1χn−12\chi_{n-1}^2n−1n−1n-1NNN Lo que …

2
¿Cuál es la estimación de máxima verosimilitud de la covarianza de los datos normales bivariados cuando se conocen la media y la varianza?
Supongamos que tenemos una muestra aleatoria de una distribución normal bivariada que tiene ceros como medias y unos como varianzas, por lo que el único parámetro desconocido es la covarianza. ¿Cuál es el MLE de la covarianza? Sé que debería ser algo así como pero ¿cómo sabemos esto?1norte∑nortej = 1Xjyj1n∑j=1nxjyj\frac{1}{n} …

1
¿Por qué el embolsado utiliza muestras de bootstrap?
El embolsado es el proceso de crear N alumnos en N muestras de bootstrap diferentes, y luego tomar la media de sus predicciones. Mi pregunta es: ¿por qué no usar ningún otro tipo de muestreo? ¿Por qué usar muestras de bootstrap?
10 bagging 


2
Variedad de cuidados para el modelo randomForest
Tengo problemas para entender cómo varImpfunciona la función para un modelo randomForest con el caretpaquete. En el ejemplo a continuación, la característica var3 tiene cero importancia usando la varImpfunción de caret , pero el modelo final randomForest subyacente tiene una importancia distinta de cero para la característica var3. ¿Por qué …
10 r  caret  random-forest 




3
¿Es posible en R (o en general) forzar que los coeficientes de regresión sean un signo determinado?
Estoy trabajando con algunos datos del mundo real y los modelos de regresión están dando algunos resultados contraintuitivos. Normalmente confío en las estadísticas, pero en realidad algunas de estas cosas no pueden ser ciertas. El principal problema que estoy viendo es que un aumento en una variable está causando un …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.