Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

2
Tratar con un buen desempeño en los datos de capacitación y validación, pero muy mal desempeño en los datos de prueba
Tengo un problema de regresión con 5-6k variables. Divido mis datos en 3 conjuntos no superpuestos: capacitación, validación y pruebas. Entreno usando solo el conjunto de entrenamiento y genero muchos modelos de regresión lineal diferentes eligiendo un conjunto diferente de 200 variables para cada modelo (intento aproximadamente 100k de tales …

1
Al hacer inferencias sobre los medios grupales, ¿los intervalos creíbles son sensibles a la variación dentro del sujeto, mientras que los intervalos de confianza no lo son?
Esta es una derivación de esta pregunta: ¿Cómo comparar dos grupos con múltiples mediciones para cada individuo con R? En las respuestas allí (si entendí correctamente) aprendí que la varianza dentro del sujeto no afecta las inferencias hechas sobre las medias grupales y que está bien simplemente tomar los promedios …

2
Comprobando si una densidad es familia exponencial
Tratando de demostrar que esto no pertenece a una familia exponencial. f(y|a)=4(y+a)(1+4a);0&lt;y&lt;1,a&gt;0f(y|a)=4(y+a)(1+4a);0&lt;y&lt;1,a&gt;0f(y|a)=4\frac{(y+a)}{(1+4a)} ; 0 < y < 1 , a>0 Aquí está mi enfoque: f(y|a)=4(y+a)e−log(1+4a)f(y|a)=4(y+a)e−log(1+4a)f(y|a) = 4(y+a)e^{-log(1+4a)} f(y|a)=(4y)(1+ay)e−log(1+4a)f(y|a)=(4y)(1+ay)e−log(1+4a)f(y|a) = (4y)(1+\frac{a}{y})e^{-log(1+4a)} Comparándolo con la forma estándar, h(y)=4yh(y)=4yh(y) = 4y y g(a)g(a)g(a) que tiene que ser una función de solo aaa, no …


4
Regresión de datos que incluye una fecha
Tengo un conjunto de datos que contiene unos cientos de transacciones de tres proveedores que operan en más de 100 países durante un período de tres años. Hemos descubierto que el país de ventas no es un factor significativo en los precios alcanzados (los productos son más o menos productos …





2
Agrupar variables categóricas en glmnet
Considere el siguiente ajuste: fit3a=glmnet(x,g4,family="multinomial",type.multinomial="grouped") ¿Cómo indico qué columnas xson categóricas / multinomiales? ¿Existe una opción para especificar el índice de las variables agrupadas? La documentación describe la opción de la type.multinomialsiguiente manera: Si está "agrupado", se utiliza una penalización de lazo agrupada en los coeficientes multinomiales para una variable. …




2
Programación cuadrática cuando la matriz no es positiva definida
http://cran.r-project.org/web/packages/quadprog/quadprog.pdf El paquete R quadprogparece ser capaz de resolver el problema de programación cuadrática solo cuando la matrizreDD Es positivo definitivo. Sin embargo, hay un caso cuando la matriz reDDNo es positivo definido. como min (X2+y2- 6 x y)sujeto ax + y3 x + yx , y≤≤≥1 ,1.5 ,0.min(x2+y2−6xy)subject tox+y≤1,3x+y≤1.5,x,y≥0.\begin{eqnarray} …
8 r  optimization 

3
Recomendaciones para estadística matemática multivariante con ejercicios
Necesito un libro de texto matemáticamente riguroso y riguroso sobre análisis e inferencia multivariante para mejorarme. He estado leyendo los Elementos del aprendizaje estadístico y resolviendo los problemas internos, pero necesito un libro con otros enfoques. Temas como distribuciones famosas (Wishart, Wilks lambda, etc.), pruebas de hipótesis, algunas teorías sobre …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.