Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

2
Historia: el papel de la estadística en astronomía
Recientemente reclamé con valentía frente a un grupo de estudiantes de octavo grado bastante inteligentes que la astronomía contribuyó en gran medida a los fundamentos de las estadísticas y muchos conceptos estadísticos fueron inventados para su uso en astronomía. Sin embargo, buscando respaldar eso, estaba bastante decepcionado. Los errores, la …

1
¿Cuál es el CDF de dos muestras de
Estoy tratando de entender cómo obtener los valores para la prueba unilateral de Kolmogorov-Smirnov , y estoy luchando por encontrar CDF para y en el caso de dos muestras. Lo siguiente se cita en algunos lugares como el CDF para en un caso de una muestra:pppD+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}}D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}}D+nDn+D^{+}_{n} p+n(x)=P(D+n≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jpn+(x)=P(Dn+≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jp^{+}_{n}\left(x\right) = \text{P}\left(D^{+}_{n} \ge …

2
¿Por qué es válida una correlación de rangos de Pearson a pesar de la suposición de normalidad?
Actualmente estoy leyendo sobre suposiciones para las correlaciones de Pearson. Una suposición importante para la prueba t resultante parece ser que ambas variables provienen de distribuciones normales; si no lo hacen, se recomienda el uso de medidas alternativas como el Spearman rho. La correlación de Spearman se calcula como la …



1
Sobremuestreo con variables categóricas
Me gustaría realizar una combinación de sobremuestreo y submuestreo para equilibrar mi conjunto de datos con aproximadamente 4000 clientes divididos en dos grupos, donde uno de los grupos tiene una proporción de aproximadamente el 15%. He examinado SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) y ROSE ( http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf ), pero ambos crean …


1
¿Cuál es la relación entre las medidas de confiabilidad de la escala (alfa de Cronbach, etc.) y las cargas de componentes / factores?
Digamos que tengo un conjunto de datos con puntajes en un montón de ítems del cuestionario, que en teoría están compuestos por un número menor de escalas, como en la investigación de psicología. Sé que un enfoque común aquí es verificar la confiabilidad de las escalas utilizando el alfa de …


1
prueba anova tipo III para un GLMM
Estoy ajustando un glmermodelo en el lme4paquete R. Estoy buscando una tabla anova con el valor p que se muestra allí, pero no puedo encontrar ningún paquete que se ajuste a ella. ¿Es posible hacerlo en R? El modelo que estoy ajustando es de la forma: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four …

1
¿Poder en proteómica?
Las subvenciones a menudo requieren un análisis de potencia para admitir un tamaño de muestra propuesto. En proteómica (y la mayoría de los ómics), hay de 100 a 1000 de características / variables medidas en 10 de las muestras (tal vez 100, pero poco probable). Además, se sabe que algunas …





Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.