Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

2
k-significa vs k-mediana?
Sé que hay un algoritmo de agrupación k-means y una mediana k. Uno que usa la media como el centro del grupo y el otro usa la mediana. Mi pregunta es: ¿cuándo / dónde usar cuál?


1
Bandas de confianza para la línea QQ
Esta pregunta no pertenece específicamente R, pero elegí usarla Rpara ilustrarla. Considere el código para producir bandas de confianza alrededor de una línea qq (normal): library(car) library(MASS) b0<-lm(deaths~.,data=road) qqPlot(b0$resid,pch=16,line="robust") Estoy buscando una explicación de (o un enlace alternativo a un documento en papel / en línea que explique) cómo se …

3
¿Los coeficientes de regresión logística tienen sentido?
Tengo un problema de clasificación binaria de varias características. ¿Los coeficientes de una regresión logística (regularizada) tienen un significado interpretable? Pensé que podrían indicar el tamaño de la influencia, dado que las características se normalizan de antemano. Sin embargo, en mi problema, los coeficientes parecen depender sensiblemente de las características …



1
¿Cómo se le ocurrió a Karl Pearson la estadística de chi-cuadrado?
¿Cómo llegó Pearson con las siguientes estadísticas chi-cuadrado de Pearson en 1900? que K∼χ2K=∑(Oij−Eij)2EijK=∑(Oij−Eij)2Eij K = \sum \frac{(O_{ij} -E_{ij})^2}{E_{ij}} K∼χ2K∼χ2 K \sim \chi^2 ¿Tenía en mente chi cuadrado e ideó la métrica (enfoque de abajo hacia arriba), o ideó la estadística y luego demostró que sigue la distribución de chi …


1
Clasificadores de aprendizaje automático big-O o complejidad
Para evaluar el rendimiento de un nuevo algoritmo clasificador, estoy tratando de comparar la precisión y la complejidad (big-O en entrenamiento y clasificación). De Machine Learning: una revisión obtengo una lista completa de clasificadores supervisados, también una tabla de precisión entre los algoritmos y 44 problemas de prueba del repositorio …

3
¿Cómo calcular la superposición entre densidades de probabilidad empírica?
Estoy buscando un método para calcular el área de superposición entre dos estimaciones de densidad del núcleo en R, como una medida de similitud entre dos muestras. Para aclarar, en el siguiente ejemplo, necesitaría cuantificar el área de la región superpuesta púrpura: library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), …






Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.