Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.








5
Recomendaciones de color y grosor de línea para gráficos de líneas
Mucho se ha escrito sobre las opciones de color amigables para los daltónicos para mapas, polígonos y regiones sombreadas en general (ver, por ejemplo, http://colorbrewer2.org ). No he podido encontrar recomendaciones para colores de línea y grosores de línea variables para gráficos de líneas. Los objetivos son: distinguir líneas fácilmente …

5
Detectando predictores significativos de muchas variables independientes
En un conjunto de datos de dos poblaciones no superpuestas (pacientes y sanos, total n = 60n=60n=60 ), me gustaría encontrar (de 300300300 variables independientes) predictores significativos para una variable dependiente continua. La correlación entre predictores está presente. Estoy interesado en averiguar si alguno de los predictores está relacionado con …


8
Reemplazar valores atípicos con media
Esta pregunta fue hecha por mi amigo que no conoce Internet. No tengo antecedentes en estadísticas y he estado buscando en internet esta pregunta. La pregunta es: ¿es posible reemplazar los valores atípicos con valor medio? si es posible, ¿hay alguna referencia de libro / revistas para respaldar esta declaración?

1
Reducción de dimensionalidad (SVD o PCA) en una matriz grande y dispersa
/ edit: Seguimiento adicional ahora puedes usar irlba :: prcomp_irlba / edit: siguiendo mi propio post. irlbaahora tiene argumentos de "centro" y "escala", que le permiten usarlo para calcular componentes principales, por ejemplo: pc <- M %*% irlba(M, nv=5, nu=0, center=colMeans(M), right_only=TRUE)$v Tengo una gran variedad Matrixde características que me …


3
¿Por qué es necesaria la selección de variables?
Los procedimientos comunes de selección de variables basadas en datos (por ejemplo, hacia adelante, hacia atrás, paso a paso, todos los subconjuntos) tienden a generar modelos con propiedades indeseables, que incluyen: Coeficientes sesgados lejos de cero. Errores estándar que son demasiado pequeños e intervalos de confianza que son demasiado estrechos. …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.