Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.





2
¿Cuál es la ventaja de reducir la dimensionalidad de los predictores para propósitos de regresión?
¿Cuáles son las aplicaciones o ventajas de las técnicas de regresión de reducción de dimensiones (DRR) o de reducción supervisada de dimensionalidad (SDR) sobre las técnicas de regresión tradicionales (sin ninguna reducción de dimensionalidad)? Esta clase de técnicas encuentra una representación de baja dimensión del conjunto de características para el …

5
¿Buenos libros sobre minería de texto?
Hola, ¿quería saber si hay algunos buenos libros sobre minería de texto y clasificación con algunos estudios de casos? Si no, algunos artículos / revistas accesibles al público lo harían. Si ilustran sus ejemplos con R aún mejor. No busco el manual paso a paso, sino algo que ilustre los …

4
¿Intenta calcular el índice de Gini en la distribución de reputación de StackOverflow?
Estoy tratando de calcular el índice de Gini en la distribución de reputación SO usando SO Data Explorer. La ecuación que intento implementar es la siguiente: Donde: = número de usuarios en el sitio; = ID de serie del usuario (1 - 1,225,000); = reputación del usuario .nG(S)=1n−1(n+1−2(∑ni=1(n+1−i)yi∑ni=1yi))G(S)=1n−1(n+1−2(∑i=1n(n+1−i)yi∑i=1nyi)) G(S)=\frac{1}{n-1}\left(n+1-2\left(\frac{\sum^n_{i=1}(n+1-i)y_i}{\sum^n_{i=1}y_i}\right)\right) nnniiiyiyiy_iiii …
11 gini 

1
¿Puedo asumir (log-) normalidad para esta muestra?
Aquí hay un gráfico QQ para mi muestra (observe el eje Y logarítmico); :n = 1000n=1000n = 1000 Como señaló Whuber, esto indica que la distribución subyacente está sesgada hacia la izquierda (la cola derecha es más corta). Utilizando shapiro.test(sobre los datos transformados logarítmicamente) en R, tengo una prueba estadística …

1
¿Cómo fijar un coeficiente en una regresión logística ordinal sin suposición de probabilidades proporcionales en R?
Quiero hacer una regresión logística ordinal en R sin el supuesto de proporcionalidad. Sé que esto se puede hacer directamente usando la vglm()función Rconfigurando parallel=FALSE. Pero mi problema es cómo solucionar un conjunto particular de coeficientes en esta configuración de regresión. Por ejemplo, supongamos que la variable dependiente es discreta …
11 r  regression  logistic 


1
Residuos de Schoenfeld
En un modelo de riesgos proporcionales de Cox con muchas variables, si los residuos de Schoenfeld no son planos para una de las variables, ¿esto invalida todo el modelo o solo se puede ignorar la variable de bajo rendimiento? Es decir, interprete los coeficientes para las otras variables, pero no …

2
Parámetro de dispersión en salida GLM
He ejecutado un glm en R, y cerca de la parte inferior de la summary()salida, dice (Dispersion parameter for gaussian family taken to be 28.35031) Hice algunas búsquedas en Google y aprendí que el parámetro de dispersión se usa para ajustarse a los errores estándar. Espero que alguien pueda proporcionar …

2
Introducción a la probabilidad aplicada para matemáticos puros?
Tengo experiencia en matemática pura (teoría de medidas, análisis funcional, álgebra de operadores, etc.). También tengo un trabajo que requiere cierto conocimiento de la teoría de la probabilidad (desde principios básicos hasta técnicas de aprendizaje automático). Mi pregunta: ¿Alguien puede proporcionar alguna lectura canónica y materiales de referencia que: Introducción …

1
¿Ridge y LASSO tienen una estructura de covarianza?
Después de leer el Capítulo 3 en los Elementos del aprendizaje estadístico (Hastie, Tibshrani y Friedman), me preguntaba si era posible implementar los famosos métodos de contracción citados en el título de esta pregunta dada una estructura de covarianza, es decir, minimizar el (quizás más general ) cantidad ( y⃗ …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.