Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


5
¿Cómo pueden los principales componentes principales retener el poder predictivo en una variable dependiente (o incluso conducir a mejores predicciones)?
Supongamos que yo estoy corriendo una regresión . ¿Por qué al seleccionar los principales componentes principales de , el modelo conserva su poder predictivo en ?Y∼XY∼XY \sim XkkkXXXYYY Entiendo que desde el punto de vista de reducción de dimensionalidad / selección de características, si son los vectores propios de la …

3
Interpretación de la regularización de crestas en regresión
Tengo varias preguntas sobre la penalización de cresta en el contexto de mínimos cuadrados: βridge=(λID+X′X)−1X′yβridge=(λID+X′X)−1X′y\beta_{ridge} = (\lambda I_D + X'X)^{-1}X'y 1) La expresión sugiere que la matriz de covarianza de X se reduce hacia una matriz diagonal, lo que significa que (suponiendo que las variables estén estandarizadas antes del procedimiento) …





2
Correlación entre estimadores de MCO para intersección y pendiente
En un modelo de regresión simple, y=β0+β1x+ε,y=β0+β1x+ε, y = \beta_0 + \beta_1 x + \varepsilon, los estimadores MCO betaβ^OLS0β^0OLS\hat{\beta}_0^{OLS} y ββ^OLS1β^1OLS\hat{\beta}_1^{OLS} están correlacionados. La fórmula para la correlación entre los dos estimadores es (si la he derivado correctamente): Corr(β^OLS0,β^OLS1)=−∑ni=1xin−−√∑ni=1x2i−−−−−−−√.Corr⁡(β^0OLS,β^1OLS)=−∑i=1nxin∑i=1nxi2. \operatorname{Corr}(\hat{\beta}_0^{OLS},\hat{\beta}_1^{OLS}) = \frac{-\sum_{i=1}^{n}x_i}{\sqrt{n} \sqrt{\sum_{i=1}^{n}x_i^2} }. Preguntas: ¿Cuál es la explicación intuitiva …




5
¿Cómo generar una gran matriz de correlación aleatoria de rango completo con algunas correlaciones fuertes presentes?
Me gustaría generar una matriz de correlación aleatoria CC\mathbf C de tamaño n×nn×nn \times n modo que haya algunas correlaciones moderadamente fuertes presentes: matriz simétrica real cuadrada de tamaño n×nn×nn \times n , con, por ejemplo, n=100n=100n=100 ; positivo-definido, es decir, con todos los valores propios reales y positivos; rango …

1
¿La "estimación de la densidad del núcleo" es una convolución de qué?
Estoy tratando de comprender mejor la estimación de la densidad del kernel. Usando la definición de Wikipedia: https://en.wikipedia.org/wiki/Kernel_density_estimation#Definition fh^(x)=1n∑ni=1Kh(x−xi)=1nh∑ni=1K(x−xih)fh^(x)=1n∑i=1nKh(x−xi)=1nh∑i=1nK(x−xih) \hat{f_h}(x) = \frac{1}{n}\sum_{i=1}^n K_h (x - x_i) \quad = \frac{1}{nh} \sum_{i=1}^n K\Big(\frac{x-x_i}{h}\Big) Tomemos como una función rectangular que da si está entre y y contrario, y (tamaño de la ventana) es …

2
¿Cómo utilizar los resultados de R prcomp para la predicción?
Tengo un data.frame con 800 obs. de 40 variables, y me gustaría utilizar el Análisis de componentes principales para mejorar los resultados de mi predicción (que hasta ahora funciona mejor con Support Vector Machine en unas 15 variables seleccionadas a mano). Entiendo que un prcomp puede ayudarme a mejorar mis …
25 r  pca 

3
LSA vs. PCA (agrupación de documentos)
Estoy investigando varias técnicas utilizadas en la agrupación de documentos y me gustaría aclarar algunas dudas sobre PCA (análisis de componentes principales) y LSA (análisis semántico latente). Lo primero: ¿cuáles son las diferencias entre ellos? Sé que en PCA, la descomposición SVD se aplica a la matriz de covarianza de …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.