Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

1
Encontrar valores atípicos en un diagrama de dispersión
Tengo un conjunto de puntos de datos que se supone que se sientan en un lugar y siguen un patrón, pero hay algunos puntos de dispersión del lugar principal que causan incertidumbre en mi análisis final. Me gustaría obtener un lugar limpio para aplicarlo más tarde para mi análisis. Los …


1
Comparación de residuos entre regresiones OLS y no OLS
Suponga que desea estimar un modelo lineal: ( observaciones de la respuesta y predictores ) nortenortenp + 1pags+1p+1E (yyo) =β0 0+∑j = 1pagsβjXyo jmi(yyo)=β0 0+∑j=1pagsβjXyoj\mathbb{E}(y_i) = \beta_0 + \sum_{j=1}^p \beta_j x_{ij} Una forma de hacerlo es a través de la solución OLS, es decir, elegir los coeficientes para que la …




1
Cuantificación de cuánto "más correlación" contiene una matriz de correlación A en comparación con una matriz de correlación B
Tengo 2 matrices de correlación UNAUNAA y sisiB(utilizando el coeficiente de correlación lineal de Pearson a través de corrcoef de Matlab () ). Me gustaría cuantificar cuánto "más correlación"UNAUNAA contiene en comparación con sisiB. ¿Hay alguna medida estándar o prueba para eso? Por ejemplo, la matriz de correlación contiene "más …


1
Teoría del valor extremo: parámetros de GEV logarítmicos normales
La distribución logarítmica pertenece al dominio de atracción máximo de Gumbel , donde: FlogN(x;μ,σ)=Φ(lnx−μσ)FlogN(x;μ,σ)=Φ(ln⁡x−μσ)F^{logN}(x; \mu,\sigma)=\Phi\left(\frac{\ln x - \mu}{\sigma}\right) , FGum(x;μ,β)=e−exp(−x−μβ)FGum(x;μ,β)=e−exp⁡(−x−μβ)F^{Gum}(x;\mu,\beta) = e^{-\exp\left({-\frac{x-\mu}{\beta}}\right)} Mi pregunta : ¿tenemos y ?μ=μμ=μ\mu=\muσ=βσ=β\sigma=\beta La distribución Generalized Extreme Value también usa la notación (Gumbel es el caso límite ), y comparar los CDF para Standard-Lognormal y …

2
¿Cómo preparar interacciones de variables categóricas en scikit-learn?
¿Cuál es la mejor manera de preparar interacciones de características categóricas antes de ajustar con scikit-learn? Con statsmodelspodría decir convenientemente en estilo R smf.ols(formula = 'depvar ~ C(var1)*C(var2)', data=df).fit()(lo mismo en Stata con regress depvar i.var1##i.var2). ¿Puede sklearn.preprocessing.PolynomialFeatures(en v0.15, actualmente dev) usarse con variables categóricas?


1
Residuos en regresión de Poisson
Zuur 2013 Beginners Guide to GLM & GLMM sugiere validar una regresión de Poisson trazando los residuos de Pearson contra los valores ajustados. Zuur afirma que no deberíamos ver los residuos desplegándose a medida que aumentan los valores ajustados, como el gráfico adjunto (dibujado a mano). Pero pensé que una …


2
¿Regresión múltiple en estadística direccional / circular?
Estoy tratando de desarrollar un modelo predictivo para una variable dependiente angular (en [ 0 , 2 π] )[0 0,2π])[0,2\pi]) utilizando varias mediciones independientes, también variables angulares, en [ 0 , 2 π][0 0,2π][0,2\pi]- Como predictores. Cada predictor está significativamente pero no extremadamente fuertemente correlacionado con la variable dependiente. ¿Cómo …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.