Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

1
Análisis discriminante lineal para
Estoy estudiando 'Introducción al aprendizaje estadístico' de James, Witten, Hastie, Tibshirani. En la página 139 de su libro, comenzaron introduciendo el Teorema de Bayes . no es una constante matemática, pero denota la probabilidad previa. Nada es extraño en esta ecuación.pk(X)=P(Y=k|X=x)=πkfk(x)∑kl=1πlfl(x)pk(X)=P(Y=k|X=x)=πkfk(x)∑l=1kπlfl(x)p_k(X)=P(Y=k|X=x) = \dfrac{\pi_kf_k(x)}{\sum_{l=1}^k \pi_l f_l(x)}ππ\pi El libro afirma que quiere …

1
Rango de lambda en regresión neta elástica
\def\l{|\!|} Dada la regresión neta elástica minb12||y−Xb||2+αλ||b||22+(1−α)λ||b||1minb12||y−Xb||2+αλ||b||22+(1−α)λ||b||1\min_b \frac{1}{2}\l y - Xb \l^2 + \alpha\lambda \l b\l_2^2 + (1 - \alpha) \lambda \l b\l_1 ¿Cómo se puede elegir un rango apropiado de λλ\lambda para la validación cruzada? En el caso α=1α=1\alpha=1 (regresión de cresta) la fórmula dof=∑js2js2j+λdof=∑jsj2sj2+λ\textrm{dof} = \sum_j \frac{s_j^2}{s_j^2+\lambda} se …



2
¿Qué es mejor, reemplazo por medio y reemplazo por mediana?
Estoy haciendo un proyecto que implica reemplazar los valores faltantes en un conjunto de datos (la primera vez que lo hago). Esto implica el uso de dos métodos replacement by meany replacement by mediancompletar los valores faltantes. No hay mucha diferencia entre los resultados de la desviación mínima, mediana, máxima, …


1
Simular a partir de una mezcla truncada distribución normal
Quiero simular una muestra de una mezcla de distribución normal de manera que p × N(μ1,σ21) + ( 1 - p ) × N(μ2,σ22)p×N(μ1,σ12)+(1−p)×N(μ2,σ22)p\times\mathcal{N}(\mu_1,\sigma_1^2) + (1-p)\times\mathcal{N}(\mu_2,\sigma_2^2) está restringido al intervalo [ 0 , 1 ][0,1][0,1] en vez de RR\mathbb{R}. Esto significa que quiero simular una mezcla truncada de distribuciones normales. …

1
Estimaciones de efectos aleatorios en modelo binomial (lme4)
Estoy simulando ensayos de Bernoulli con un entre grupos y luego el modelo correspondiente con el paquete:logitθ ∼ N( logitθ0 0,12)logitθ∼norte(logitθ0 0,12)\text{logit}\, \theta \sim {\cal N}(\text{logit}\, \theta_0, 1^2)lme4 library(lme4) library(data.table) I <- 30 # number of groups J <- 10 # number of Bernoulli trials within each group logit <- …


2
Interpretación de la trama ACF y PACF
Mis datos en bruto consisten en una serie temporal de 60 días con una tendencia a la baja. Los datos son semanales, por lo que la frecuencia se establece en 7. Calculé la diferencia de los datos que se ve así Cuando ejecuto gráficos ACF y PACF en la diferencia, …




4
¿Cómo se verifica la causalidad?
Después de haber demostrado que dos cantidades están correlacionadas, ¿cómo inferimos que la relación es causal? ¿Y además cuál causa qué? Ahora, en teoría, se puede usar una "asignación aleatoria" (cualquiera que sea la palabra correcta), para romper cualquier vínculo accidental que pueda existir entre dos variables. Pero en algunos …

2
Seleccionar nudos para un GAM
Al seleccionar un número apropiado de nudos para un GAM, uno puede tener en cuenta el número de datos e incrementos en el eje x. ¿Qué pasa si tenemos 100 incrementos en el eje x con 1000 puntos de datos en cada incremento? La información aquí dice: Si no se …
9 r  gam  splines 

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.