Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.



1
Trazar una línea de regresión por partes
¿Hay alguna manera de trazar la línea de regresión de un modelo por partes como este, que no sea usar linespara trazar cada segmento por separado o usar geom_smooth(aes(group=Ind), method="lm", fill=FALSE)? m.sqft <- mean(sqft) model <- lm(price~sqft+I((sqft-m.sqft)*Ind)) # sqft, price: continuous variables, Ind: if sqft>mean(sqft) then 1 else 0 plot(sqft,price) …

2
¿Buen texto para remuestreo?
¿Puede el grupo recomendar un buen texto / recurso de introducción a las técnicas de remuestreo aplicadas? Específicamente, estoy interesado en alternativas a las pruebas paramétricas clásicas (p. Ej., Pruebas t, ANOVA, ANCOVA) para comparar grupos cuando se violan claramente supuestos como la normalidad. Un tipo de problema de ejemplo …


2
¿Qué método de kernel da las mejores salidas de probabilidad?
Recientemente he usado la escala de Platt de salidas SVM para estimar las probabilidades de eventos predeterminados. Las alternativas más directas parecen ser la "Regresión logística del núcleo" (KLR) y la "Máquina de vectores de importación" relacionada. ¿Alguien puede decir qué método de kernel que da resultados de probabilidad es …

4
¿Cómo puedo estimar la densidad de un parámetro inflado a cero en R?
Tengo un conjunto de datos con muchos ceros que se ve así: set.seed(1) x <- c(rlnorm(100),rep(0,50)) hist(x,probability=TRUE,breaks = 25) Me gustaría dibujar una línea para su densidad, pero la density()función usa una ventana móvil que calcula valores negativos de x. lines(density(x), col = 'grey') Hay density(... from, to)argumentos, pero estos …
10 r  probability  kde 

3
Estimación del modelo exponencial.
Un modelo exponencial es un modelo descrito por la siguiente ecuación: yyo^= β0 0⋅ eβ1X1 i+ … + ΒkXk iyi^=β0⋅eβ1x1i+…+βkxki\hat{y_{i}}=\beta_{0}\cdot e^{\beta_{1}x_{1i}+\ldots+\beta_{k}x_{ki}} El enfoque más común utilizado para estimar dicho modelo es la linealización, que se puede hacer fácilmente calculando logaritmos de ambos lados. ¿Cuáles son los otros enfoques? Estoy especialmente …

5
Generar valores multivariados aleatorios a partir de datos empíricos.
Estoy trabajando en una función de Monte Carlo para valorar varios activos con rendimientos parcialmente correlacionados. Actualmente, acabo de generar una matriz de covarianza y alimentar la rmvnorm()función en R. (Genera valores aleatorios correlacionados). Sin embargo, al observar las distribuciones de los rendimientos de un activo, normalmente no se distribuye. …
10 mcmc  monte-carlo  pdf 

2
¿Cómo calcular los intervalos de confianza en los coeficientes de regresión en PLS?
El modelo subyacente de PLS es que un determinado matriz y vector están relacionadas por donde es un latente de la matriz, y son términos de ruido (suponiendo que están centrados).n×mn×mn \times mXXXnnnyyyX=TP′+E,X=TP′+E,X = T P' + E, y=Tq′+f,y=Tq′+f,y = T q' + f,TTTn×kn×kn \times kE,fE,fE, fX,yX,yX, y PLS produce …


1
En R, ¿"glmnet" se ajusta a una intersección?
Estoy ajustando un modelo lineal en R usando glmnet. El modelo original (no regularizado) se ajustó utilizando lmy no tenía un término constante (es decir, tenía la forma lm(y~0+x1+x2,data)). glmnettoma una matriz de predictores y un vector de respuestas. He estado leyendo glmnetdocumentación y no encuentro mención del término constante. …
10 r  regression  lasso 


1
Diferencia entre GLS y SUR
He estado leyendo algunos sobre Mínimos cuadrados generalizados (GLS) y tratando de relacionarlo con mi fondo econométrico básico. Recuerdo que en la escuela de posgrado usé Regresión aparentemente no relacionada (SUR) que parece algo similar a GLS. Un artículo con el que me topé incluso se refirió al SUR como …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.