Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


8
Errores en el análisis de series de tiempo
Estoy empezando el autoaprendizaje en el análisis de series de tiempo. He notado que hay una serie de posibles dificultades que no son aplicables a las estadísticas generales. Entonces, basándose en ¿Cuáles son los pecados estadísticos comunes? , Me gustaría preguntar: ¿Cuáles son las dificultades comunes o los pecados estadísticos …

2
Intuición detrás de por qué la paradoja de Stein solo se aplica en dimensiones
El ejemplo de Stein muestra que la estimación de máxima verosimilitud de nnn variables normalmente distribuidas con medias μ1,…,μnμ1,…,μn\mu_1,\ldots,\mu_n varianzas 111 es inadmisible (bajo una función de pérdida cuadrada) si f n≥3n≥3n\ge 3 . Para una prueba clara, vea el primer capítulo de Inferencia a gran escala: Métodos empíricos de …


5
¿Cómo calcular pseudo- partir de la regresión logística de R?
El artículo de Christopher Manning sobre regresión logística en R muestra una regresión logística en R de la siguiente manera: ced.logr <- glm(ced.del ~ cat + follows + factor(class), family=binomial) Alguna salida: > summary(ced.logr) Call: glm(formula = ced.del ~ cat + follows + factor(class), family = binomial("logit")) Deviance Residuals: Min …




1
KL divergencia entre dos gaussianos multivariados
Tengo problemas para derivar la fórmula de divergencia KL suponiendo dos distribuciones normales multivariadas. He hecho el caso univariado con bastante facilidad. Sin embargo, ha pasado bastante tiempo desde que tomé las estadísticas de matemáticas, por lo que tengo algunos problemas para extenderlo al caso multivariante. Estoy seguro de que …





3
Interpretación del logaritmo transformador predictor y / o respuesta
Me pregunto si hace una diferencia en la interpretación si solo el dependiente, tanto el dependiente como el independiente, o solo las variables independientes se transforman logarítmicamente. Considere el caso de log(DV) = Intercept + B1*IV + Error Puedo interpretar el IV como el porcentaje de aumento, pero ¿cómo cambia …
46 regression  data-transformation  interpretation  regression-coefficients  logarithm  r  dataset  stata  hypothesis-testing  contingency-tables  hypothesis-testing  statistical-significance  standard-deviation  unbiased-estimator  t-distribution  r  functional-data-analysis  maximum-likelihood  bootstrap  regression  change-point  regression  sas  hypothesis-testing  bayesian  randomness  predictive-models  nonparametric  terminology  parametric  correlation  effect-size  loess  mean  pdf  quantile-function  bioinformatics  regression  terminology  r-squared  pdf  maximum  multivariate-analysis  references  data-visualization  r  pca  r  mixed-model  lme4-nlme  distributions  probability  bayesian  prior  anova  chi-squared  binomial  generalized-linear-model  anova  repeated-measures  t-test  post-hoc  clustering  variance  probability  hypothesis-testing  references  binomial  profile-likelihood  self-study  excel  data-transformation  skewness  distributions  statistical-significance  econometrics  spatial  r  regression  anova  spss  linear-model 

3
¿De dónde viene la idea errónea de que Y debe distribuirse normalmente?
Fuentes aparentemente de buena reputación afirman que la variable dependiente debe distribuirse normalmente: Suposiciones del modelo: YYY se distribuye normalmente, los errores se distribuyen normalmente, ei∼N(0,σ2)ei∼N(0,σ2)e_i \sim N(0,\sigma^2) , e independiente, y XXX es fijo, y la varianza constante σ2σ2\sigma^2 . Penn State, STAT 504 Análisis de datos discretos En …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.