Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

4
Algoritmos de Metropolis-Hastings utilizados en la práctica
Hoy estaba leyendo el blog de Christian Robert y me gustó bastante el nuevo algoritmo Metropolis-Hastings que estaba discutiendo. Parecía simple y fácil de implementar. Cada vez que codifico MCMC, tiendo a mantener algoritmos MH muy básicos, como movimientos independientes o caminatas aleatorias en la escala de registro. ¿Qué algoritmos …

14
Software para una exploración de datos fácil pero robusta
En mis intentos de luchar contra el caos de las hojas de cálculo, a menudo soy evangélico al presionar por herramientas más robustas, como un verdadero software de estadísticas (R, Stata y similares). Recientemente, fui desafiado en esta opinión por alguien que declaró rotundamente que simplemente no aprenderán a programar. …

3
Cómo combinar intervalos de confianza para un componente de varianza de un modelo de efectos mixtos cuando se usa la imputación múltiple
La lógica de la imputación múltiple (MI) es imputar los valores faltantes no una vez sino varias (típicamente M = 5) veces, lo que resulta en M conjuntos de datos completados. Los M conjuntos de datos completados se analizan luego con métodos de datos completos sobre los cuales se combinan …

4
¿Cuál es un límite inferior ajustado en el tiempo de cobro de cupones?
En el problema clásico de Coupon Collector , es bien sabido que el tiempo necesario para completar un conjunto de cupones elegidos al azar satisface , y .TTTnnnE[T]∼nlnnE[T]∼nln⁡nE[T] \sim n \ln n Var(T)∼n2Var(T)∼n2Var(T) \sim n^2Pr(T&gt;nlnn+cn)&lt;e−cPr(T&gt;nln⁡n+cn)&lt;e−c\Pr(T > n \ln n + cn) < e^{-c} Este límite superior es mejor que el …

6
Buen recurso para entender ANOVA y ANCOVA?
Estoy realizando experimentos para un artículo y estoy buscando un libro / sitio web interesante para comprender correctamente cómo funcionan ANOVA y ANCOVA. Tengo buenos conocimientos matemáticos, así que no necesariamente necesito una explicación vulgar. También me gustaría saber cómo determinar cuándo usar ANOVA en lugar de ANCOVA.



6
¿Es correcto mi meteorólogo?
Una pregunta que me molestó por algún tiempo, que no sé cómo abordar: Todos los días, mi meteorólogo da un porcentaje de probabilidad de lluvia (supongamos que se calcula a 9000 dígitos y nunca ha repetido un número). Cada día posterior, llueve o no llueve. Tengo años de datos: posibilidad …

4
¿Cuáles son los valores correctos para precisión y recuperación en casos extremos?
La precisión se define como: p = true positives / (true positives + false positives) ¿Es cierto que, como true positivesy false positivesenfoque 0, la precisión se aproxima a 1? La misma pregunta para recordar: r = true positives / (true positives + false negatives) Actualmente estoy implementando una prueba …
20 precision-recall  data-visualization  logarithm  references  r  networks  data-visualization  standard-deviation  probability  binomial  negative-binomial  r  categorical-data  aggregation  plyr  survival  python  regression  r  t-test  bayesian  logistic  data-transformation  confidence-interval  t-test  interpretation  distributions  data-visualization  pca  genetics  r  finance  maximum  probability  standard-deviation  probability  r  information-theory  references  computational-statistics  computing  references  engineering-statistics  t-test  hypothesis-testing  independence  definition  r  censoring  negative-binomial  poisson-distribution  variance  mixed-model  correlation  intraclass-correlation  aggregation  interpretation  effect-size  hypothesis-testing  goodness-of-fit  normality-assumption  small-sample  distributions  regression  normality-assumption  t-test  anova  confidence-interval  z-statistic  finance  hypothesis-testing  mean  model-selection  information-geometry  bayesian  frequentist  terminology  type-i-and-ii-errors  cross-validation  smoothing  splines  data-transformation  normality-assumption  variance-stabilizing  r  spss  stata  python  correlation  logistic  logit  link-function  regression  predictor  pca  factor-analysis  r  bayesian  maximum-likelihood  mcmc  conditional-probability  statistical-significance  chi-squared  proportion  estimation  error  shrinkage  application  steins-phenomenon 




1
lme () y lmer () dan resultados contradictorios
He estado trabajando con algunos datos que tienen algunos problemas con las mediciones repetidas. Al hacerlo, noté un comportamiento muy diferente entre lme()y lmer()usando mis datos de prueba y quiero saber por qué. El conjunto de datos falsos que creé tiene medidas de altura y peso para 10 sujetos, tomados …

2
¿Existe un estimador imparcial de la distancia de Hellinger entre dos distribuciones?
En un entorno donde se observa distribuido desde una distribución con densidad , me pregunto si hay un estimador imparcial (basado en 's) de la distancia de Hellinger a otra distribución con densidad , a saber, X1,…,XnX1,…,XnX_1,\ldots,X_nfffXiXiX_if0f0f_0H(f,f0)={1−∫Xf(x)f0(x)−−−−−−−−√dx}1/2.H(f,f0)={1−∫Xf(x)f0(x)dx}1/2. \mathfrak{H}(f,f_0) = \left\{ 1 - \int_\mathcal{X} \sqrt{f(x)f_0(x)} \text{d}x \right\}^{1/2}\,.

4
¿Se ajusta un modelo a los datos o se ajustan los datos a un modelo?
¿Existe una diferencia conceptual o de procedimiento entre ajustar un modelo a datos y ajustar datos a modelos? Se puede ver un ejemplo de la primera redacción en https://courses.washington.edu/matlab1/ModelFitting.html , y de la segunda en https://reference.wolfram.com/applications/eda/FittingDataToLinearModelsByLeast-SquaresTechniques.html .

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.