Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


2
Combinando información de múltiples estudios para estimar la media y la varianza de los datos distribuidos normalmente: enfoques bayesianos versus metaanalíticos
He revisado un conjunto de documentos, cada uno informando la media observada y la DE de una medida de en su muestra respectiva de tamaño conocido, . Quiero hacer la mejor suposición posible sobre la distribución probable de la misma medida en un nuevo estudio que estoy diseñando, y cuánta …



5
Bosque aleatorio vs regresión
Ejecuté un modelo de regresión OLS en un conjunto de datos con 5 variables independientes. Las variables independientes y la variable dependiente son continuas y están relacionadas linealmente. El cuadrado R es de aproximadamente 99.3%. Pero cuando ejecuto lo mismo usando un bosque aleatorio en R, mi resultado es '% …


6
¿Cuál es la diferencia entre estadística descriptiva e inferencial?
Comprendí que las estadísticas descriptivas describían cuantitativamente las características de una muestra de datos, mientras que las estadísticas inferenciales hacían inferencias sobre las poblaciones de las que se extrajeron las muestras. Sin embargo, la página de wikipedia para estados de inferencia estadística : En su mayor parte, la inferencia estadística …



1
Detección de valores atípicos en los datos de conteo
Tengo lo que ingenuamente pensé que era un problema bastante sencillo que implica la detección de valores atípicos para muchos conjuntos diferentes de datos de conteo. Específicamente, quiero determinar si uno o más valores en una serie de datos de conteo son más altos o más bajos de lo esperado …

4
Imputación múltiple y selección de modelos.
La imputación múltiple es bastante sencilla cuando tiene un modelo lineal a priori que desea estimar. Sin embargo, las cosas parecen ser un poco más complicadas cuando realmente desea hacer una selección de modelo (por ejemplo, encontrar el "mejor" conjunto de variables predictoras de un conjunto más grande de variables …

1
¿Cuáles son algunas mejoras bien conocidas sobre los algoritmos MCMC de libros de texto que las personas usan para la inferencia bayesiana?
Cuando estoy codificando una simulación de Monte Carlo para algún problema, y ​​el modelo es lo suficientemente simple, uso un libro de texto muy básico de muestreo de Gibbs. Cuando no es posible usar el muestreo de Gibbs, codifico el libro de texto Metropolis-Hastings que aprendí hace años. El único …




Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.