Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

5
¿Por qué los regresores irrelevantes se vuelven estadísticamente significativos en muestras grandes?
Estoy tratando de comprender mejor la significación estadística, los tamaños del efecto y similares. Tengo la percepción (tal vez está mal) de que incluso los regresores irrelevantes a menudo se vuelven estadísticamente significativos en muestras grandes . Por irrelevante quiero decir que no hay una explicación del tema por qué …

3
Cómo obtener la función cuantil cuando no se conoce una forma analítica de la distribución
El problema proviene de la página 377-379 de este [0] documento. Dada una distribución continua y una fija , considere:FFFz∈Rz∈Rz\in\mathbb{R} Lz(t)=PF(|z−Z|≤t)Lz(t)=PF(|z−Z|≤t)L_z(t)=P_F(|z-Z|\leq t) y H(z)=L−1z(0.5)=medZ∼F|z−Z|H(z)=Lz−1(0.5)=medZ∼F|z−Z|H(z)=L^{-1}_z(0.5)=\underset{Z\sim F}{\mbox{med}}|z-Z| donde es el inverso continuo correcto. Entonces, para una z fija , esta es la distancia media de todos los Z \ sim F a …

1
Trabajando con la muestra bootstrap vs la muestra original
Considere una muestra de números reales. Digamos que queremos estimar la tendencia central de la población y tener una idea de nuestra incertidumbre en torno a esta estimación. Pongamos a un lado las suposiciones sobre la distribución de la población por un momento, y consideremos los siguientes dos enfoques. Obtenga …

2
Cálculo manual del valor p para la prueba t: cómo evitar valores mayores que
Estos dos métodos para calcular el valor p deberían ser equivalentes: t.test(rats.drug,mu=1.2)$p.value 2*pt((mean(rats.drug)-1.2)*sqrt(n)/sd(rats.drug),df=n-1) El problema con el segundo método es que existe el riesgo de obtener valores mayores que (de hecho, hasta ):111222 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1) [1] 2 Por supuesto, esto puede remediarse 2*pt((1.5-1.2)*sqrt(100)/.5,df=100-1,lower=F) [1] 3.245916e-08 Mi pregunta Obviamente, el algoritmo de …
8 r  t-test  p-value 

2
Visualización y sobreplotting: alternativa a los scatters
Tengo un gran conjunto de datos de países que están llenos (como puede ver a continuación), pero necesito las etiquetas y los valores atípicos: también tengo muchos gráficos, por lo que sería tedioso restablecer la ventana y agregar puntos de datos falsos para los atípicos. ¿Existe una buena alternativa a …


1
Revisión de papel sobre filtro de partículas
Encontré en línea un borrador de un excelente artículo de revisión de Zhe Chen titulado "Filtrado bayesiano: de los filtros de Kalman a los filtros de partículas, y más allá". Según Google Scholar, la cita de la versión publicada es "Estadísticas 182 (1), 1-69, 2003", pero la revista que encuentro …

1
Derivando el algoritmo K-means como límite de Maximización de Expectativas para Mezclas Gaussianas
Christopher Bishop define el valor esperado de la función de probabilidad de registro de datos completos (es decir, suponiendo que se nos dan tanto los datos observables X como los datos latentes Z) de la siguiente manera: EZ[lnp(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){lnπk+lnN(xn∣ μk,Σk)}(1)(1)EZ[ln⁡p(X,Z∣μ,Σ,π)]=∑n=1N∑k=1Kγ(znk){ln⁡πk+ln⁡N(xn∣ μk,Σk)} \mathbb{E}_\textbf{Z}[\ln p(\textbf{X},\textbf{Z} \mid \boldsymbol{\mu}, \boldsymbol{\Sigma}, \boldsymbol{\pi})] = \sum_{n=1}^N \sum_{k=1}^K \gamma(z_{nk})\{\ln …

1
Fórmula de Schuette-Nesbitt
Estaba leyendo el artículo sobre la fórmula de Schuette-Nesbitt , que se describe como "una generalización del principio de inclusión-exclusión" , que tiene versiones combinatorias y probabilísticas. Otro sitio web proporcionó una prueba de eventos dependientes (descarga en pdf) , y encontró un tercero que lo compara con el Teorema …

1
Términos de error vs innovaciones
Noté que a veces llamamos a los términos de error "innovaciones". No entiendo si esto es en situaciones especiales o si estos términos pueden usarse uno para el otro. Entonces, otra pregunta es "¿por qué llamamos a los términos de error" innovaciones "? Gracias

1
¿Cuáles son los temas de investigación más importantes para la tesis doctoral en bioestadística?
He estado pensando en elegir temas de investigación para la tesis doctoral en Bioestadística. Deseo conocer algunos temas importantes de investigación en los últimos años. Hasta donde yo sé, algunos temas de investigación importantes son: Análisis de datos de alta dimensión; inferencia causal en experimentos y estudios observacionales; puntaje de …

3
Convierta la razón de riesgos en odds ratio
En el metanálisis: ¿cómo convertimos las razones de riesgo en algunos estudios en odds ratio? Se deben incluir estudios de casos y controles de cohortes y algunos de ellos informan las razones de riesgo. Los datos sin procesar no se informan para calcular la razón de probabilidades.


2
Distribuciones sesgadas para la regresión logística
He estado desarrollando un modelo de regresión logística basado en datos retrospectivos de una base de datos nacional de traumatismos de lesiones en la cabeza en el Reino Unido. El resultado clave es la mortalidad a los 30 días (indicada como Outcome30medida). Otras medidas en toda la base de datos …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.