Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


3
Cómo derivar la matriz de coeficientes de varianza-covarianza en regresión lineal
Estoy leyendo un libro sobre regresión lineal y tengo algunos problemas para comprender la matriz de varianza-covarianza de bb\mathbf{b} : Los elementos diagonales son bastante fáciles, pero los no diagonales son un poco más difíciles, lo que me desconcierta es que σ(b0,b1)=E(b0b1)−E(b0)E(b1)=E(b0b1)−β0β1σ(b0,b1)=E(b0b1)−E(b0)E(b1)=E(b0b1)−β0β1 \sigma(b_0, b_1) = E(b_0 b_1) - E(b_0)E(b_1) = …
36 regression 



3
Interpretación del valor p en la prueba de hipótesis
Recientemente me encontré con el artículo "La insignificancia de las pruebas de significación de hipótesis nulas", Jeff Gill (1999) . El autor planteó algunas ideas falsas comunes con respecto a la prueba de hipótesis y los valores p, sobre los cuales tengo dos preguntas específicas: El valor p es técnicamente …


4
Donde hace
Una versión muy simple del teorema limitado central como se muestra a continuación que es Lindeberg – Lévy CLT. No entiendo por qué hay un en el lado izquierdo. Y Lyapunov CLT dice pero por qué no ? ¿Alguien me diría cuáles son estos factores, como y ? ¿Cómo los …


6
¿Por qué "explicar" tiene sentido intuitivo?
Recientemente aprendí sobre un principio de razonamiento probabilístico llamado " explicar lejos ", y estoy tratando de captar una intuición para ello. Déjame configurar un escenario. Sea AAA el evento de que ocurra un terremoto. Que el evento BBB sea ​​el evento de que el gigante verde alegre pasee por …


5
Levante la medida en minería de datos
¿Busqué en muchos sitios web para saber qué hará exactamente el ascensor? Los resultados que encontré fueron sobre usarlo en aplicaciones, no en sí mismo. Sé sobre la función de soporte y confianza. Desde Wikipedia, en la minería de datos, el levantamiento es una medida del rendimiento de un modelo …

2
¿Cuál es la distribución de la suma de las variantes gaussianas no iid?
Si XXX se distribuye N(μX,σ2X)N(μX,σX2)N(\mu_X, \sigma^2_X) , YYY se distribuye y , sé que se distribuye si X e Y son independientes.N(μY,σ2Y)N(μY,σY2)N(\mu_Y, \sigma^2_Y)Z=X+YZ=X+YZ = X + YZZZN(μX+μY,σ2X+σ2Y)N(μX+μY,σX2+σY2)N(\mu_X + \mu_Y, \sigma^2_X + \sigma^2_Y) Pero, ¿qué pasaría si X e Y no fueran independientes, es decir (X,Y)≈N((μXμY),(σ2XσX,YσX,Yσ2Y))(X,Y)≈N((μXμY),(σX2σX,YσX,YσY2))(X, Y) \approx N\big( (\begin{smallmatrix} \mu_X\\\mu_Y …



5
Funciones de temporización en R [cerrado]
Me gustaría medir el tiempo que lleva repetir la ejecución de una función. ¿Son replicate()y usan for-loops equivalentes? Por ejemplo: system.time(replicate(1000, f())); system.time(for(i in 1:1000){f()}); Cuál es el método preferido. En la salida de system.time(), ¿es sys+userel tiempo real de CPU para ejecutar el programa? ¿Es elapseduna buena medida del …
36 r 

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.