Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

1
Residuos de desviación de Pearson VS en regresión logística
Sé que los Residuos de Pearson estandarizados se obtienen de una manera probabilística tradicional: ri=yi−πiπi(1−πi)−−−−−−−−√ri=yi−πiπi(1−πi) r_i = \frac{y_i-\pi_i}{\sqrt{\pi_i(1-\pi_i)}} y los residuos de desviación se obtienen de una manera más estadística (la contribución de cada punto a la probabilidad): di=si−2[yilogπi^+(1−yi)log(1−πi)]−−−−−−−−−−−−−−−−−−−−−−−−−−√di=si−2[yilog⁡πi^+(1−yi)log⁡(1−πi)] d_i = s_i \sqrt{-2[y_i \log \hat{\pi_i} + (1 - y_i)\log(1-\pi_i)]} donde …

3
Modelos de dos etapas: diferencia entre los modelos de Heckman (para tratar con la selección de muestras) y las variables instrumentales (para tratar con la endogenidad)
Estoy tratando de entender la diferencia entre la selección de muestras y la endogeneidad y, a su vez, cómo los modelos de Heckman (para tratar con la selección de muestras) difieren de las regresiones de variables instrumentales (para tratar con la endogeneidad). ¿Es correcto decir que la selección de muestra …

2
¿Por qué ρ de Pearson es solo una medida exhaustiva de asociación si la distribución conjunta es multivariada normal?
Esta afirmación se planteó en la respuesta principal a esta pregunta . Creo que la pregunta del "por qué" es lo suficientemente diferente como para justificar un nuevo hilo. Buscar en Google "medida exhaustiva de asociación" no produjo ningún éxito, y no estoy seguro de lo que significa esa frase.

2
¿Por qué transformar los datos antes de realizar el análisis de componentes principales?
Estoy siguiendo un tutorial aquí: http://www.r-bloggers.com/computing-and-visualizing-pca-in-r/ para obtener una mejor comprensión de PCA. El tutorial utiliza el conjunto de datos Iris y aplica una transformación de registro antes de PCA: Observe que en el siguiente código aplicamos una transformación logarítmica a las variables continuas según lo sugerido por [1] y …

4
¿Malentendido un valor P?
Así que he estado leyendo mucho sobre cómo interpretar correctamente un valor P, y de lo que he leído, el valor p no dice NADA sobre la probabilidad de que la hipótesis nula sea verdadera o falsa. Sin embargo, al leer la siguiente declaración: El valor p representa la probabilidad …

3
¿Por qué necesitamos Bootstrapping?
Actualmente estoy leyendo "Todas las estadísticas" de Larry Wasserman y estoy desconcertado por algo que escribió en el capítulo sobre la estimación de funciones estadísticas de modelos no paramétricos. El escribio "A veces podemos encontrar el error estándar estimado de una función estadística haciendo algunos cálculos. Sin embargo, en otros …

1
Integración de Metropolis-Hastings: ¿por qué no funciona mi estrategia?
Suponga que tengo una función g(x)g(x)g(x) que deseo integrar ∫∞−∞g(x)dx.∫−∞∞g(x)dx. \int_{-\infty}^\infty g(x) dx. Por supuesto, suponiendo que g(x)g(x)g(x) va a cero en los puntos finales, sin ampliaciones, buena función. Una forma con la que he estado jugando es usar el algoritmo Metropolis-Hastings para generar una lista de muestras x1,x2,…,xnx1,x2,…,xnx_1, x_2, …

3
tanh vs. sigmoide en la red neuronal
Pido disculpas de antemano por el hecho de que todavía estoy avanzando en esto. Estoy tratando de entender los pros y los contras de usar tanh (mapa -1 a 1) versus sigmoide (mapa 0 a 1) para mi función de activación neuronal. De mi lectura sonaba como algo menor con …

3
Función ETS (), ¿cómo evitar el pronóstico que no está en línea con los datos históricos?
Estoy trabajando en un alogoritmo en R para automatizar un cálculo de pronóstico mensual. Estoy usando, entre otros, la función ets () del paquete de pronóstico para calcular el pronóstico. Está funcionando muy bien. Desafortunadamente, para algunas series de tiempo específicas, el resultado que obtengo es extraño. A continuación, encuentre …





2
¿Para qué distribuciones hay un estimador imparcial de forma cerrada para la desviación estándar?
Para la distribución normal, hay un estimador imparcial de la desviación estándar dada por: σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2−−−−−−−−−−−−√σ^unbiased=Γ(n−12)Γ(n2)12∑k=1n(xi−x¯)2\hat{\sigma}_\text{unbiased} = \frac{\Gamma(\frac{n-1}{2})}{\Gamma(\frac{n}{2})} \sqrt{\frac{1}{2}\sum_{k=1}^n(x_i-\bar{x})^2} La razón por la cual este resultado no es tan conocido parece ser que es en gran parte una curiosidad y no una cuestión de gran importancia . La prueba está cubierta …

2
¿Cuál sería un ejemplo de un modelo realmente simple con una probabilidad intratable?
El cálculo bayesiano aproximado es una técnica realmente genial para ajustar básicamente cualquier modelo estocástico, destinado a modelos donde la probabilidad es intratable (por ejemplo, puede tomar muestras del modelo si fija los parámetros pero no puede calcular la probabilidad numérica, algorítmica o analíticamente ). Al presentar el cálculo bayesiano …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.