Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

1
En la regresión lineal, ¿por qué la regularización penaliza también los valores de los parámetros?
Actualmente estoy aprendiendo regresión de cresta y estaba un poco confundido acerca de la penalización de modelos más complejos (o la definición de un modelo más complejo). Por lo que entiendo, la complejidad del modelo no se correlaciona necesariamente con el orden polinómico. Entonces: es un modelo más complejo que:2+3+4x2+5x3+6x42+3+4x2+5x3+6x4 …

2
¿Cómo encontrar la matriz de covarianza de un polígono?
Imagine que tiene un polígono definido por un conjunto de coordenadas y su centro de masa está en . Puede tratar el polígono como una distribución uniforme con un límite poligonal. (x1,y1)...(xn,yn)(x1,y1)...(xn,yn)(x_1,y_1)...(x_n,y_n)(0,0)(0,0)(0,0) Busco un método que encuentre la matriz de covarianza de un polígono . Sospecho que la matriz de …

2
¿Cómo probar si ?
Supongamos que tengo tres grupos independientes, con media respectivamente.μ1, μ2, μ3μ1, μ2, μ3\mu_1,~ \mu_2,~\mu_3 ¿Cómo puedo probar si o no muestras de cada grupo?μ1&lt;μ2&lt;μ3μ1&lt;μ2&lt;μ3\mu_1 < \mu_2 <\mu_3n1, n2, n3n1, n2, n3n_1,~n_2,~n_3 Deseo conocer alguna metodología general, no un cálculo detallado. No pude entender cómo establecer mi hipótesis y .H0H0H_0H1H1H_1

2
Probabilidad de
Supongamos que X1X1X_1 y X2X2X_2 son variables aleatorias geométricas independientes con el parámetro ppp . ¿Cuál es la probabilidad de que X1≥X2X1≥X2X_1 \geq X_2 ? Estoy confundido acerca de esta pregunta porque no se nos dice nada sobre X1X1X_1 y X2X2X_2 aparte de que son geométricos. ¿No sería esto 50%50%50\% …



1
¿Por qué la parte posterior bayesiana se concentra alrededor del minimizador de la divergencia KL?
Considere la bayesiana posterior . Asintóticamente, su máximo ocurre en la estimación MLE , que simplemente maximiza la probabilidad .θ ∣ Xθ∣X\theta\mid Xθ argmin θθ^θ^\hat \thetaargminθFθ( X)argminθfθ(X)\operatorname{argmin}_\theta\, f_\theta(X) Todos estos conceptos (antecedentes bayesianos, maximizando la probabilidad) suenan súper principios y no son en absoluto arbitrarios. No hay un registro a …

2
¿Estimación de incertidumbre en problemas de inferencia de alta dimensión sin muestreo?
Estoy trabajando en un problema de inferencia de alta dimensión (alrededor de 2000 parámetros del modelo) para el cual somos capaces de realizar una estimación MAP de manera sólida al encontrar el máximo global del log-posterior utilizando una combinación de optimización basada en gradiente y un algoritmo genético. Me gustaría …

1
¿Por qué se filtra información sobre los datos de validación si evalúo el rendimiento del modelo en los datos de validación al ajustar los hiperparámetros?
En el aprendizaje profundo de François Chollet con Python dice: Como resultado, ajustar la configuración del modelo en función de su rendimiento en el conjunto de validación puede resultar rápidamente en un ajuste excesivo para el conjunto de validación, aunque su modelo nunca esté directamente capacitado sobre él. Central a …

13
Si 'B tiene más probabilidades de recibir A', entonces 'A tiene más probabilidades de recibir B'
Estoy tratando de tener una intuición más clara detrás: "Si hace que sea más probable, entonces hace que sea más probable", es decirAAABBBBBBAAA Supongamos que denota el tamaño del espacio en el que están y , luegon(S)n(S)n(S)AAABBB Reclamación: entoncesP(B|A)&gt;P(B)P(B|A)&gt;P(B)P(B|A)>P(B)n(AB)/n(A)&gt;n(B)/n(S)n(AB)/n(A)&gt;n(B)/n(S)n(AB)/n(A) > n(B)/n(S) entoncesn(AB)/n(B)&gt;n(A)/n(S)n(AB)/n(B)&gt;n(A)/n(S)n(AB)/n(B) > n(A)/n(S) que esP(A|B)&gt;P(A)P(A|B)&gt;P(A)P(A|B)>P(A) Entiendo las matemáticas, pero …

1
Comprobando si una moneda es justa
Me hizo la siguiente pregunta un amigo. No pude ayudarla, pero espero que alguien me lo explique. No pude encontrar ningún ejemplo similar. Gracias por cualquier ayuda y explicación. P: Los resultados de 100 experimentos de lanzamiento de monedas se registran como 0 = "Cola" y 1 = "Cabeza". La …




4
Optimización de descenso de gradiente
Estoy tratando de entender la optimización de descenso de gradiente en algoritmos ML (aprendizaje automático). Tengo entendido que hay una función donde el costo es el objetivo de minimizar el error y - y . En un escenario donde los pesos w 1 , w 2 se están optimizando para …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.