Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


1
Elegir entre funciones de pérdida para la clasificación binaria
Trabajo en un dominio problemático donde la gente suele informar ROC-AUC o AveP (precisión promedio). Sin embargo, recientemente encontré documentos que optimizan la pérdida de registro , mientras que otros informan pérdida de bisagra . Si bien entiendo cómo se calculan estas métricas, me resulta difícil comprender las compensaciones entre …





3
GLM binomial negativo frente a transformación logarítmica para datos de recuento: tasa de error tipo I aumentada
Algunos de ustedes podrían haber leído este bonito artículo: O'Hara RB, Kotze DJ (2010) No log-transforma los datos de recuento. Methods in Ecology and Evolution 1: 118–122. Klick . En mi campo de investigación (ecotoxicología) estamos lidiando con experimentos pobremente replicados y los GLM no son ampliamente utilizados. Entonces hice …

4
No transitividad de la correlación: correlaciones entre el género y el tamaño del cerebro y entre el tamaño del cerebro y el coeficiente intelectual, pero no hay correlación entre el género y el coeficiente intelectual
Encontré una siguiente explicación en un blog y me gustaría obtener más información sobre la no transitividad de la correlación: Tenemos los siguientes hechos indiscutibles: En promedio, hay una diferencia en el volumen cerebral entre hombres y mujeres. Existe una correlación entre el coeficiente intelectual y el tamaño del cerebro; …

4
¿Cuál es la intuición detrás de la independencia de
Esperaba que alguien pudiera proponer un argumento que explicara por qué las variables aleatorias Y1=X2−X1Y1=X2−X1Y_1=X_2-X_1 e Y2=X1+X2Y2=X1+X2Y_2=X_1+X_2 , XiXiX_i tiene la distribución normal estándar, son estadísticamente independientes. La prueba de este hecho se deduce fácilmente de la técnica de MGF, pero me parece extremadamente contra-intuitiva. Por lo tanto, agradecería la …

3
¿Por qué las estadísticas bayesianas no son más populares para el control estadístico de procesos?
Mi comprensión del debate bayesiano vs frecuentista es que las estadísticas frecuentistas: es (o pretende ser) objetivo o al menos imparcial así que diferentes investigadores, utilizando diferentes supuestos aún pueden obtener resultados cuantitativamente comparables mientras que las estadísticas bayesianas pretende hacer predicciones "mejores" (es decir, menor pérdida esperada), porque puede …


4
Entrenamiento de un modelo oculto de Markov, múltiples instancias de entrenamiento
He implementado un HMM discreto de acuerdo con este tutorial http://cs229.stanford.edu/section/cs229-hmm.pdf Este tutorial y otros siempre hablan de entrenar a un HMM dada una secuencia de observación. ¿Qué sucede cuando tengo múltiples secuencias de entrenamiento? ¿Debo ejecutarlos secuencialmente, entrenando al modelo después del otro? Otra opción es concatenar las secuencias …


2
¿Por qué la optimización de una mezcla de Gaussiana es computacionalmente difícil?
Considere la probabilidad logarítmica de una mezcla de gaussianos: l ( Snorte; θ ) = ∑t = 1norteIniciar sesiónF( x(t)|θ)=∑t=1nlog{∑i=1kpif(x(t)|μ(i),σ2i)}l(Snorte;θ)=∑t=1norteIniciar sesión⁡F(X(t)El |θ)=∑t=1norteIniciar sesión⁡{∑yo=1kpagyoF(X(t)El |μ(yo),σyo2)}l(S_n; \theta) = \sum^n_{t=1}\log f(x^{(t)}|\theta) = \sum^n_{t=1}\log\left\{\sum^k_{i=1}p_i f(x^{(t)}|\mu^{(i)}, \sigma^2_i)\right\} Me preguntaba por qué era computacionalmente difícil maximizar esa ecuación directamente. Estaba buscando una intuición clara y sólida …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.