Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

3
Elegir K óptimo para KNN
Realicé un CV de 5 veces para seleccionar la K óptima para KNN. Y parece que cuanto más grande se hace K, más pequeño es el error ... Lo siento, no tenía una leyenda, pero los diferentes colores representan diferentes pruebas. Hay 5 en total y parece que hay poca …

2
Explicación de los grados de libertad no enteros en la prueba t con variaciones desiguales
El procedimiento de prueba t de SPSS informa 2 análisis cuando se comparan 2 medias independientes, un análisis con variaciones iguales asumidas y otro con variaciones iguales no asumidas. Los grados de libertad (df) cuando se asumen variaciones iguales son siempre valores enteros (e iguales n-2). El df cuando no …

3
¿Cómo elegir un número óptimo de factores latentes en la factorización matricial no negativa?
Dada una matriz , la factorización de matriz no negativa (NMF) encuentra dos matrices no negativas W m × k y H k × n (es decir, con todos los elementos ≥ 0 ) para representar la matriz descompuesta como:Vm×nVm×n\mathbf V^{m \times n}Wm×kWm×k\mathbf W^{m \times k}Hk×nHk×n\mathbf H^{k \times n}≥0≥0\ge 0 …

4
Significado de las características latentes?
Estoy tratando de entender los modelos de factorización matricial para sistemas de recomendación y siempre leo 'características latentes', pero ¿qué significa eso? Sé lo que significa una característica para un conjunto de datos de entrenamiento, pero no puedo entender la idea de las características latentes. Cada artículo sobre el tema …

1
¿Cómo calcular la pureza?
En el análisis de conglomerados, ¿cómo calculamos la pureza? ¿Cuál es la ecuación? No estoy buscando un código para hacerlo por mí. Deje ωkωk\omega_k ser clúster k, y cjcjc_j sea ​​clase j. Entonces, ¿la pureza es prácticamente precisión? parece que estaban sumando la cantidad de clase verdaderamente clasificada por grupo …
15 clustering 

3
Calcular la divergencia Kullback-Leibler en la práctica?
Estoy usando KL divergencia como una medida de disimilitud entre 2 y .P Qp.m.f.p.m.f.p.m.f. PPPQQQ =-∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))DKL(P||Q)=∑i=1Nln(PiQi)PiDKL(P||Q)=∑i=1Nln⁡(PiQi)PiD_{KL}(P||Q) = \sum_{i=1}^N \ln \left( \frac{P_i}{Q_i} \right) P_i =−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=−∑P(Xi)ln(Q(Xi))+∑P(Xi)ln(P(Xi))=-\sum P(X_i)ln\left(Q(X_i)\right) + \sum P(X_i)ln\left(P(X_i)\right) Si , podemos calcular fácilmente que P ( X i ) l n ( Q ( X i ) ) = 0 …

4
Cómo mantener variables invariables en el tiempo en un modelo de efectos fijos
Tengo datos sobre los empleados de una gran empresa italiana durante diez años y me gustaría ver cómo la brecha de género en los ingresos de hombres y mujeres ha cambiado con el tiempo. Para este propósito ejecuto OLS agrupados: yit=X′itβ+δmalei+∑t=110γtdt+εityit=Xit′β+δmalei+∑t=110γtdt+εit y_{it} = X'_{it}\beta + \delta {\rm male}_i + \sum^{10}_{t=1}\gamma_t …


1
Series temporales biológicas multivariantes: VAR y estacionalidad
Tengo un conjunto de datos de series temporales multivariadas que incluye variables biológicas y ambientales que interactúan (más posiblemente algunas variables exógenas). Además de la estacionalidad, no hay una tendencia clara a largo plazo en los datos. Mi propósito es ver qué variables están relacionadas entre sí. La previsión no …

1
Cualitativamente, ¿qué es la entropía cruzada?
Esta pregunta da una definición cuantitativa de entropía cruzada, en términos de su fórmula. Estoy buscando una definición más teórica, wikipedia dice: En teoría de la información, la entropía cruzada entre dos distribuciones de probabilidad mide el número promedio de bits necesarios para identificar un evento a partir de un …




1
Arpillera de la función logística
Tengo dificultad para derivar el hessiano de la función objetivo, l(θ)l(θ)l(\theta) , en regresión logística donde l(θ)l(θ)l(\theta) es: l(θ)=∑i=1m[yilog(hθ(xi))+(1−yi)log(1−hθ(xi))]l(θ)=∑i=1m[yilog⁡(hθ(xi))+(1−yi)log⁡(1−hθ(xi))] l(\theta)=\sum_{i=1}^{m} \left[y_{i} \log(h_\theta(x_{i})) + (1- y_{i}) \log (1 - h_\theta(x_{i}))\right] hθ(x)hθ(x)h_\theta(x) es una función logística. El Hessian esXTDXXTDXX^T D X . Traté de deducirlo calculando∂2l(θ)∂θi∂θj∂2l(θ)∂θi∂θj\frac{\partial^2 l(\theta)}{\partial \theta_i \partial \theta_j} , pero …
15 logistic 


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.