Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


1
Ecuación correcta para la covarianza muestral imparcial ponderada
Estoy buscando la ecuación correcta para calcular la covarianza muestral imparcial ponderada. Las fuentes de Internet son bastante raras en este tema y todas usan ecuaciones diferentes. La ecuación más probable que he encontrado es esta: qjk=∑Ni=1wi(∑Ni=1wi)2−∑Ni=1w2i∑Ni=1wi(xij−x¯j)(xik−x¯k).qjk=∑i=1Nwi(∑i=1Nwi)2−∑i=1Nwi2∑i=1Nwi(xij−x¯j)(xik−x¯k).q_{jk}=\frac{\sum_{i=1}^{N}w_i}{\left(\sum_{i=1}^{N}w_i\right)^2-\sum_{i=1}^{N}w_i^2} \sum_{i=1}^N w_i \left( x_{ij}-\bar{x}_j \right) \left( x_{ik}-\bar{x}_k \right) . De: https://en.wikipedia.org/wiki/Sample_mean_and_sample_covariance#Weighted_samples Por supuesto, …

1
¿Cuál es el significado del superíndice en y ?
En el contexto de la inferencia basada en la probabilidad, he visto alguna notación sobre los parámetros de interés que he encontrado un poco confusa. Por ejemplo, notación como y .pθ(x)pθ(x)p_{\theta}(x)Eθ[S(θ)]Eθ[S(θ)]{\mathbb E}_{\theta}\left[S(\theta)\right] ¿Cuál es el significado del parámetro ( ) en la notación de subíndice anterior? En otras palabras, ¿cómo …

3
¿Por qué svm no es tan bueno como el árbol de decisión en los mismos datos?
Soy nuevo en el aprendizaje automático y trato de usar scikit-learn (sklearn) para tratar un problema de clasificación. Tanto DecisionTree como SVM pueden entrenar a un clasificador para este problema. Utilizo sklearn.ensemble.RandomForestClassifiery sklearn.svm.SVCpara ajustar los mismos datos de entrenamiento (alrededor de 500,000 entradas con 50 funciones por entrada). El RandomForestClassifier …


1
Significado de correlación parcial
De Wikipedia Formalmente, la correlación parcial entre e dado un conjunto de variables de control , escrita ρ_ {XY · Z} , es la correlación entre los residuos RX y RY resultantes de regresión lineal de X con Z y de Y con Z , respectivamente.XXXYYYnnnZ={Z1,Z2,…,Zn}Z={Z1,Z2,…,Zn}Z = \{Z_1, Z_2, …, …


1
Navaja de Occam obsoleta?
Vi los libros de Vapnik sobre aprendizaje estadístico ... Leí los primeros capítulos. De todos modos, lo que más me sorprendió fue que pensó que la navaja de afeitar de Occam era obsoleta. Pensé que estaba relacionado con la situación en la que asumir una dimensión más alta mejora significativamente …



2
Regresión a través del origen.
Tenemos los siguientes puntos: ¿Cómo podemos encontrar la mejor línea de ajuste través de los puntos? Mi calculadora tiene la opción de encontrar la mejor línea de ajuste través de estos puntos, que es:( 0 , 0 ) ( 1 , 51.8 ) ( 1.9 , 101.3 ) ( 2.8 …



1
¿Qué se entiende por "nivel" de una serie temporal?
En gran parte de la literatura que estoy estudiando, es uno de esos términos que ocurre con frecuencia pero sin una definición rigurosa. Específicamente, me dicen: Para variables aleatorias indexadas en el tiempo (RV) {Xt}{Xt}\{X_t\}, el modelo de descomposición aditiva se da como Xt=ll(Xt−1,Xt−2,…)+fc(Xt−1,Xt−2,…,εt,εt−1,…)Xt=ll(Xt−1,Xt−2,…)+fc(Xt−1,Xt−2,…,εt,εt−1,…)X_t = {ll}(X_{t-1}, X_{t-2}, \ldots) + {fc}(X_{t-1}, …

1
¿Cuál es la diferencia entre maximizar la probabilidad condicional (log) o la probabilidad conjunta (log) al estimar los parámetros de un modelo?
Considere una respuesta y y matriz de datos X . Supongamos que estoy creando un modelo del formulario: y ~ g (X, )θθ\theta (g () podría ser cualquier función de X y )θθ\theta Ahora, para estimar utilizando el método de máxima verosimilitud (ML), podría seguir adelante con ML condicional (suponiendo …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.