Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

5
¿Es una trampa descartar los valores atípicos basados ​​en el diagrama de caja de Error absoluto medio para mejorar un modelo de regresión?
Tengo un modelo de predicción probado con cuatro métodos, como puede ver en la figura del diagrama de caja a continuación. El atributo que predice el modelo está en el rango de 0-8. Puede notar que hay un valor atípico de límite superior y tres valores atípicos de límite inferior …




2
Buena precisión a pesar del alto valor de pérdida
Durante el entrenamiento de un clasificador binario de red neuronal simple obtengo un alto valor de pérdida, usando entropía cruzada. A pesar de esto, el valor de precisión en el conjunto de validación es bastante bueno. ¿Tiene algún significado? ¿No hay una correlación estricta entre pérdida y precisión? Tengo en …

1
¿Cuál es la diferencia entre PCA regular y PCA probabilística?
Sé que el PCA regular no sigue el modelo probabilístico para los datos observados. Entonces, ¿cuál es la diferencia básica entre PCA y PPCA ? En PPCA, el modelo de variable latente contiene, por ejemplo, variables observadas , latente (variables no observadas x ) y una matriz W que no …
15 pca 

1
¿Un estimador imparcial de la razón de dos coeficientes de regresión?
Suponga que ajusta una regresión lineal / logística , con el objetivo de una estimación imparcial de . Está muy seguro de que tanto como son muy positivos en relación con el ruido en sus estimaciones.g(y)=a0+a1⋅x1+a2⋅x2g(y)=a0+a1⋅x1+a2⋅x2g(y) = a_0 + a_1\cdot x_1 + a_2\cdot x_2a1a2a1a2\frac{a_1}{a_2}a1a1a_1a2a2a_2 Si tiene la covarianza conjunta de …

1
¿Cómo podría el descenso de gradiente estocástico ahorrar tiempo en comparación con el descenso de gradiente estándar?
Descenso de gradiente estándar calcularía el gradiente para todo el conjunto de datos de entrenamiento. for i in range(nb_epochs): params_grad = evaluate_gradient(loss_function, data, params) params = params - learning_rate * params_grad Para un número predefinido de épocas, primero calculamos el vector de gradiente weights_grad de la función de pérdida para …




2
¿Qué significa decir que un evento "sucede eventualmente"?
Considere una caminata aleatoria de 1 dimensión en los enteros con el estado inicial :ZZ\mathbb{Z}x∈Zx∈Zx\in\mathbb{Z} Sn=x+∑i=1nξiSn=x+∑i=1nξi\begin{equation} S_n=x+\sum^n_{i=1}\xi_i \end{equation} donde los incrementos ξiξi\xi_i son IID tales que P{ξi=1}=P{ξi=−1}=12P{ξi=1}=P{ξi=−1}=12P\{\xi_i=1\}=P\{\xi_i=-1\}=\frac{1}{2} . Uno puede probar que (1) Px{Sn reaches +1 eventually}=1Px{Sn reaches +1 eventually}=1\begin{equation} P^x{\{S_n \text{ reaches +1 eventually}\}} = 1 \end{equation} donde el …


4
La precisión de la máquina de aumento de gradiente disminuye a medida que aumenta el número de iteraciones
Estoy experimentando con el algoritmo de la máquina de aumento de gradiente a través del caretpaquete en R. Usando un pequeño conjunto de datos de admisión a la universidad, ejecuté el siguiente código: library(caret) ### Load admissions dataset. ### mydata <- read.csv("http://www.ats.ucla.edu/stat/data/binary.csv") ### Create yes/no levels for admission. ### mydata$admit_factor[mydata$admit==0] …
15 machine-learning  caret  boosting  gbm  hypothesis-testing  t-test  panel-data  psychometrics  intraclass-correlation  generalized-linear-model  categorical-data  binomial  model  intercept  causality  cross-correlation  distributions  ranks  p-value  z-test  sign-test  time-series  references  terminology  cross-correlation  definition  probability  distributions  beta-distribution  inverse-gamma  missing-data  paired-comparisons  paired-data  clustered-standard-errors  cluster-sample  time-series  arima  logistic  binary-data  odds-ratio  medicine  hypothesis-testing  wilcoxon-mann-whitney  unsupervised-learning  hierarchical-clustering  neural-networks  train  clustering  k-means  regression  ordinal-data  change-scores  machine-learning  experiment-design  roc  precision-recall  auc  stata  multilevel-analysis  regression  fitting  nonlinear  jmp  r  data-visualization  gam  gamm4  r  lme4-nlme  many-categories  regression  causality  instrumental-variables  endogeneity  controlling-for-a-variable 

2
¿Cómo difieren ABC y MCMC en sus aplicaciones?
Según tengo entendido, la Computación Bayesiana Aproximada (ABC) y la Cadena de Markov Monte Carlo (MCMC) tienen objetivos muy similares. A continuación describo mi comprensión de estos métodos y cómo percibo las diferencias en su aplicación a los datos de la vida real. Computación Bayesiana Aproximada ABC consiste en muestrear …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.