Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.



2
¿Es la prueba de suma de rango de Wilcoxon la prueba correcta para ver si las donaciones totales difieren?
Antecedentes: Mi software solicita a los usuarios donaciones opcionales de cualquier cantidad. Dividí las solicitudes de donación de prueba entre los usuarios para encontrar la mejor manera de preguntar: 50% obtiene la versión 1 de la solicitud, 50% obtiene la versión 2 de la solicitud, y vemos cuál funciona mejor. …

2
Problemas con la detección de valores atípicos
En una publicación de blog, Andrew Gelman escribe : La regresión gradual es una de estas cosas, como la detección de valores atípicos y los gráficos circulares, que parecen ser populares entre los no estadísticos, pero los estadísticos consideran que son una broma. Entiendo la referencia a los gráficos circulares, …

1
Núcleo de transición de Gibbs Sampler
Deje que sea ​​la distribución objetivo en que es absolutamente continua wrt a la medida dimensional de Lebesgue, es decir:ππ\pi(Rre, B(Rre) )(Rd,B(Rd))(\mathbb{R}^d,\mathcal{B}(\mathbb{R^d}))redd ππ\pi admite una densidad wrt a con π(X1, . . . ,Xre)π(x1,...,xd)\pi(x_1,...,x_d)λreλre\lambda^dλre( dX1, . . . , dXre) = λ ( dX1) ⋅ ⋅ ⋅ λ ( dXre)λre(reX1,...,reXre)=λ(reX1)⋅⋅⋅λ(reXre)\lambda^d(dx_1,...,dx_d) …


3
Encuentra distribución y transforma a distribución normal
Tengo datos que describen con qué frecuencia tiene lugar un evento durante una hora ("número por hora", nph) y cuánto duran los eventos ("duración en segundos por hora", dph). Estos son los datos originales: nph <- c(2.50000000003638, 3.78947368414551, 1.51456310682008, 5.84686774940732, 4.58823529414907, 5.59999999993481, 5.06666666666667, 11.6470588233699, 1.99999999998209, NA, 4.46153846149851, 18, 1.05882352939726, 9.21739130425452, …
8 normal-distribution  data-transformation  logistic  generalized-linear-model  ridge-regression  t-test  wilcoxon-signed-rank  paired-data  naive-bayes  distributions  logistic  goodness-of-fit  time-series  eviews  ecm  panel-data  reliability  psychometrics  validity  cronbachs-alpha  self-study  random-variable  expected-value  median  regression  self-study  multiple-regression  linear-model  forecasting  prediction-interval  normal-distribution  excel  bayesian  multivariate-analysis  modeling  predictive-models  canonical-correlation  rbm  time-series  machine-learning  neural-networks  fishers-exact  factorisation-theorem  svm  prediction  linear  reinforcement-learning  cdf  probability-inequalities  ecdf  time-series  kalman-filter  state-space-models  dynamic-regression  index-decomposition  sampling  stratification  cluster-sample  survey-sampling  distributions  maximum-likelihood  gamma-distribution 

1
Sobre valores negativos de AIC
Mi pregunta está relacionada con el hilo Valores negativos para AIC en el Modelo mixto general . A menudo obtengo valores negativos de AIC del software que uso. Lo noto más cuando estoy haciendo series de tiempo. Pero aquí está lo que no entiendo. Al definir el AIC como AIC=2k−2ln(L)AIC=2k−2ln⁡(L)AIC …
8 aic 

2
Modelo de predicción electoral de Nate Silver
Nate Silver ha tenido bastante éxito al predecir los resultados de las elecciones estadounidenses en el pasado, algo que se describe en su libro The Signal and the Noise . El libro contiene algunas descripciones del modelo utilizado, y una publicación en su blog describe el modelo utilizado para las …


2
¿Qué desviación está usando glmnet para comparar valores de ?
Un criterio para seleccionar el valor óptimo de con una regresión penalizada neta elástica o similar es examinar una gráfica de la desviación contra el rango de y seleccionar cuando la desviación se minimiza (o dentro de un error estándar del mínimo).λλ\lambdaλλ\lambdaλλ\lambdaλλ\lambda Sin embargo, estoy teniendo dificultades para entender con …
8 r  glmnet 



2
¿Cuáles son algunas de las razones por las que los mínimos cuadrados reponderados iterativamente no convergerían cuando se usaran para la regresión logística?
He estado usando la función glm.fit en R para ajustar parámetros a un modelo de regresión logística. Por defecto, glm.fit utiliza mínimos cuadrados repesados ​​de forma iterativa para ajustar los parámetros. ¿Cuáles son algunas razones por las cuales este algoritmo no podría converger, cuando se usa para la regresión logística?

1
Comparaciones múltiples con muchos grupos.
Me gustaría determinar si el uso de la prueba de comparaciones múltiples sería apropiado para mis datos. Utilicé la prueba de Kruskal-Wallis para determinar si había diferencias en la inhibición media entre grupos diferentes. El análisis reveló que había diferencias significativas y ahora me gustaría utilizar un procedimiento de comparación …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.