Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


2
Cálculo de problemas, interpretación de subconjuntos de registros y preguntas generales sobre el procedimiento de selección de modelos
Quiero seleccionar modelos usando regsubsets(). Tengo un marco de datos llamado olympiadaten (datos cargados: http://www.sendspace.com/file/8e27d0 ). Primero adjunto este marco de datos y luego empiezo a analizar, mi código es: attach(olympiadaten) library(leaps) a<-regsubsets(Gesamt ~ CommunistSocialist + CountrySize + GNI + Lifeexp + Schoolyears + ExpMilitary + Mortality + PopPoverty + …

2
Determinación del mayor contribuyente en un grupo
No sé mucho sobre estadísticas, así que tengan paciencia conmigo. Digamos que tengo un conjunto de 1000 trabajadores. Quiero averiguar quién es el trabajador más duro, pero solo puedo medir la cantidad de trabajo que se realiza en grupos de 1 a 100 durante más de una hora de trabajo. …


2
Uso del parámetro Gamma con máquinas de vectores de soporte
Cuando se usa libsvm, el parámetro es un parámetro para la función del núcleo. Su valor predeterminado se configura como γ = 1γγ\gammaγ= 1Número de características.γ=1Número de características.\gamma = \frac{1}{\text{number of features.}} ¿Existe alguna guía teórica para configurar este parámetro además de los métodos existentes, por ejemplo, la búsqueda de …


3
¿Cómo usar R gbm con distribution = "adaboost"?
La documentación establece que R gbm with distribution = "adaboost" se puede usar para problemas de clasificación 0-1. Considere el siguiente fragmento de código: gbm_algorithm <- gbm(y ~ ., data = train_dataset, distribution = "adaboost", n.trees = 5000) gbm_predicted <- predict(gbm_algorithm, test_dataset, n.trees = 5000) Se puede encontrar en la …
9 r  gbm 


2
¿Por qué la cantidad de variación explicada por mi primera PC es tan cercana a la correlación promedio por pares?
¿Cuál es la relación entre los primeros componentes principales y la correlación promedio en la matriz de correlación? Por ejemplo, en una aplicación empírica, observo que la correlación promedio es casi la misma que la razón de la varianza del primer componente principal (primer valor propio) a la varianza total …

3
Asignación aleatoria: ¿por qué molestarse?
La asignación aleatoria es valiosa porque garantiza la independencia del tratamiento de los posibles resultados. Así es como conduce a estimaciones imparciales del efecto promedio del tratamiento. Pero otros esquemas de asignación también pueden garantizar sistemáticamente la independencia del tratamiento de los posibles resultados. Entonces, ¿por qué necesitamos una asignación …

1
¿Cómo comparar los eventos observados con los esperados?
Supongamos que tengo una muestra de frecuencias de 4 eventos posibles: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 y tengo las probabilidades esperadas de que ocurran mis eventos: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 Con la suma de las …
9 r  statistical-significance  chi-squared  multivariate-analysis  exponential  joint-distribution  statistical-significance  self-study  standard-deviation  probability  normal-distribution  spss  interpretation  assumptions  cox-model  reporting  cox-model  statistical-significance  reliability  method-comparison  classification  boosting  ensemble  adaboost  confidence-interval  cross-validation  prediction  prediction-interval  regression  machine-learning  svm  regularization  regression  sampling  survey  probit  matlab  feature-selection  information-theory  mutual-information  time-series  forecasting  simulation  classification  boosting  ensemble  adaboost  normal-distribution  multivariate-analysis  covariance  gini  clustering  text-mining  distance-functions  information-retrieval  similarities  regression  logistic  stata  group-differences  r  anova  confidence-interval  repeated-measures  r  logistic  lme4-nlme  inference  fiducial  kalman-filter  classification  discriminant-analysis  linear-algebra  computing  statistical-significance  time-series  panel-data  missing-data  uncertainty  probability  multivariate-analysis  r  classification  spss  k-means  discriminant-analysis  poisson-distribution  average  r  random-forest  importance  probability  conditional-probability  distributions  standard-deviation  time-series  machine-learning  online  forecasting  r  pca  dataset  data-visualization  bayes  distributions  mathematical-statistics  degrees-of-freedom 

1
Parametrizando las distribuciones Behrens-Fisher
"Sobre el problema de Behrens-Fisher: una revisión" por Seock-Ho Kim y Allen S. Cohen Journal of Educational and Behavioral Statistics , volumen 23, número 4, invierno, 1998, páginas 356–377 Estoy mirando esto y dice: Fisher (1935, 1939) eligió la estadística [dondeties laestadísticathabitual de una muestraparai=1,2] dondeθse toma en la primera …

1
"Dado que
Pregunta corta: ¿Por qué es esto cierto? Larga pregunta: Muy simple, estoy tratando de descubrir qué justifica esta primera ecuación. El autor del libro que estoy leyendo (contexto aquí si lo desea, pero no es necesario), afirma lo siguiente: Debido a la suposición de casi gaussianismo, podemos escribir: pag0 0( …



Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.