Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


4
¿Cómo puedo calcular la estadística de prueba Pearson por falta de ajuste en un modelo de regresión logística en R?
La estadística de razón de probabilidad (también conocida como desviación) y la prueba de falta de ajuste (o bondad de ajuste) es bastante sencilla de obtener para un modelo de regresión logística (ajuste usando la función) en R. Sin embargo, puede ser Es fácil tener algunos recuentos de células lo …

1
Prueba de Fisher en R
Supongamos que tenemos el siguiente conjunto de datos: Men Women Dieting 10 30 Non-dieting 5 60 Si ejecuto la prueba exacta de Fisher en R, ¿qué implica alternative = greater(o menos)? Por ejemplo: mat = matrix(c(10,5,30,60), 2,2) fisher.test(mat, alternative="greater") Tengo el p-value = 0.01588y odds ratio = 3.943534. Además, cuando …

1
R regresión lineal variable categórica valor "oculto"
Este es solo un ejemplo que he encontrado varias veces, por lo que no tengo ningún dato de muestra. Ejecutar un modelo de regresión lineal en R: a.lm = lm(Y ~ x1 + x2) x1Es una variable continua. x2es categórico y tiene tres valores, por ejemplo, "Bajo", "Medio" y "Alto". …
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 





2
Cómo tratar correctamente múltiples puntos de datos por cada sujeto
Actualmente estoy discutiendo con alguien sobre cómo tratar correctamente los datos con múltiples mediciones para cada sujeto. En este caso, se recopilaron datos para cada sujeto en un corto período de tiempo para diferentes condiciones dentro de cada sujeto. Todas las mediciones reúnen exactamente la misma variable, solo múltiples. Una …

2
¿Cómo simular resultados multivariados en R?
La mayoría de las situaciones, solo tratamos con una variable de resultado / respuesta como . Sin embargo, en algunos escenarios, especialmente en los datos clínicos, las variables de resultado pueden ser de alta dimensión / multivariadas. Tal como Y = β x + ϵ , donde Y contiene variables …



3
¿Cómo crear un sistema de recomendación que integre tanto el filtrado colaborativo como las características de contenido?
Estoy creando un sistema de recomendación y quiero incorporar tanto las calificaciones de los usuarios "similares" como las características de los elementos. La salida es una calificación prevista [0-1]. Estoy considerando una red neuronal (para empezar). Por lo tanto, las entradas son una combinación de las características de los elementos …

1
Faltan valores en la variable de respuesta en JAGS
Gelman y Hill (2006) dicen: En Bugs, los resultados faltantes en una regresión se pueden manejar fácilmente simplemente incluyendo el vector de datos, NA y todo. Los errores modelan explícitamente la variable de resultado, por lo que es trivial usar este modelo para, en efecto, imputar valores faltantes en cada …

2
Bosque aleatorio en datos agrupados
Estoy usando un bosque aleatorio en datos agrupados de alta dimensión (50 variables de entrada numéricas) que tienen una estructura jerárquica. Los datos se recopilaron con 6 repeticiones en 30 posiciones de 70 objetos diferentes, lo que resultó en 12600 puntos de datos, que no son independientes. Parece que el …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.