Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


3
Elegir entre transformaciones en regresión logística
En la regresión lineal, las transformaciones de las variables explicativas se realizan para tener una correlación máxima con la variable dependiente. ¿Cuál es la mejor medida para elegir entre transformaciones múltiples en regresión logística ya que la variable dependiente es binaria y no continua? El objetivo final es maximizar el …

1
Encuesta diseño chi cuadrado
¿Alguien sabe un método para comparar dos variables con una prueba de chi cuadrado si las variables son de diferentes encuestas con diferentes svydesign()declaraciones? Estoy buscando probar una diferencia en una distribución variable en dos ondas de una encuesta, pero la svychisq()declaración se limita a un objeto de diseño. ¿Es …
8 r  chi-squared  survey 



2
Pesos en regresión cuantil para encuesta compleja en R
Quiero incluir pesos de muestra en mi modelo de regresión cuantil, pero no estoy seguro de cómo hacerlo. Ya he definido mi peso, que son los pesos replicados que ya figuran en el conjunto de datos de la encuesta (calculado en el paquete de la encuesta): w<-svrepdesign(variables=data[,1:10],repweights=data[,11:30],type="BRR", combined.weights=TRUE, weights=r.weights, rho=0.5,dbname="") …


1
Distancia de Mahalanobis en datos no normales
La distancia de Mahalanobis, cuando se usa con fines de clasificación, generalmente asume una distribución normal multivariada, y las distancias desde el centroide deberían seguir un χ2χ2\chi^2distribución (con grados de libertad igual al número de dimensiones / características). Podemos calcular la probabilidad de que un nuevo punto de datos pertenezca …

2
¿Cómo combinar múltiples conjuntos de datos imputados?
Necesito un único conjunto de datos imputados (por ejemplo, para crear un grupo ficticio del grupo imputado a partir de los datos de ingreso per cápita del país imputado). R ofrece paquetes de paquetes para crear múltiples datos imputados (por ejemplo, Amelia) y combinar resultados de múltiples conjuntos de datos …

2
No normalidad en residuos
Me refiero a esta publicación que parece cuestionar la importancia de la distribución normal de los residuos, argumentando que esto, junto con la heterocedasticidad, podría evitarse mediante el uso de errores estándar robustos. He considerado varias transformaciones (raíces, registros, etc.) y todo resulta inútil para resolver completamente el problema. Aquí …





1
Elegir antecedentes no informativos
Estoy trabajando en un modelo que depende de una función parametrizada fea que actúa como una función de calibración en una parte del modelo. Utilizando una configuración bayesiana, necesito obtener antecedentes no informativos para los parámetros que describen mi función. Sé que, idealmente, debería derivar referencias o al menos anteriores …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.