Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


2
Regresión lineal versus no lineal
Tengo un conjunto de valores xxx e que están teóricamente relacionados exponencialmente:yyy y=axby=axsiy = ax^b Una forma de obtener los coeficientes es aplicando logaritmos naturales en ambos lados y ajustando un modelo lineal: > fit <- lm(log(y)~log(x)) > a <- exp(fit$coefficients[1]) > b <- fit$coefficients[2] Otra forma de obtener esto …


1
Al construir un modelo de regresión utilizando conjuntos de modelado / validación separados, ¿es apropiado "recircular" los datos de validación?
Supongamos que tengo una división 80/20 entre las observaciones de modelado / validación. He ajustado un modelo al conjunto de datos de modelado y me siento cómodo con el error que veo en el conjunto de datos de validación. Antes de implementar mi modelo para puntuar futuras observaciones, ¿es apropiado …


1
Bosque aleatorio y predicción
Estoy tratando de entender cómo funciona Random Forest. Tengo una idea de cómo se construyen los árboles, pero no puedo entender cómo Random Forest hace predicciones sobre muestras fuera de bolsa. ¿Alguien podría darme una explicación simple, por favor? :)

1
¿Variable dependiente estandarizada dentro de un grupo en modelos de datos de panel?
¿Tiene sentido estandarizar una variable dependiente dentro del grupo de identificación? El siguiente documento de trabajo (Desaceleración de la deforestación en la Amazonía legal; ¿Precios o políticas ?, pdf ) utiliza una variable dependiente estandarizada para analizar el efecto del cambio de política general en Brasil sobre la deforestación. La …


2
¿Cuándo registrar / explicar sus variables cuando usa modelos de bosque aleatorio?
Estoy haciendo una regresión usando Random Forests para predecir precios basados ​​en varios atributos. El código está escrito en Python usando Scikit-learn. ¿Cómo decide si debe transformar sus variables usando exp/ logantes de usarlo para ajustar el modelo de regresión? ¿Es necesario cuando se utiliza un enfoque de conjunto como …

1
Muestra grande asintótica / teoría - ¿Por qué preocuparse?
Espero que esta pregunta no se marque "como demasiado general" y espero que se inicie una discusión que beneficie a todos. En estadística, pasamos mucho tiempo aprendiendo grandes teorías de muestra. Estamos profundamente interesados ​​en evaluar las propiedades asintóticas de nuestros estimadores, incluso si son asintóticamente insesgadas, asintóticamente eficientes, su …

4
Interpolación de datos de influenza que conserva la media semanal
Editar He encontrado un documento que describe exactamente el procedimiento que necesito. La única diferencia es que el documento interpola datos medios mensuales a diarios, al tiempo que conserva los medios mensuales. Tengo problemas para implementar el enfoque R. Cualquier pista es apreciada. Original Para cada semana, tengo los siguientes …

1
Predicción sobre modelos de efectos mixtos: ¿qué hacer con los efectos aleatorios?
Consideremos este conjunto de datos hipotético: set.seed(12345) num.subjects <- 10 dose <- rep(c(1,10,50,100), num.subjects) subject <- rep(1:num.subjects, each=4) group <- rep(1:2, each=num.subjects/2*4) response <- dose*dose/10 * group + rnorm(length(dose), 50, 30) df <- data.frame(dose=dose, response=response, subject=subject, group=group) podemos usar lmepara modelar la respuesta con un modelo de efectos aleatorios: require(nlme) …

1
¿Son apropiados los errores estándar de arranque y los intervalos de confianza en regresiones donde se viola el supuesto de homocedasticidad?
Si en las regresiones estándar de OLS se violan dos supuestos (distribución normal de errores, homocedasticidad), ¿son los errores estándar de arranque y los intervalos de confianza una alternativa apropiada para llegar a resultados significativos con respecto a la importancia de los coeficientes regresores? ¿Las pruebas de significación con errores …

3
¿Cómo calcular componentes principales rotados con varimax en R?
Ejecuté PCA en 25 variables y seleccioné las 7 mejores PC usando prcomp. prc <- prcomp(pollutions, center=T, scale=T, retx=T) Luego hice rotación varimax en esos componentes. varimax7 <- varimax(prc$rotation[,1:7]) Y ahora deseo varimax rotar los datos rotados por PCA (ya que no es parte del objeto varimax, solo la matriz …
13 r  pca  factor-rotation 


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.