Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.





2
Métodos MCMC: ¿quemar muestras?
En los métodos MCMC , sigo leyendo sobre el burn-intiempo o el número de muestras "burn". ¿Qué es esto exactamente y por qué es necesario? Actualizar: Una vez que MCMC se estabiliza, ¿permanece estable? ¿Cómo se relaciona la noción de burn-intiempo con la de tiempo de mezcla?
12 sampling  mcmc 



2
Mejores prácticas para crear 'Tidy Data'
Hadley Wickham escribió un artículo estelar llamado "Tidy Data" ( enlace ) en JSS el año pasado sobre la manipulación de datos y la obtención de los datos en una condición "óptima" para realizar el análisis. Sin embargo, me preguntaba cuáles eran las mejores prácticas en términos de presentar datos …
12 dataset  tables 

3
Aproximación normal a la distribución de Poisson.
Aquí en Wikipedia dice: Para valores suficientemente grandes de λλλ , (digamos λ>1000λ>1000λ>1000 ), la distribución normal con media λλλ y varianza λλλ (desviación estándar λ−−√λ\sqrt{\lambda} ), es una excelente aproximación a la distribución de Poisson. Siλλλes mayor que aproximadamente 10, entonces la distribución normal es una buena aproximación si …


1


1
¿Es necesario el preprocesamiento antes de la predicción usando FinalModel de RandomForest con el paquete de caret?
Utilizo el paquete caret para entrenar un objeto randomForest con 10x10CV. library(caret) tc <- trainControl("repeatedcv", number=10, repeats=10, classProbs=TRUE, savePred=T) RFFit <- train(Defect ~., data=trainingSet, method="rf", trControl=tc, preProc=c("center", "scale")) Después de eso, pruebo el randomForest en un testSet (nuevos datos) RF.testSet$Prediction <- predict(RFFit, newdata=testSet) La matriz de confusión me muestra que …



Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.