Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

3
Para los clasificadores lineales, ¿los coeficientes más grandes implican características más importantes?
Soy un ingeniero de software que trabaja en aprendizaje automático. Según tengo entendido, la regresión lineal (como OLS) y la clasificación lineal (como la regresión logística y SVM) hacen una predicción basada en un producto interno entre los coeficientes entrenados y las variables de característica :w⃗ w→\vec{w}x⃗ x→\vec{x} y^=f(w⃗ ⋅x⃗ …



2
Alta variación de validación cruzada de dejar uno fuera
Leí una y otra vez que la validación cruzada "Leave-one-out" tiene una gran variación debido a la gran superposición de los pliegues de entrenamiento. Sin embargo, no entiendo por qué es así: ¿no debería ser el rendimiento de la validación cruzada muy estable (baja variación) exactamente porque los conjuntos de …

3
¿Puede un modelo para datos no negativos con aglomeración en ceros (Tweedie GLM, GLM inflado a cero, etc.) predecir ceros exactos?
Una distribución Tweedie puede modelar datos asimétricos con una masa de punto en cero cuando el parámetro ppagp (exponente en la relación media-varianza) está entre 1 y 2. Del mismo modo, un modelo inflado a cero (ya sea continuo o discreto) puede tener una gran cantidad de ceros. Tengo problemas …


2
¿Qué medida de error de entrenamiento reportar para bosques aleatorios?
Actualmente estoy ajustando bosques aleatorios para un problema de clasificación usando el randomForestpaquete en R, y no estoy seguro de cómo informar un error de entrenamiento para estos modelos. Mi error de entrenamiento es cercano al 0% cuando lo calculo usando predicciones que obtengo con el comando: predict(model, data=X_train) ¿Dónde …

5
Kernel SVM: quiero una comprensión intuitiva de la asignación a un espacio de características de dimensiones superiores, y cómo esto hace posible la separación lineal
Estoy tratando de entender la intuición detrás de los SVM del kernel. Ahora, entiendo cómo funciona el SVM lineal, mediante el cual se toma una línea de decisión que divide los datos lo mejor que puede. También entiendo el principio detrás de la transferencia de datos a un espacio de …

1
importancia de la diferencia entre dos recuentos
¿Hay alguna manera de determinar si una diferencia entre un recuento de accidentes de tráfico en el momento 1 es significativamente diferente de un recuento en el momento 2? He encontrado diferentes métodos para determinar la diferencia entre grupos de observaciones en diferentes momentos (por ejemplo, comparar medias de Poisson) …


1
¿Qué pasa si alta precisión de validación pero baja precisión de prueba en investigación?
Tengo una pregunta específica sobre la validación en la investigación de aprendizaje automático. Como sabemos, el régimen de aprendizaje automático les pide a los investigadores que capaciten a sus modelos en los datos de capacitación, que elijan entre los modelos candidatos por conjunto de validación e informen la precisión del …





Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.