Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


2
¿Por qué necesita escalar datos en KNN?
¿Podría alguien explicarme por qué necesita normalizar los datos cuando usa K vecinos más cercanos? He intentado buscar esto, pero parece que todavía no puedo entenderlo. Encontré el siguiente enlace: https://discuss.analyticsvidhya.com/t/why-it-is-necessary-to-normalize-in-knn/2715 Pero en esta explicación, no entiendo por qué un rango mayor en una de las características afecta las predicciones.

3
Cero distribuciones infladas, ¿qué son realmente?
Estoy luchando por comprender las distribuciones infladas cero. ¿Qué son? ¿Cuál es el punto de? Si tengo datos con muchos ceros, entonces podría ajustar una regresión logística primero calcular la probabilidad de ceros, y luego podría eliminar todos los ceros, y luego ajustar una regresión regular usando mi elección de …



1
¿Por qué es importante incluir un término de corrección de sesgo para el optimizador Adam para Deep Learning?
Estaba leyendo sobre el optimizador Adam para Deep Learning y encontré la siguiente oración en el nuevo libro Deep Learning de Begnio, Goodfellow y Courtville: Adam incluye correcciones de sesgo a las estimaciones de los momentos de primer orden (el término de momento) y los momentos de segundo orden (no …

2
¿Diferencia entre seleccionar entidades basadas en la "regresión F" y en los valores ?
¿Comparar características usando F-regressionlo mismo que correlacionar características con la etiqueta individualmente y observando el valor ?R2R2R^2 A menudo he visto a mis colegas usar una F regressionselección de funciones para su canal de aprendizaje automático de sklearn: sklearn.feature_selection.SelectKBest(score_func=sklearn.feature_selection.f_regression...)` Algunos, por favor, díganme: ¿por qué da los mismos resultados que …

1
¿La maldición de la dimensionalidad afecta a algunos modelos más que a otros?
Los lugares que he estado leyendo sobre la maldición de la dimensionalidad lo explican conjuntamente con kNN principalmente, y los modelos lineales en general. Regularmente veo a los mejores clasificados en Kaggle usando miles de características en el conjunto de datos que apenas tiene 100k puntos de datos. Utilizan principalmente …


2
¿Por qué lrtest () no coincide con anova (test = "LRT")
Estaba buscando formas de hacer una prueba de razón de probabilidad en R para comparar los ajustes del modelo. Primero lo codifiqué yo mismo, luego encontré la anova()función predeterminada y también lrtest()en el lmtestpaquete. Sin embargo, cuando verifiqué, anova()siempre produce un valor p ligeramente diferente de los otros dos, aunque …

1
¿Puede la regresión logística de glmnet manejar directamente las variables factoriales (categóricas) sin necesidad de variables ficticias? [cerrado]
Cerrado. Esta pregunta está fuera de tema . Actualmente no está aceptando respuestas. ¿Quieres mejorar esta pregunta? Actualice la pregunta para que esté en el tema de Cross Validated. Cerrado hace 3 años . Estoy construyendo una regresión logística en R usando el método LASSO con las funciones cv.glmnetpara seleccionar …

1
Relación entre la distribución gamma y chi-cuadrado
Si Y= ∑i = 1norteX2yoY=∑i=1NXi2Y=\sum_{i=1}^{N}X_i^2 donde Xyo∼ N( 0 , σ2)Xi∼N(0,σ2)X_i \sim \mathcal{N}(0,\sigma^2) , es decir, todas las XyoXiX_i son iid variables aleatorias normales de media cero con las mismas variaciones, entonces Y∼ Γ ( N2, 2 σ2) .Y∼Γ(N2,2σ2).Y \sim \Gamma\left(\frac{N}{2},2\sigma^2\right). Sé que la distribución chi-cuadrado es un caso especial …




Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.