Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

3
¿Hay documentos altamente citados sobre estadísticas que realmente han difundido malas prácticas estadísticas?
Obviamente, hay muchas formas de abusar de los métodos estadísticos. ¿Conoce algún ejemplo de mala práctica estadística que se publicó por primera vez como un consejo explícito (por ejemplo, "debe usar este método para ..."), en revistas académicas acreditadas que luego fueron citadas repetidamente? Un ejemplo podría ser la regla …

1
Descartar valores atípicos basados ​​en "2.5 veces el RMSE"
En Kahneman y Deaton (2010) † , los autores escriben lo siguiente:††^\dagger Esta regresión explica el 37% de la varianza, con un error cuadrático medio (RMSE) de 0.67852. Para eliminar los valores atípicos y los informes de ingresos inverosímiles, descartamos observaciones en las que el valor absoluto de la diferencia …

1
¿Una regresión logística que maximiza la probabilidad necesariamente también maximiza el AUC sobre los modelos lineales?
Dado un conjunto de datos con resultados binarios algunas matrices de predicción , el modelo de regresión logística estándar estima los coeficientes que maximizan la probabilidad binomial. Cuando X es rango completo, \ beta_ {MLE} es único; cuando la separación perfecta no está presente, es finita.y∈{0,1}ny∈{0,1}ny\in\{0,1\}^nX∈Rn×pX∈Rn×pX\in\mathbb{R}^{n\times p}βMLEβMLE\beta_{MLE}XXXβMLEβMLE\beta_{MLE} ¿Este modelo de …






8
Cómo tratar las respuestas de encuestas ilógicas
He enviado una encuesta a una muestra de artistas. Una de las preguntas era indicar el porcentaje de ingresos derivados de: actividad artística, apoyo gubernamental, pensión privada, actividades no relacionadas con las artes. Alrededor del 65% de los individuos respondieron de manera tal que la suma del porcentaje es 100. …
13 survey  bias 




2
¿Por qué no se favorece la mejor selección de subconjuntos en comparación con el lazo?
Estoy leyendo sobre la mejor selección de subconjuntos en el libro Elementos de aprendizaje estadístico. Si tengo 3 predictores x1,x2,x3x1,x2,x3x_1,x_2,x_3 , creo 23=823=82^3=8 subconjuntos: Subconjunto sin predictores subconjunto con predictor x1x1x_1 subconjunto con predictorx2x2x_2 subconjunto con predictor x3x3x_3 subconjunto con predictores x1,x2x1,x2x_1,x_2 subconjunto con predictores x1,x3x1,x3x_1,x_3 subconjunto con predictores x2,x3x2,x3x_2,x_3 …


1
Cuando comparamos grupos en variables de control, ¿deberíamos usar pruebas de equivalencia?
En muchos artículos que consideran tratamientos y resultados, veo tablas (generalmente "tabla 1") de lo que podría llamarse variables molestas (a menudo demográficas, a veces afecciones médicas) con pruebas de significación y texto como "los grupos fueron ampliamente similares, allí no hubo diferencias significativas en XXXXX, ver Tabla ". Entonces, …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.