Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

11
Podcasts estadísticos
¿Cuáles son algunos podcasts relacionados con el análisis estadístico? He encontrado algunas grabaciones de audio de conferencias universitarias en iTunes U, pero no conozco ningún podcast estadístico. Lo más cercano que conozco es un podcast de investigación de operaciones The Science of Better . Toca cuestiones estadísticas, pero no es …
29 references 


3
¿Cómo realizar la regresión ortogonal (mínimos cuadrados totales) a través de PCA?
Siempre uso lm()en R para realizar una regresión lineal de en . Esa función devuelve un coeficiente tal queyyyXxxββ\betay= βx .y=βx.y = \beta x. Hoy aprendí sobre mínimos cuadrados totales y esa princomp()función (análisis de componentes principales, PCA) se puede utilizar para realizarla. Debería ser bueno para mí (más preciso). …


6
Procedimiento de selección variable para clasificación binaria.
¿Cuál es la selección de variables / características que prefiere para la clasificación binaria cuando hay muchas más variables / características que observaciones en el conjunto de aprendizaje? El objetivo aquí es discutir cuál es el procedimiento de selección de características que reduce mejor el error de clasificación. Podemos corregir …


6
Prueba de varianza finita?
¿Es posible probar la finitud (o existencia) de la varianza de una variable aleatoria dada una muestra? Como nulo, o bien {la varianza existe y es finita} o {la varianza no existe / es infinita} sería aceptable. Filosóficamente (y computacionalmente), esto parece muy extraño porque no debería haber diferencia entre …

3
¿Qué es un múltiple?
En la técnica de reducción de dimensionalidad, como el análisis de componentes principales, LDA, etc., a menudo se usa el término múltiple. ¿Qué es una variedad en términos no técnicos? Si un punto pertenece a una esfera cuya dimensión quiero reducir, y si hay un ruido y e no están …

1
¿Cuáles son las deficiencias del error de porcentaje absoluto medio (MAPE)?
El error porcentual absoluto medio ( mape ) es una medida de precisión o error común para series de tiempo u otras predicciones, MAPE=100n∑t=1n|At−Ft|At%,MAPE=100n∑t=1n|At−Ft|At%, \text{MAPE} = \frac{100}{n}\sum_{t=1}^n\frac{|A_t-F_t|}{A_t}\%, donde son reales y predicciones o predicciones correspondientes.AtAtA_tFtFtF_t El MAPE es un porcentaje, por lo que podemos compararlo fácilmente entre series, y las …
29 accuracy  mape 

1
Intervalo de predicción de Bootstrap
¿Existe alguna técnica de arranque disponible para calcular los intervalos de predicción para predicciones puntuales obtenidas, por ejemplo, de regresión lineal u otro método de regresión (k-vecino más cercano, árboles de regresión, etc.)? De alguna manera, siento que la forma a veces propuesta de simplemente reiniciar la predicción de puntos …

2
¿Por qué usar validación cruzada estratificada? ¿Por qué esto no daña el beneficio relacionado con la varianza?
Me han dicho que es beneficioso usar la validación cruzada estratificada, especialmente cuando las clases de respuesta no están equilibradas. Si un propósito de la validación cruzada es ayudar a explicar la aleatoriedad de nuestra muestra de datos de entrenamiento original, seguramente hacer que cada pliegue tenga la misma distribución …


4
Interpretación Pseudo-R2 de McFadden
Tengo un modelo de regresión logística binaria con un pseudo R cuadrado de McFadden de 0.192 con una variable dependiente llamada pago (1 = pago y 0 = sin pago). ¿Cuál es la interpretación de este pseudo R cuadrado? ¿Es una comparación relativa para modelos anidados (por ejemplo, un modelo …



Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.