Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

1
¿Cuál es la conexión entre mínimos cuadrados parciales, regresión de rango reducido y regresión de componentes principales?
¿La regresión de rango reducido y la regresión de componentes principales son solo casos especiales de mínimos cuadrados parciales? Este tutorial (Página 6, "Comparación de objetivos") establece que cuando hacemos mínimos cuadrados parciales sin proyectar X o Y (es decir, "no parcial"), se convierte en regresión de rango reducido o …





2
La linealidad de la varianza.
Creo que las siguientes dos fórmulas son ciertas: Var(aX)=a2Var(X)Var(aX)=a2Var(X) \mathrm{Var}(aX)=a^2 \mathrm{Var}(X) mientras que a es un número constante Var(X+Y)=Var(X)+Var(Y)Var(X+Y)=Var(X)+Var(Y) \mathrm{Var}(X + Y)=\mathrm{Var}(X)+\mathrm{Var}(Y) siXXX ,YYY son independientes Sin embargo, no estoy seguro de lo que está mal con lo siguiente: Var(2X)=Var(X+X)=Var(X)+Var(X)Var(2X)=Var(X+X)=Var(X)+Var(X)\mathrm{Var}(2X) = \mathrm{Var}(X+X) = \mathrm{Var}(X) + \mathrm{Var}(X) que no es igual …

1
En la teoría del aprendizaje estadístico, ¿no hay un problema de sobreajuste en un conjunto de prueba?
Consideremos el problema de clasificar el conjunto de datos MNIST. Según la página web MNIST de Yann LeCun , 'Ciresan et al.' obtuvo una tasa de error del 0.23% en el conjunto de prueba MNIST usando la red neuronal convolucional. Denotemos el conjunto de entrenamiento MNIST como DtrainDtrainD_{train} , el …

1
Paquete R para bosque aleatorio ponderado? opción classwt?
Estoy tratando de usar Random Forest para predecir el resultado de un conjunto de datos extremadamente desequilibrado (la tasa de clase minoritaria es de solo 1% o incluso menos). Debido a que el algoritmo tradicional de bosque aleatorio minimiza la tasa de error general, en lugar de prestar especial atención …
16 r  random-forest 

3
¿Qué es exactamente una distribución?
Sé muy poco de probabilidad y estadística, y deseo aprender. Veo la palabra "distribución" utilizada en todo el lugar en diferentes contextos. Por ejemplo, una variable aleatoria discreta tiene una "distribución de probabilidad". Yo sé lo que es esto. Una variable aleatoria continua tiene una función de densidad de probabilidad, …


3
¿Por qué una estadística suficiente contiene toda la información necesaria para calcular cualquier estimación del parámetro?
Acabo de comenzar a estudiar estadísticas y no puedo obtener una comprensión intuitiva de la suficiencia. Para ser más precisos, no puedo entender cómo mostrar que los dos párrafos siguientes son equivalentes: Aproximadamente, dado un conjunto X de datos independientes distribuidos idénticamente condicionados en un parámetro desconocido θ, una estadística …





Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.