Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.




1
Obtener vectores de cointegración utilizando el método de Johansen
Estoy tratando de entender mejor el método de Johansen, así que desarrollé un ejemplo 3.1 dado por el libro Likelihood-Based-Inference-Cointegrated-Autoregressive-Econometrics donde tenemos tres procesos: X1t=∑i=1tϵ1i+ϵ2tX1t=∑i=1tϵ1i+ϵ2tX_{1t} = \sum_{i=1}^t \epsilon_{1i} + \epsilon_{2t} X2t=α∑i=1tϵ1i+ϵ3tX2t=α∑i=1tϵ1i+ϵ3t X_{2t} = \alpha \sum_{i=1}^t \epsilon_{1i} + \epsilon_{3t} X3t=ϵ4tX3t=ϵ4t X_{3t} = \epsilon_{4t} entonces los vectores de cointegración deberían ser [a, …

4
Cálculo de precisión del pronóstico
Estamos utilizando STL (implementación R) para pronosticar datos de series temporales. Todos los días hacemos pronósticos diarios. Nos gustaría comparar los valores de pronóstico con valores reales e identificar la desviación promedio. Por ejemplo, ejecutamos el pronóstico para mañana y obtuvimos puntos de pronóstico, nos gustaría comparar estos puntos de …

4
¿Se puede usar la prueba de Mann-Whitney para comparaciones post-hoc después de Kruskal-Wallis?
Tengo una simulación en la que un animal se coloca en un entorno hostil y se cronometra para ver cuánto tiempo puede sobrevivir usando algún enfoque de supervivencia. Hay tres enfoques que puede usar para sobrevivir. Ejecuté 300 simulaciones del animal usando cada enfoque de supervivencia. Todas las simulaciones tienen …


1
¿Por qué tiene que proporcionar un modelo de variograma cuando está kriging?
Soy muy nuevo en estadísticas espaciales y veo muchos tutoriales, Pero realmente no entiendo por qué tiene que proporcionar un modelo de variograma cuando realiza la corrección. Estoy usando el paquete gstat en R, y este es el ejemplo que dan: library(sp) data(meuse) coordinates(meuse) = ~x+y data(meuse.grid) str(meuse.grid) gridded(meuse.grid) = …
9 spatial 


2
Agrupando datos ruidosos o con valores atípicos
Tengo datos ruidosos de dos variables como esta. x1 <- rep(seq(0,1, 0.1), each = 3000) set.seed(123) y1 <- rep (c(0.2, 0.8, 0.3, 0.9, 0.65, 0.35,0.7,0.1,0.25, 0.3, 0.95), each = 3000) set.seed(1234) e1 = rnorm(length(x1), 0.07,0.07) set.seed(1223) e2 = rnorm(length(x1), 0.07,0.07) set.seed(1334) yn <- rnorm(20000, 0.5,0.9) set.seed(2344) xn <- rnorm(20000, 0.5,0.9) …

1
Estandarización de características cuando se usa LDA como paso de preprocesamiento
Si se usa un Análisis discriminante lineal de varias clases (o también leo Análisis discriminante múltiple a veces) para la reducción de dimensionalidad (o transformación después de la reducción de dimensionalidad a través de PCA), entiendo que, en general, una "normalización del puntaje Z" (o estandarización) de las características no …


1
Comprensión de la descomposición del valor singular en el contexto de LSI
Mi pregunta es generalmente sobre la descomposición del valor singular (SVD), y particularmente sobre la indexación semántica latente (LSI). Digamos que tengo que contiene frecuencias de 5 palabras para 7 documentos.UNAw o r d× do c u m e n tAword×document A_{word \times document} A = matrix(data=c(2,0,8,6,0,3,1, 1,6,0,1,7,0,1, 5,0,7,4,0,5,6, 7,0,8,5,0,8,5, …



Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.