Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

1
¿Qué significa la eficiencia gaussiana?
En el caso de estimadores robustos, ¿qué significa eficiencia gaussiana ? Por ejemplo, tiene un 82% de eficiencia gaussiana y un 50% de punto de ruptura.QnorteQnorteQ_{_n} La referencia es: Rousseeuw PJ y Croux, C. (1993). "Alternativas a la desviación media absoluta". J. American Statistical Assoc., 88, 1273-1283



3
Problemas de trampa variable ficticia
Estoy ejecutando una gran regresión OLS donde todas las variables independientes (alrededor de 400) son variables ficticias. Si se incluyen todos, existe una multicolinealidad perfecta (la trampa de variable ficticia), por lo que tengo que omitir una de las variables antes de ejecutar la regresión. Mi primera pregunta es, ¿qué …



3
¿Cuál es el significado de ?
¿Cuál es el significado de ∥a∥p=(∑ni=1|ai(t)|p)1p‖a‖p=(∑i=1n|ai(t)|p)1p\|a\|_p=\left(\sum _{i=1}^n \left|a_i(t)\right|{}^p\right){}^{\frac{1}{p}} ? Esta fórmula aparece en la quinta página de Un resumen de flujo de datos mejorado: el boceto Count-Min y sus aplicaciones (que se puede encontrar aquí ). Estoy implementando el boceto Count-Min y puedo entender los conceptos básicos muy bien, pero …


4
Dada una cadena 10D MCMC, ¿cómo puedo determinar sus modos posteriores en R?
Pregunta: Con una cadena MCMC de 10 dimensiones, digamos que estoy preparado para entregarle una matriz de los sorteos: 100,000 iteraciones (filas) por 10 parámetros (columnas), ¿cómo puedo identificar los modos posteriores? Me preocupan especialmente los modos múltiples. Antecedentes:Me considero un experto en informática, pero cuando un colega me hizo …

5
Omega al cuadrado para medir el efecto en R?
El libro de estadísticas que estoy leyendo recomienda omega al cuadrado para medir los efectos de mis experimentos. Ya probé usando un diseño de parcela dividida (mezcla de diseño dentro de los sujetos y entre sujetos) que mis factores dentro de los sujetos son estadísticamente significativos con p <0.001 y …

1
Salida del modelo logístico en R
Estoy tratando de interpretar el siguiente tipo de modelo logístico: mdl <- glm(c(suc,fail) ~ fac1 + fac2, data=df, family=binomial) ¿Es la salida de predict(mdl)las probabilidades de éxito esperadas para cada punto de datos? ¿Existe una manera simple de tabular las probabilidades para cada nivel de factor del modelo, en lugar …


1
Encuentra UMVUE de
Dejar que X1,X2,...,XnX1,X2,...,XnX_1, X_2, . . . , X_n iid variables aleatorias que tienen pdf fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)f_X(x\mid\theta) =\theta(1 +x)^{−(1+\theta)}I_{(0,\infty)}(x) donde θ>0θ>0\theta >0 . Dar el UMVUE de 1θ1θ\frac{1}{\theta} y calcula su varianza He aprendido acerca de dos métodos para obtener UMVUE: Límite inferior Cramer-Rao (CRLB) Lehmann-Scheffe Thereom Voy a intentar esto …


1
Ayuda a entender kNN para datos multidimensionales
Entiendo la premisa del algoritmo kNN para datos espaciales. Y sé que puedo extender ese algoritmo para usarlo en cualquier variable de datos continua (o datos nominales con Hamming Distance). Sin embargo, ¿qué estrategias se utilizan cuando se trata con datos de dimensiones superiores? Por ejemplo, supongamos que tengo una …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.