Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


3
¿Cómo puedo estimar la probabilidad de que un miembro aleatorio de una población sea "mejor" que un miembro aleatorio de una población diferente?
Supongamos que tengo muestras de dos poblaciones distintas. Si mido cuánto tiempo le toma a cada miembro hacer una tarea, puedo estimar fácilmente la media y la varianza de cada población. Si ahora planteo una combinación aleatoria con un individuo de cada población, ¿puedo estimar la probabilidad de que el …

1
¿Cómo trazar una función de escalones con ggplot?
Bloqueado . Esta pregunta y sus respuestas están bloqueadas porque la pregunta está fuera de tema pero tiene un significado histórico. Actualmente no acepta nuevas respuestas o interacciones. Tengo el gráfico como este: El código R para generarlo es: DF <- data.frame(date = as.Date(runif(100, 0, 800),origin="2005-01-01"), outcome = rbinom(100, 1, …




1
¿Cómo configurar e interpretar los contrastes ANOVA con el paquete del automóvil en R?
Digamos que tengo un simple experimento factorial 2x2 en el que quiero hacer ANOVA. Así, por ejemplo: d <- data.frame(a=factor(sample(c('a1','a2'), 100, rep=T)), b=factor(sample(c('b1','b2'), 100, rep=T))); d$y <- as.numeric(d$a)*rnorm(100, mean=.75, sd=1) + as.numeric(d$b)*rnorm(100, mean=1.2, sd=1) + as.numeric(d$a)*as.numeric(d$b)*rnorm(100, mean=.5, sd=1) + rnorm(100); En ausencia de una interacción significativa, por defecto (es decir, …
15 r  anova  contrasts 

2
¿Qué es un 'método para pasar mensajes'?
Tengo un vago sentido de lo que es un método de paso de mensajes: un algoritmo que construye una aproximación a una distribución construyendo iterativamente aproximaciones de cada uno de los factores de la distribución condicional a todas las aproximaciones de todos los demás factores. Creo que ambos son ejemplos …


1
¿Cómo funciona la normalización cuantil?
En los estudios de expresión génica que utilizan microarrays, los datos de intensidad deben normalizarse para poder comparar las intensidades entre individuos, entre genes. Conceptualmente y algorítmicamente, ¿cómo funciona la "normalización de cuantiles" y cómo se lo explicaría a un no estadístico?


1
¿Cuáles son los pros y los contras de aprender sobre una distribución algorítmicamente (simulaciones) versus matemáticamente?
¿Cuáles son los pros y los contras de aprender sobre las propiedades de una distribución algorítmicamente (a través de simulaciones por computadora) versus matemáticamente? Parece que las simulaciones por computadora pueden ser un método de aprendizaje alternativo, especialmente para aquellos estudiantes nuevos que no se sienten fuertes en el cálculo. …

2
Kullback – Leibler divergencia entre dos distribuciones gamma
Optar por parametrizar la distribución gamma Γ ( b , c )Γ(si,C)\Gamma(b,c) por el pdf g(x;b,c)=1Γ(c)xc−1bce-x/bg(x;b,c)=1Γ(c)Xc-1siCmi-X/ /sig(x;b,c) = \frac{1}{\Gamma(c)}\frac{x^{c-1}}{b^c}e^{-x/b} La divergencia Kullback-Leibler entreΓ(bq,cq)Γ(bq,cq)\Gamma(b_q,c_q)yΓ(bp,cp)Γ(bp,cp)\Gamma(b_p,c_p)viene dada por [1] como KLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−logbq−cq−logΓ(cq)+logΓ(cp)+cplogbp−(cp−1)(Ψ(cq)+logbq)+bqcqbpKLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−log⁡bq−cq−log⁡Γ(cq)+log⁡Γ(cp)+cplog⁡bp−(cp−1)(Ψ(cq)+log⁡bq)+bqcqbp\begin{align} KL_{Ga}(b_q,c_q;b_p,c_p) &= (c_q-1)\Psi(c_q) - \log b_q - c_q - \log\Gamma(c_q) + \log\Gamma(c_p)\\ &\qquad+ c_p\log b_p - (c_p-1)(\Psi(c_q) + \log b_q) + \frac{b_qc_q}{b_p} …


8
Cómo NO usar estadísticas
Esta es una especie de pregunta abierta pero quiero ser claro. Dada una población suficiente, es posible que pueda aprender algo (esta es la parte abierta) pero, sea lo que sea que aprenda sobre su población, ¿cuándo es aplicable a un miembro de la población? Por lo que entiendo de …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.