Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

4
Enmarcando la distribución binomial negativa para la secuenciación del ADN
La distribución binomial negativa se ha convertido en un modelo popular para los datos de recuento (específicamente el número esperado de lecturas de secuenciación dentro de una región dada del genoma de un experimento dado) en bioinformática. Las explicaciones varían: Algunos lo explican como algo que funciona como la distribución …

1
¿Cómo simular desde una cópula gaussiana?
Supongamos que tengo dos distribuciones marginales univariadas, digamos FFF y GGG , que puedo simular. Ahora, construya su distribución conjunta usando una cópula gaussiana , denotada C(F,G;Σ)C(F,G;Σ)C(F,G;\Sigma) . Todos los parámetros son conocidos. ¿Existe algún método que no sea MCMC para simular a partir de esta cópula?


3
Una estimación imparcial de la mediana
Supongamos que tenemos una variable aleatoria XXX admitida en [0,1][0,1][0,1] de la que podemos extraer muestras. ¿Cómo podemos llegar a una estimación imparcial de la mediana de XXX ? Por supuesto, podemos generar algunas muestras y tomar la mediana de la muestra, pero entiendo que, en general, esto no será …
16 sampling 


3
Estimando las probabilidades de transición de Markov a partir de datos de secuencia
Tengo un conjunto completo de secuencias (432 observaciones para ser precisos) de 4 estados : por ejemploA−DA−DA-D Y=⎛⎝⎜⎜⎜⎜AB⋮BCA⋮CDA⋮ADC⋮DBA⋮AA−⋮BC−⋮A⎞⎠⎟⎟⎟⎟Y=(ACDDBACBAACA−−⋮⋮⋮⋮⋮⋮⋮BCADABA)Y=\left(\begin{array}{c c c c c c c} A& C& D&D & B & A &C\\ B& A& A&C & A&- &-\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ B& C& A&D & A & B & A\\ \end{array}\right) EDITAR …

1
Definición y convergencia de mínimos cuadrados re ponderados iterativamente
He estado usando mínimos cuadrados iterativamente ponderados (IRLS) para minimizar las funciones de la siguiente forma, J(m)=∑Ni=1ρ(|xi−m|)J(m)=∑i=1Nρ(|xi−m|)J(m) = \sum_{i=1}^{N} \rho \left(\left| x_i - m \right|\right) donde NNN es el número de instancias de xi∈Rxi∈Rx_i \in \mathbb{R} , m∈Rm∈Rm \in \mathbb{R} es la estimación sólida que quiero, y ρρ\rho es una …

3
¿Qué significa Theta?
Soy un novato en las estadísticas y encontré esto . En estadística, θ, la letra griega minúscula 'theta', es el nombre usual para un (vector de) parámetro (s) de alguna distribución de probabilidad general. Un problema común es encontrar los valores de theta. Tenga en cuenta que no tiene ningún …


1
Valor esperado del log-determinante de una matriz Wishart
Sea , es decir, distribuido según una distribución dimensional de Wishart con media y grados de libertad . Me gustaría una expresión para dondeEs el determinante.E ( log | Λ | ) | Λ |Λ ∼ Wre( ν, Ψ )Λ∼Wre(ν,Ψ)\Lambda \sim \mathcal W_D(\nu, \Psi)D × Dre×reD \times DνΨνΨ\nu \Psiνν\numi( registroEl …

1
Expresión en forma cerrada para los cuantiles de
Tengo dos variables aleatorias, αi∼iid U(0,1),i=1,2αi∼iid U(0,1),i=1,2\alpha_i\sim \text{iid }U(0,1),\;\;i=1,2 dondeU(0,1)U(0,1)U(0,1) es la distribución uniforme 0-1. Entonces, estos producen un proceso, digamos: P(x)=α1sin(x)+α2cos(x),x∈(0,2π)P(x)=α1sin⁡(x)+α2cos⁡(x),x∈(0,2π)P(x)=\alpha_1\sin(x)+\alpha_2\cos(x), \;\;\;x\in (0,2\pi) Ahora, me preguntaba si hay una expresión de forma cerrada para F−1(P(x);0.75)F−1(P(x);0.75)F^{-1}(P(x);0.75) el cuantil teórico del 75 por ciento de P(x)P(x)P(x) para un determinado x∈(0,2π)x∈(0,2π)x\in(0,2\pi) - …



1
Proceso gaussiano: propiedades de aproximación de funciones
Estoy aprendiendo sobre el Proceso Gaussiano y solo he escuchado fragmentos. Realmente agradecería comentarios y respuestas. Para cualquier conjunto de datos, ¿es cierto que una aproximación de la función del Proceso Gaussiano daría un error de ajuste cero o insignificante en los puntos de datos? En otro lugar también escuché …

2
Medidas de heteroscedasticidad residual
Este enlace de wikipedia enumera una serie de técnicas para detectar la heterocedasticidad residual de OLS. Me gustaría saber qué técnica práctica es más eficiente en la detección de regiones afectadas por la heterocedasticidad. Por ejemplo, aquí la región central en la trama 'Residuals vs Fitted' de OLS tiene una …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.