Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


2
Identificación de preguntas inútiles de un cuestionario.
Estoy desarrollando un cuestionario. Para mejorar su fiabilidad y validez, quiero utilizar métodos estadísticos. Quiero eliminar preguntas cuyas respuestas son siempre las mismas. Esto significa que casi todos los participantes dieron las mismas respuestas a esas preguntas. Ahora mis preguntas son: ¿Cuál es el término técnico para preguntas tan inútiles …


4
¿Puede comparar diferentes métodos de agrupación en un conjunto de datos sin verdad básica mediante validación cruzada?
Actualmente, estoy tratando de analizar un conjunto de datos de documentos de texto que no tiene ninguna verdad fundamental. Me dijeron que puede usar la validación cruzada k-fold para comparar diferentes métodos de agrupación. Sin embargo, los ejemplos que he visto en el pasado utilizan una verdad fundamental. ¿Hay alguna …

1
Inversión de bayas
Tengo un gran conjunto de datos de mercado agregado sobre las ventas de vino en los EE. UU. Y me gustaría estimar la demanda de ciertos vinos de alta calidad. Estas cuotas de mercado se derivaron básicamente de un modelo de utilidad aleatorio de la forma , donde incluye las …

2
Estadísticas de pizza para las masas
Una breve entrada en el sitio web del NY Times proporciona los hechos y cifras del consumo de pizza en los Estados Unidos. Tengo un interés casual en cómo se usan (o abusan) las estadísticas para proporcionar información al público en general, y han surgido un par de preguntas basadas …

1
Calcule la probabilidad logarítmica "a mano" para la regresión generalizada de mínimos cuadrados no lineales (nlme)
Estoy tratando de calcular la probabilidad logarítmica de una regresión no lineal generalizada de mínimos cuadrados para la función optimizada por funcionan en el paquete R , usando la matriz de covarianza de varianza generada por distancias en un árbol filogenético asumiendo movimiento browniano ( del paquete). El siguiente código …




4
Supuestos de distribución residual de regresión
¿Por qué es necesario colocar el supuesto de distribución en los errores, es decir? yyo= Xβ+ ϵyoyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , con .ϵyo∼ N( 0 , σ2)ϵi∼N(0,σ2)\epsilon_{i} \sim \mathcal{N}(0,\sigma^{2}) Porque no escribir yyo= Xβ+ ϵyoyi=Xβ+ϵiy_i = X\beta + \epsilon_{i} , con ,yyo∼ N( Xβ^, σ2)yi∼N(Xβ^,σ2)y_i \sim \mathcal{N}(X\hat{\beta},\sigma^{2}) donde en …


1
¿Por qué la prueba F en modelos lineales gaussianos es más poderosa?
Y=μ+σGY=μ+σGY=\mu+\sigma Gμμ\muWWWGGGRnRn\mathbb{R}^nFFFH0:{μ∈U}H0:{μ∈U}H_0\colon\{\mu \in U\}U⊂WU⊂WU \subset Wf=ϕ(2logsupμ∈W,σ>0L(μ,σ|y)supμ∈U,σ>0L(μ,σ|y)).f=ϕ(2log⁡supμ∈W,σ>0L(μ,σ|y)supμ∈U,σ>0L(μ,σ|y)).f=\phi\left( 2\log \frac{\sup_{\mu \in W, \sigma>0} L(\mu, \sigma | y)}{\sup_{\mu \in U, \sigma>0} L(\mu, \sigma | y)} \right). ¿Cómo podemos saber que esta estadística proporciona la prueba más poderosa para (tal vez después de descartar casos particulares inusuales)? Esto no se deriva del teorema de …

3
Bayesiano vs MLE, problema de sobreajuste
En el libro PRML de Bishop, dice que el sobreajuste es un problema con la Estimación de máxima verosimilitud (MLE), y Bayesian puede evitarlo. Pero creo que el sobreajuste es un problema más sobre la selección del modelo, no sobre el método utilizado para hacer la estimación de parámetros. Es …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.