Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

3
MCMC para manejar problemas de probabilidad plana
Tengo una probabilidad bastante plana de que el muestreador Metropolis-Hastings se mueva a través del espacio de parámetros de forma muy irregular, es decir, no se puede lograr la convergencia sin importar los parámetros de distribución de la propuesta (en mi caso, es gaussiana). No hay una gran complejidad en …


2
PRESIONE la estadística para la regresión de cresta
En mínimos cuadrados ordinarios, regresando un vector objetivo yyy contra un conjunto de predictores XXX, la matriz del sombrero se calcula como H= X(XtX)- 1XtH=X(XtX)−1XtH = X (X^tX)^{-1} X^t y la PRENSA (suma residual de cuadrados prevista) se calcula mediante SSPAGS=∑yo(miyo1 -hyo i)2SSP=∑i(ei1−hii)2SS_P = \sum_i \left( \frac{e_i}{1-h_{ii}}\right)^2 dónde miyoeie_i es …

3
¿Puedo usar una variable que tenga una relación no lineal con la variable dependiente en la regresión logística?
Digamos que estoy construyendo un modelo de regresión logística donde la variable dependiente es binaria y puede tomar los valores. 0 000 o 111. Deje que las variables independientes seanX1,X2, . . . ,Xmetrox1,x2,...,xmx_1, x_2, ..., x_m - existen metrommvariables independientes. Digamos por elkkkEn la variable independiente, el análisis bivariado …


1
Imputación de una variable censurada
Tengo un conjunto de datos médicos con aproximadamente 200 variables. Una de las variables es un marcador biológico (concentración de una enzima particular). Su distribución es correcta, y el problema es que los valores por encima de cierto nivel están censurados / cortados en ese nivel. Entonces, mientras que la …

3
¿Es necesario reducir y descifrar datos de series temporales cuando se utilizan métodos de aprendizaje automático?
Por ejemplo: Quiero pronosticar valores futuros de una serie temporal basados ​​en valores previos de múltiples series temporales 'utilizando un ANN y / o SVM. Las entradas serán valores rezagados de cada serie de tiempo, y las salidas serán pronósticos de un paso adelante (los pronósticos con horizontes adicionales se …

4
Error cuadrático medio o error cuadrático medio
Como hablante de inglés no nativo, me preguntaba cuál de las expresiones cuadradas o cuadradas debería usar. Por ejemplo, en medio de la plaza de error o de media al cuadrado de error. Según Internet, parece que ambas formas se usan indistintamente. ¿Es una expresión más cuadrada que la otra?

1
Técnicas para el aprendizaje incremental en línea del clasificador en datos de flujo
¿Cuáles pueden ser buenas técnicas para enfrentar este problema abstracto? Tiene un flujo de datos de una señal continua, como uno de un sensor físico. Esa señal tiene valores reales (discretizados), sin atributo; Se pueden extraer características adictivas (p. ej., potencia, autocorrelación, entropía). Puede asignar una etiqueta de un conjunto …


2
Índice de aceptación en el algoritmo de Metrópolis-Hastings
En el algoritmo Metropolis – Hastings para muestrear una distribución objetivo, dejemos que: πiπi\pi_{i} sea ​​la densidad objetivo en el estado ,iii πjπj\pi_j sea ​​la densidad objetivo en el estado propuesto ,jjj hijhijh_{ij} sea ​​la densidad propuesta para la transición al estado dado el estado actual ,jjjiii aijaija_{ij} sea ​​la …



4
¿El mejor método para transformar la secuencia de baja discrepancia en distribución normal?
He estado usando secuencias de baja discrepancia durante un tiempo para Distribuciones uniformes, ya que he encontrado que sus propiedades son útiles (principalmente en gráficos de computadora por su apariencia aleatoria y su capacidad para cubrir densamente [0,1] de manera incremental). Por ejemplo, valores aleatorios arriba, valores de secuencia Halton …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.