Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

2
Aprendiendo de datos relacionales
Configuración Muchos algoritmos operan en una sola relación o tabla, mientras que muchas bases de datos del mundo real almacenan información en varias tablas (Domingos, 2003). Pregunta ¿Qué tipos de algoritmos aprenden bien de múltiples tablas (relacionales)? En particular, estoy interesado en los algoritmos que son aplicables a las tareas …

3
Cambio de signo al agregar una variable más en regresión y con una magnitud mucho mayor
Configuración básica: modelo de regresión: donde C es el vector de las variables de control.y=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy = \text{constant} +\beta_1x_1+\beta_2x_2+\beta_3x_3+\beta_4x_4+\alpha C+\epsilon Estoy interesado en y espero que y sean negativos. Sin embargo, hay un problema de multicolinealidad en el modelo, el coeficiente de correlación viene dado por, corr ( , 0.9345, corr …

1
Interpretación de los coeficientes de una interacción entre variable categórica y continua
Tengo una pregunta sobre la interpretación de los coeficientes de una interacción entre variable continua y categórica. Aquí está mi modelo: model_glm3=glm(cog~lg_hag+race+pdg+sex+as.factor(educa)+(lg_hag:as.factor(educa)), data=base_708) Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 21.4836 2.0698 10.380 < 2e-16 *** lg_hag 8.5691 3.7688 2.274 0.02334 * raceblack -8.4715 1.7482 -4.846 1.61e-06 *** racemexican …


1
¿Cómo debo normalizar los datos del sensor de mi acelerómetro?
Estoy trabajando con un gran conjunto de datos de acelerómetro recopilados con múltiples sensores usados ​​por muchos sujetos. Desafortunadamente, nadie aquí parece conocer las especificaciones técnicas de los dispositivos y no creo que hayan sido recalibrados. No tengo mucha información sobre los dispositivos. Estoy trabajando en mi tesis de maestría, …



1
Un paralelo entre LSA y pLSA
En el documento original de pLSA, el autor, Thomas Hoffman, establece un paralelismo entre las estructuras de datos de pLSA y LSA que me gustaría discutir con usted. Antecedentes: Inspirándose en la recuperación de información, supongamos que tenemos una colección de documentos y un vocabulario de términosNNND={d1,d2,....,dN}D={d1,d2,....,dN}D = \lbrace d_1, …

2
¿Distribuciones en subconjuntos de ?
Me pregunto si hay algún tipo de distribución estándar en subconjuntos de enteros . De manera equivalente, podríamos expresar esto como una distribución en un vector de longitud de resultados binarios, por ejemplo, si entonces corresponde al vector .{1,2,...,J}{1,2,...,J}\{1, 2, ..., J\}JJJJ=5J=5J = 5{1,3,5}{1,3,5}\{1, 3, 5\}(1,0,1,0,1)(1,0,1,0,1)(1, 0, 1, 0, 1) …


4
Cómo trazar 20 años de datos diarios en series de tiempo
Tengo el siguiente conjunto de datos: https://dl.dropbox.com/u/22681355/ORACLE.csv y me gustaría trazar los cambios diarios en 'Abrir' por 'Fecha', así que hice lo siguiente: oracle <- read.csv(file="http://dl.dropbox.com/u/22681355/ORACLE.csv", header=TRUE) plot(oracle$Date, oracle$Open, type="l") y me sale lo siguiente: Obviamente, esta no es la mejor trama, así que me pregunto cuál es el método …

3
PCA, ICA y mapas propios laplacianos
Estoy muy interesado en el método de mapas propios de Laplacia. Actualmente, lo estoy usando para reducir la dimensión de mis conjuntos de datos médicos. Sin embargo, me he encontrado con un problema al usar el método. Por ejemplo, tengo algunos datos (señales de espectros), puedo usar PCA (o ICA) …
9 pca  ica 

1
Referencias estadísticas frecuentes para alguien bien versado en la teoría de probabilidad moderna
Con una formación rigurosa en análisis y teoría de probabilidad moderna, las estadísticas bayesianas son sencillas y fáciles de entender, y las estadísticas frecuentes son increíblemente confusas y poco intuitivas. Parece que los frecuentistas realmente están haciendo estadísticas bayesianas, excepto con "antecedentes secretos" que no están bien motivados o cuidadosamente …

1
Intervalos de confianza y predicción del modelo de regresión lineal.
Bien, entonces estoy tratando de entender la regresión lineal. Tengo un conjunto de datos y todo parece estar bien, pero estoy confundido. Este es mi modelo-resumen lineal: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: 0 …
9 r  regression 


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.