Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.



1
Usando la mediana para calcular la varianza
Tengo una variable aleatoria 1-D que es extremadamente sesgada. Para normalizar esta distribución, quiero usar la mediana en lugar de la media. mi pregunta es esta: ¿puedo calcular la varianza de la distribución usando la mediana en la fórmula en lugar de la media? es decir, puedo reemplazar Var(X)=∑[(Xi−mean(X))2]/nVar(X)=∑[(Xi−mean(X))2]/n \mathrm{Var}(X) …
10 variance  mean  median 

1
Bayes variadas combinadas con Monte Carlo
Estoy leyendo sobre Bayes variacional, y según tengo entendido, todo se reduce a la idea de que aproximas (donde son las variables latentes de tu modelo los datos observados) con una función , suponiendo que factoriza como donde es un subconjunto de las variables latentes. Entonces se puede demostrar que …



1
¿Es precisa esta interpretación de la escasez?
Según la documentación de la removeSparseTermsfunción del tmpaquete, esto es lo que implica la escasez: A term-document matrix where those terms from x are removed which have at least a sparse percentage of empty (i.e., terms occurring 0 times in a document) elements. I.e., the resulting matrix contains only terms …

6
¿Cómo se lee la notación ?
¿Cómo se lee la notación ? ¿Es sigue una distribución normal? ¿O es una distribución normal? O tal vez es aproximadamente normal ...XX∼N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2)XXX XXX XXX ¿Qué pasa si hay varias variables que siguen (o las palabras que sean) la misma distribución? Como se escribe

3
Identificación de características filtradas después de la selección de características con scikit learn
Aquí está mi Código para el método de selección de características en Python: from sklearn.svm import LinearSVC from sklearn.datasets import load_iris iris = load_iris() X, y = iris.data, iris.target X.shape (150, 4) X_new = LinearSVC(C=0.01, penalty="l1", dual=False).fit_transform(X, y) X_new.shape (150, 3) Pero después de obtener una nueva X (variable dependiente …




2
¿Qué es la bucketización?
He estado dando vueltas para encontrar una explicación clara de "bucketization" en el aprendizaje automático sin suerte. Lo que entiendo hasta ahora es que la bucketización es similar a la cuantificación en el procesamiento de señales digitales donde un rango de valores continuos se reemplaza con un valor discreto. ¿Es …


2
Diferencia entre PCA y agrupación espectral para un pequeño conjunto de muestras de características booleanas
Tengo un conjunto de datos de 50 muestras. Cada muestra se compone de 11 características booleanas (posiblemente correlacionadas). Me gustaría ver de alguna manera cómo visualizar estas muestras en una gráfica 2D y examinar si hay grupos / agrupaciones entre las 50 muestras. He intentado los siguientes dos enfoques: (a) …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.