Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

4
Dado un tamaño de muestra suficientemente grande, una prueba siempre mostrará un resultado significativo a menos que el tamaño del efecto verdadero sea exactamente cero. ¿Por qué?
Tengo curiosidad acerca de una afirmación hecha en el artículo de Wikipedia sobre el tamaño del efecto . Específicamente: [...] una comparación estadística no nula siempre mostrará resultados estadísticamente significativos a menos que el tamaño del efecto de la población sea exactamente cero No estoy seguro de lo que esto …


2
El límite del estimador de regresión de cresta "unidad-varianza" cuando
Considere la regresión de cresta con una restricción adicional que requiere que tenga una unidad de suma de cuadrados (equivalente, varianza de unidad); si es necesario, se puede suponer que tiene una unidad de suma de cuadrados: Yy^y^\hat{\mathbf y}yy\mathbf y β^∗λ=argmin{∥y−Xβ∥2+λ∥β∥2}s.t.∥Xβ∥2=1.β^λ∗=arg⁡min{‖y−Xβ‖2+λ‖β‖2}s.t.‖Xβ‖2=1.\hat{\boldsymbol\beta}_\lambda^* = \arg\min\Big\{\|\mathbf y - \mathbf X \boldsymbol \beta\|^2+\lambda\|\boldsymbol\beta\|^2\Big\} \:\:\text{s.t.}\:\: …

1
t-SNE versus MDS
He estado leyendo algunas preguntas sobre t-SNE ( t-Distributed Stochastic Neighbor Embedded ) últimamente, y también visité algunas preguntas sobre MDS ( Multidimensional Scaling ). A menudo se usan de manera análoga, por lo que parecía una buena idea hacer esta pregunta, ya que aquí hay muchas preguntas sobre ambas …

2
¿Cuándo debemos discretizar / bin variables / características continuas independientes y cuándo no?
¿Cuándo debemos discretizar / bin variables / características independientes y cuándo no? Mis intentos de responder la pregunta: En general, no debemos bin, porque binning perderá información. El binning en realidad aumenta el grado de libertad del modelo, por lo que es posible causar un ajuste excesivo después del binning. …


4
¿Se pueden utilizar los algoritmos de Machine Learning o Deep Learning para "mejorar" el proceso de muestreo de una técnica MCMC?
Basado en el poco conocimiento que tengo sobre los métodos MCMC (Markov chain Monte Carlo), entiendo que el muestreo es una parte crucial de la técnica antes mencionada. Los métodos de muestreo más utilizados son Hamiltonian y Metropolis. ¿Hay alguna manera de utilizar el aprendizaje automático o incluso el aprendizaje …





2
Impulsar redes neuronales
Hace poco, estaba trabajando en el aprendizaje de algoritmos de refuerzo, como adaboost, aumento de gradiente, y he sabido que el árbol de aprendizaje débil más utilizado es el árbol. Realmente quiero saber si hay algunos ejemplos recientes exitosos (me refiero a algunos artículos o artículos) para usar redes neuronales …



1
Conjuntos de datos tipo Anscombe con el mismo cuadro y gráfico de bigotes (media / estándar / mediana / MAD / min / máx.)
EDITAR: como esta pregunta se ha inflado, un resumen: encontrar diferentes conjuntos de datos significativos e interpretables con las mismas estadísticas mixtas (media, mediana, rango medio y sus dispersiones asociadas y regresión). El cuarteto Anscombe (ver ¿ Propósito de visualizar datos de alta dimensión? ) Es un famoso ejemplo de …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.