Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

1
Mapas autoorganizados versus kernel k-means
Para una aplicación, quiero agrupar datos (potencialmente de alta dimensión) y extraer la probabilidad de pertenecer a un clúster. Considero en este momento mapas autoorganizados o kernel k-means para hacer el trabajo. ¿Cuáles son los pros y los contras de cada clasificador para esta tarea? ¿Me estoy perdiendo otros algoritmos …



2
Buscando el 'codo' en los datos
La subitización es la enumeración rápida y precisa de las pantallas de baja numerosidad, que se distingue del conteo por una no linealidad aguda en la gráfica de tiempos de respuesta. A continuación se muestra una trama representativa, de Watson, DG, Maylor, EA y Bruce, LAM (2007). Observe que los …


1
¿Por qué usar bayesglm?
Mi pregunta general es: ¿por qué usar en bayesglmlugar de otros métodos de clasificación? Nota: Solo me interesa la predicción. Tengo una cantidad decente de datos (~ 100,000 obs). Siento que el tamaño de la muestra es lo suficientemente grande como para que los parámetros de una regresión logística regular …


2
Aproximando las cantidades relativas de monedas en Canadá
¿Sería posible aproximar con precisión las cantidades relativas de Loonies , Twoonies , cuartos, monedas de diez centavos, monedas de cinco centavos (y quizás el centavo descontinuado) en circulación simplemente obteniendo una muestra lo suficientemente grande de monedas a través del uso diario? Por uso diario, me refiero a las …



2
Generando variables aleatorias causalmente dependientes
Estoy tratando de generar conjuntos de variables aleatorias causalmente conectadas y comencé a hacer esto con un enfoque de Monte Carlo. La línea de base es un histograma medido bidimensional del que extraigo valores aleatorios. En mis ejemplos concretos, estas variables son la aceleración unaa\bf{a} y velocidad vv\bf{v} - obviamente …


3
¿Cómo realizar una clasificación de bosque aleatorio sin supervisión utilizando el código de Breiman?
Estoy trabajando con el código forestal aleatorio de Breiman ( http://stat-www.berkeley.edu/users/breiman/RandomForests/cc_manual.htm#c2 ) para la clasificación de datos satelitales (aprendizaje supervisado). Estoy usando un conjunto de datos de entrenamiento y prueba que tiene un tamaño de muestra de 2000 y un tamaño variable 10. Los datos se clasifican en dos clases, …



Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.