Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


2
Ejemplos de minería de texto con R (paquete tm)
Pasé tres días incursionando tmdespués de leer un borrador de un amigo donde exploró un corpus de texto con UCINET, mostrando nubes de texto, gráficos de red de dos modos y descomposición de valor único (con gráficos, usando Stata). Me encontré con una gran cantidad de problemas: en Mac OS …
14 r  text-mining 


1
Cómo ajustar el suavizado en el modelo mgcv GAM
Estoy tratando de descubrir cómo controlar los parámetros de suavizado en un modelo mgcv: gam. Tengo una variable binomial que intento modelar principalmente como una función de las coordenadas xey en una cuadrícula fija, además de algunas otras variables con influencias menores. En el pasado, he construido un modelo de …
14 r  smoothing  mgcv 

3
o métricas para la agrupación?
¿Alguien usa las métricas o para la agrupación, en lugar de ? Aggarwal et al., Sobre el sorprendente comportamiento de las métricas de distancia en el espacio de alta dimensión, dijeron (en 2001) queL1L1L_1L.5L.5L_.5L2L2L_2 L1L1L_1 es consistentemente más preferible que la métrica de distancia euclidiana para aplicaciones de minería de …



2
Explicación intuitiva de la estacionariedad.
Estuve luchando con la estacionaria en mi cabeza por un tiempo ... ¿Es así como piensas al respecto? Cualquier comentario o pensamiento adicional será apreciado. El proceso estacionario es el que genera valores de series temporales de modo que la media de distribución y la varianza se mantienen constantes. Estrictamente …



7
¿Vale la pena modelar series cortas?
Aquí hay un poco de contexto. Estoy interesado en determinar cómo dos variables ambientales (temperatura, niveles de nutrientes) impactan el valor medio de una variable de respuesta durante un período de 11 años. Dentro de cada año, hay datos de más de 100k ubicaciones. El objetivo es determinar si, durante …

1
¿Cuándo querría usar AdaBoost?
Como he oído hablar del clasificador AdaBoost que se menciona repetidamente en el trabajo, quería tener una mejor idea de cómo funciona y cuándo uno podría usarlo. Continué y leí una serie de documentos y tutoriales que encontré en Google, pero hay aspectos del clasificador que todavía tengo problemas para …

1
Aleatorización y correlación en secuencias de baja discrepancia (Halton / Sobol)
Actualmente estoy trabajando en un proyecto donde genero valores aleatorios usando conjuntos de puntos de baja discrepancia / cuasialeatorios , como los conjuntos de puntos de Halton y Sobol. Estos son esencialmente vectores dimensionales que imitan una variable dimensional uniforme (0,1), pero tienen una mejor distribución. En teoría, se supone …



Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.