Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

1
¿Debo elegir el regresor o clasificador Random Forest?
Encajo un conjunto de datos con una clase de destino binaria por el bosque aleatorio. En python, puedo hacerlo mediante randomforestclassifier o randomforestregressor. Puedo obtener la clasificación directamente de randomforestclassifier o podría ejecutar randomforestregressor primero y obtener un conjunto de puntajes estimados (valor continuo). Entonces puedo encontrar un valor de …


3
Utilice Holt-Winters o ARIMA?
Mi pregunta es sobre la diferencia conceptual entre Holt-Winters y ARIMA. Por lo que yo entiendo, Holt-Winters es un caso especial de ARIMA. Pero, ¿cuándo se prefiere un algoritmo sobre el otro? ¿Quizás Holt-Winters es incremental y, por lo tanto, sirve como un algoritmo en línea (más rápido)? Espero tener …





2
Estimador imparcial para el modelo AR (
Considere un modelo AR ( ) (suponiendo una media cero por simplicidad):ppp xt=φ1xt−1+…+φpxt−p+εtxt=φ1xt−1+…+φpxt−p+εt x_t = \varphi_1 x_{t-1} + \dotsc + \varphi_p x_{t-p} + \varepsilon_t Se sabe que el estimador OLS (equivalente al estimador condicional de máxima verosimilitud) para está sesgado, como se señaló en un hilo reciente .φ:=(φ1,…,φp)φ:=(φ1,…,φp)\mathbf{\varphi} := (\varphi_1,\dotsc,\varphi_p) …

1
¿Cómo interpretar el coeficiente de la segunda etapa en la regresión de variables instrumentales con un instrumento binario y una variable endógena binaria?
(publicación bastante larga, lo siento. Incluye mucha información de fondo, así que no dudes en pasar a la pregunta en la parte inferior). Introducción: estoy trabajando en un proyecto en el que intentamos identificar el efecto de una variable endógena binaria, , en un resultado continuo, y . Se nos …




2
Agrupación de datos de recuento muy sesgados: ¿alguna sugerencia para realizar (transformar, etc.)?
Problema básico Aquí está mi problema básico: estoy tratando de agrupar un conjunto de datos que contiene algunas variables muy sesgadas con recuentos. Las variables contienen muchos ceros y, por lo tanto, no son muy informativas para mi procedimiento de agrupación, que probablemente sea el algoritmo k-means. Bien, dices, simplemente …



Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.