Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

2
Comprender el hash de funciones
Wikipedia proporciona el siguiente ejemplo al describir el hashing de características ; pero el mapeo no parece consistente con el diccionario definido Por ejemplo, todebe convertirse de 3acuerdo con el diccionario, pero está codificado como en su 1lugar. ¿Hay algún error en la descripción? ¿Cómo funciona el hashing de funciones? …



4
Implicaciones del debate actual sobre la significación estadística.
En los últimos años, varios académicos han planteado un problema perjudicial de las pruebas de hipótesis científicas, denominado "grado de libertad del investigador", lo que significa que los científicos deben tomar numerosas decisiones durante su análisis que sesgan hacia la búsqueda con un valor p <5%. Estas opciones ambiguas son, …


1
¿En qué implementaciones se requiere la escala variable de los árboles de decisión y la normalización (ajuste) de las variables (características)?
En muchos algoritmos de aprendizaje automático, el escalado de características (también conocido como escalado variable, normalización) es un paso de preprocesamiento común Wikipedia - Escalado de características - esta pregunta estaba cerrada Pregunta # 41704 - ¿Cómo y por qué funcionan la normalización y el escalado de características? Tengo dos …

1
Explicando los filtros de Kalman en modelos de espacio de estado
¿Cuáles son los pasos involucrados en el uso de filtros de Kalman en modelos de espacio de estado? He visto un par de formulaciones diferentes , pero no estoy seguro de los detalles. Por ejemplo, Cowpertwait comienza con este conjunto de ecuaciones: θt=Gtθt-1+wtyt=F′tθt+vtyt=Ft′θt+vty_{t} = F^{'}_{t}\theta_{t}+v_{t} θt=Gtθt−1+wtθt=Gtθt−1+wt\theta_{t} = G_{t}\theta_{t-1}+w_{t} donde y …



2
¿Es apropiado el ANOVA de dos vías?
Esta es la descripción de mi estudio. Estoy experimentando con tres plantas: A, B y C. Se supone que estas plantas reducen la glucosa en sangre para pacientes diabéticos. Quiero determinar cuál de estas tres plantas tiene un efecto más prolongado en la reducción de la glucosa en sangre después …



2
¿Tiene sentido calcular intervalos de confianza y probar hipótesis cuando hay datos disponibles de toda la población?
¿Tiene sentido calcular intervalos de confianza y probar hipótesis cuando hay datos disponibles de toda la población? En mi opinión, la respuesta es no, ya que podemos calcular con precisión los valores verdaderos de los parámetros. Pero entonces, ¿cuál es la proporción máxima de datos de la población original que …

6
Modelos flexibles e inflexibles en el aprendizaje automático.
Encontré una pregunta simple sobre la comparación de modelos flexibles (es decir, splines) frente a modelos inflexibles (por ejemplo, regresión lineal) en diferentes escenarios. La pregunta es: En general, ¿esperamos que el rendimiento de un método de aprendizaje estadístico flexible funcione mejor o peor que un método inflexible cuando: ¿El …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.