Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

11
Recursos para aprender la cadena de Markov y los modelos ocultos de Markov
Estoy buscando recursos (tutoriales, libros de texto, webcast, etc.) para aprender sobre Markov Chain y HMM. Mi experiencia es como biólogo, y actualmente estoy involucrado en un proyecto relacionado con la bioinformática. Además, ¿cuáles son los conocimientos matemáticos necesarios que necesito para tener una comprensión suficiente de los modelos y …






3
¿Por qué la desviación estándar muestral es un estimador sesgado de
Según el artículo de Wikipedia sobre la estimación imparcial de la desviación estándar, la muestra SD s = 1n - 1∑i = 1norte( xyo- x¯¯¯)2---------------√s=1n−1∑i=1n(xi−x¯)2s = \sqrt{\frac{1}{n-1} \sum_{i=1}^n (x_i - \overline{x})^2} es un estimador sesgado de la DE de la población. Establece que .mi( s2--√) ≠ E( s2)-----√E(s2)≠E(s2)E(\sqrt{s^2}) \neq \sqrt{E(s^2)} …

9
¿Es incorrecto reformular "1 de cada 80 muertes es causada por un accidente automovilístico" ya que "1 de cada 80 personas muere como resultado de un accidente automovilístico?"
Declaración Uno (S1): "Una de cada 80 muertes es causada por un accidente automovilístico". Declaración Dos (S2): "Una de cada 80 personas muere como resultado de un accidente automovilístico". Ahora, personalmente no veo mucha diferencia entre estas dos declaraciones. Al escribir, los consideraría intercambiables para un público lego. Sin embargo, …

7
Retos de la industria contra Kaggle. ¿Es más importante recopilar más observaciones y tener acceso a más variables que el modelado elegante?
Espero que el título se explique por sí mismo. En Kaggle, la mayoría de los ganadores usan el apilamiento con a veces cientos de modelos base, para exprimir un porcentaje adicional de MSE, precisión ... En general, según su experiencia, cuán importante es el modelado sofisticado, como el apilamiento frente …



1
La regresión logística en R resultó en una separación perfecta (fenómeno de Hauck-Donner). ¿Ahora que?
Estoy tratando de predecir un resultado binario usando 50 variables explicativas continuas (el rango de la mayoría de las variables es a ). Mi conjunto de datos tiene casi 24,000 filas. Cuando corro en R, obtengo:−∞−∞-\infty∞∞\inftyglm Warning messages: 1: glm.fit: algorithm did not converge 2: glm.fit: fitted probabilities numerically 0 …

8
Bibliotecas R para aprendizaje profundo
Me preguntaba si hay buenas bibliotecas R para redes neuronales de aprendizaje profundo. Sé que está el nnet,, neuralnety RSNNS, pero ninguno de estos parece implementar métodos de aprendizaje profundo. Estoy especialmente interesado en el aprendizaje no supervisado seguido del aprendizaje supervisado y en el uso de la deserción escolar …


6
¿Es el "híbrido" entre los enfoques de Fisher y Neyman-Pearson para las pruebas estadísticas realmente una "mezcla incoherente"?
Existe una cierta escuela de pensamiento según la cual el enfoque más extendido para las pruebas estadísticas es un "híbrido" entre dos enfoques: el de Fisher y el de Neyman-Pearson; estos dos enfoques, según la afirmación, son "incompatibles" y, por lo tanto, el "híbrido" resultante es una "mezcla incoherente". Proporcionaré …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.