Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.




2
Constante de normalización en el teorema de Bayes
Pr(data)Pr(data)\Pr(\textrm{data}) Pr(parameters∣data)=Pr(data∣parameters)Pr(parameters)Pr(data)Pr(parameters∣data)=Pr(data∣parameters)Pr(parameters)Pr(data)\Pr(\text{parameters} \mid \text{data}) = \frac{\Pr(\textrm{data} \mid \textrm{parameters}) \Pr(\text{parameters})}{\Pr(\text{data})} se llama una constante de normalización . ¿Qué es exactamente? ¿Cual es su propósito? ¿Por qué se ve como ? ¿Por qué no depende de los parámetros?Pr(data)Pr(data)\Pr(data)

4
Actualización eficiente de la regresión lineal al agregar observaciones y / o predictores en R
Me interesaría encontrar formas en R para actualizar eficientemente un modelo lineal cuando se agrega una observación o un predictor. biglm tiene una capacidad de actualización al agregar observaciones, pero mis datos son lo suficientemente pequeños como para residir en la memoria (aunque tengo una gran cantidad de instancias para …


5
¿Hay más en la probabilidad que el bayesianismo?
Como estudiante de física, he experimentado la conferencia "Por qué soy bayesiano" tal vez media docena de veces. Siempre es lo mismo: el presentador explica con aire de suficiencia cómo la interpretación bayesiana es superior a la interpretación frecuentista supuestamente empleada por las masas. Mencionan la regla de Bayes, marginación, …

4
Selección de penalización óptima para lazo
¿Hay resultados analíticos o documentos experimentales con respecto a la elección óptima del coeficiente del término de penalización ℓ1ℓ1\ell_1 ? Por óptimo , me refiero a un parámetro que maximiza la probabilidad de seleccionar el mejor modelo, o que minimiza la pérdida esperada. Pregunto porque a menudo no es práctico …

2
Aplicando regresión logística con baja tasa de eventos
Tengo un conjunto de datos en el que la tasa de eventos es muy baja (40,000 de ). Estoy aplicando regresión logística en esto. He tenido una discusión con alguien donde se descubrió que la regresión logística no daría una buena matriz de confusión en datos de tan baja tasa …
15 logistic 

2
Cómo calcular la varianza de una partición de variables
Estoy ejecutando un experimento en el que estoy reuniendo muestras (independientes) en paralelo, calculo la varianza de cada grupo de muestras y ahora quiero combinar todo para encontrar la varianza total de todas las muestras. Me está costando encontrar una derivación para esto, ya que no estoy seguro de la …
15 variance 

3
CDF elevado a un poder?
Si FZFZF_Z es un CDF, parece que FZ(z)αFZ(z)αF_Z(z)^\alpha ( α > 0α>0 0\alpha \gt 0 ) también es un CDF. P: ¿Es este un resultado estándar? P: ¿Hay una buena manera de encontrar una función ggg con X≡g(Z)X≡g(Z)X \equiv g(Z) st FX(x)=FZ(z)αFX(x)=FZ(z)αF_X(x) = F_Z(z)^\alpha , donde x≡g(z)x≡g(z) x \equiv g(z) …

3
¿Cómo trazar la salida de datos de la agrupación?
Intenté agrupar un conjunto de datos (un conjunto de marcas) y obtuve 2 grupos. Me gustaría representarlo gráficamente. Poco confundido acerca de la representación, ya que no tengo las coordenadas (x, y). También buscando la función MATLAB / Python para hacerlo. EDITAR Creo que publicar datos aclara la pregunta. Tengo …




Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.