Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

4
Kurtosis de distribución inventada
Hecha un vistazo a la imagen de abajo. La línea azul indica pdf normal estándar. Se supone que la zona roja es igual a la suma de las áreas grises (perdón por un dibujo horrible). Me pregunto ¿podemos crear una nueva distribución con un pico más alto al cambiar las …



2
Función de probabilidad de datos truncados
Tengo algunos problemas para comprender el concepto y la derivación de la probabilidad de datos truncados. Por ejemplo, si quiero encontrar la función de probabilidad basada en una muestra de una distribución, pero al tomar una muestra de la distribución, observo los valores truncados (donde hay un corte de , …


2
Modelo de factorización matricial para sistemas de recomendación ¿cómo determinar el número de características latentes?
Estoy tratando de diseñar una técnica de factorización matricial para un simple sistema de recomendación de calificación de elementos de usuario. Tengo 2 preguntas sobre esto. Primero, en una implementación simple que vi de la técnica de factorización matricial para la recomendación de películas, el autor acaba de inicializar las …

1
Probabilidades de regresión logística
He construido un modelo de regresión logística en R y, aunque el resultado parece ser satisfactorio hasta cierto punto, hay una pregunta que no he podido abordar. No estoy seguro de si mi enfoque es correcto. Sé que el propósito general del modelo logístico es predecir la probabilidad de éxito …


2
Cuando n aumenta, el valor t aumenta en una prueba de hipótesis, pero la tabla t es todo lo contrario. ¿Por qué?
La fórmula para en una prueba de hipótesis viene dada por: tttt=X¯−μσ^/n−−√.t=X¯−μσ^/n. t=\frac{\bar{X}-\mu}{\hat \sigma/\sqrt{n}}. Cuando aumenta, el valor aumenta de acuerdo con la fórmula anterior. Pero, ¿por qué disminuye el valor crítico en la tabla cuando (que es una función de ) aumenta?nnntttttttttdfdf\text{df}nnorten


2
Combinando valores p de diferentes pruebas estadísticas aplicadas a los mismos datos
Aunque el título de la pregunta parece trivial, me gustaría explicar que no es tan trivial en el sentido de que es diferente de la cuestión de aplicar la misma prueba estadística en conjuntos de datos similares para probar contra una hipótesis nula total (metaanálisis, por ejemplo, utilizando el método …

2
Ejemplos para una clase SVM en R
Estoy tratando de hacer SVM de una clase en R. He estado tratando de usar el paquete kernlab e1071 / ksvm. Pero no estoy seguro si lo estoy haciendo correctamente. ¿Hay algún ejemplo de trabajo para SVM de una clase en R? También, Estoy dando una gran matriz de predictores …
8 r  svm 


1
Visualización de datos longitudinales con resultado binario.
Para datos longitudinales con un resultado numérico, puedo usar diagramas de espagueti para visualizar los datos. Por ejemplo, algo como esto (tomado del sitio de estadísticas de UCLA): tolerance<-read.table("http://www.ats.ucla.edu/stat/r/faq/tolpp.csv",sep=",", header=T) head(tolerance, n=10) interaction.plot(tolerance$time, tolerance$id, tolerance$tolerance, xlab="time", ylab="Tolerance", legend=F) ¿Pero qué pasa si mi resultado es binario 0 o 1? Por …

3
Demostración del sesgo cuantil de muestra
Mientras hacía algunas simulaciones, me di cuenta de que el cuantil de la muestra es un estimador sesgado del verdadero cuantil. Y, según mis simulaciones, una potencialmente muy sesgada. Me sorprendió ese resultado ya que el CDF empírico no está sesgado, pero después de un poco de investigación en Internet, …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.