Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.

3
¿Cómo reorganizar los datos 2D para obtener la correlación dada?
Tengo el siguiente conjunto de datos simple con dos variables continuas; es decir: d = data.frame(x=runif(100,0,100),y = runif(100,0,100)) plot(d$x,d$y) abline(lm(y~x,d), col="red") cor(d$x,d$y) # = 0.2135273 Necesito reorganizar los datos para que la correlación entre las variables sea ~ 0.6. Necesito mantener constantes las medias y otras estadísticas descriptivas (sd, min, …
9 r  correlation 

1
Estimación de ML de distribución exponencial (con datos censurados)
En el Análisis de supervivencia, se supone que el tiempo de supervivencia de un rv XyoXiX_i se distribuye exponencialmente. Considerando ahora que tengo "resultados" de iid rv's . De hecho, solo una parte de estos resultados está "plenamente realizada", es decir, las observaciones restantes aún están "vivas".X1, ... , xnortex1,…,xnx_1,\dots,x_nXyoXiX_i …


1
Intervalo de confianza para el efecto del tratamiento promedio de la ponderación de puntaje de propensión?
Estoy tratando de estimar el efecto promedio del tratamiento a partir de datos de observación utilizando la ponderación de puntaje de propensión (específicamente IPTW). Creo que estoy calculando el ATE correctamente, pero no sé cómo calcular el intervalo de confianza del ATE teniendo en cuenta los pesos del puntaje de …


1
¿Cómo evaluar la mediana de una población?
Tengo una muestra de 250 unidades. La distribución es asimétrica. Quiero probar una hipótesis de que la mediana de la población es diferente de 3.5, por lo que creo que una prueba de una muestra sería apropiada. Sé que la prueba de rango de Wilcoxon no es apropiada porque la …


2
¿El muestreo basado en la cadena de Markov es el "mejor" para el muestreo de Monte Carlo? ¿Hay esquemas alternativos disponibles?
Markov Chain Monte Carlo es un método basado en cadenas de Markov que nos permite obtener muestras (en un entorno de Monte Carlo) a partir de distribuciones no estándar de las que no podemos extraer muestras directamente. Mi pregunta es por qué la cadena de Markov es "lo último en …


1
Solución al ejercicio 2.2a.16 de "Estadísticas robustas: el enfoque basado en las funciones de influencia"
En la página 180 de Robust Statistics: el enfoque basado en las funciones de influencia, se encuentra la siguiente pregunta: 16: Demuestre que para estimadores invariantes de ubicación siempre ε∗≤12ε∗≤12\varepsilon^*\leq\frac{1}{2} . Encuentre el límite superior correspondiente en el punto de ruptura de la muestra finitaε∗nεn∗\varepsilon^*_n , ambos en el caso …

1
Interesante derivación de R al cuadrado
Hace años encontré esta identidad a través de la experimentación jugando con datos y transformaciones. Después de explicárselo a mi profesor de estadística, llegó a la siguiente clase con una prueba de una página usando notación vectorial y matricial. Lamentablemente perdí el papel que me dio. (Esto fue en 2007) …



2
Generar matriz definida positiva simétrica con un patrón de dispersión preespecificado
Estoy tratando de generar una matriz de correlación (psd simétrica) con una estructura de dispersión preespecificada (especificada por un gráfico en nodos). Los nodos que están conectados en el gráfico tienen correlación , el resto todos son 0 y la diagonal es 1.p×pp×pp\times ppppρ∼U(0,1)ρ∼U(0,1)\rho \sim U(0,1) He intentado generar esta …

3
Dimensión VC de un rectángulo
El libro "Introducción al aprendizaje automático" de Ethem Alpaydın afirma que la dimensión VC de un rectángulo alineado a ejes es 4. Pero, ¿cómo puede un rectángulo romper un conjunto de cuatro puntos colineales con puntos alternativos positivos y negativos? ¿Alguien puede explicar y probar la dimensión VC de un …

Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.