Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.


1
¿Por qué utilizamos la divergencia Kullback-Leibler en lugar de la entropía cruzada en la función objetivo t-SNE?
En mi opinión, la divergencia KL de la distribución de la muestra a la distribución verdadera es simplemente la diferencia entre entropía cruzada y entropía. ¿Por qué utilizamos la entropía cruzada para ser la función de costo en muchos modelos de aprendizaje automático, pero utilizamos la divergencia de Kullback-Leibler en …

5
LDA vs word2vec
Estoy tratando de entender cuál es la similitud entre la asignación de Dirichlet latente y word2vec para calcular la similitud de palabras. Según tengo entendido, LDA asigna palabras a un vector de probabilidades de temas latentes , mientras que word2vec las asigna a un vector de números reales (relacionado con …

4
Replicando la opción "robusta" de Stata en R
He estado tratando de replicar los resultados de la opción Stata robusten R. He utilizado el rlmcomando del paquete MASS y también el comando lmrobdel paquete "robustbase". En ambos casos, los resultados son bastante diferentes de la opción "robusta" en Stata. ¿Alguien puede sugerir algo en este contexto? Aquí están …




1
Rango en R - orden descendente [cerrado]
Estoy buscando clasificar datos que, en algunos casos, el valor más grande tiene el rango de 1. Soy relativamente nuevo en R, pero no veo cómo puedo ajustar esta configuración en la función de rango. x <- c(23,45,12,67,34,89) rank(x) genera: [1] 2 4 1 5 3 6 cuando quiero que …
39 r 




3
¿Por qué los árboles de decisión no son computacionalmente caros?
En Una introducción al aprendizaje estadístico con aplicaciones en R , los autores escriben que ajustar un árbol de decisión es muy rápido, pero esto no tiene sentido para mí. El algoritmo tiene que pasar por cada característica y particionarlo de todas las formas posibles para encontrar la división óptima. …
38 cart 

6
¿Por qué obtengo un árbol de decisión de precisión del 100%?
Estoy obteniendo una precisión del 100% para mi árbol de decisiones. ¿Qué estoy haciendo mal? Este es mi código: import pandas as pd import json import numpy as np import sklearn import matplotlib.pyplot as plt data = np.loadtxt("/Users/Nadjla/Downloads/allInteractionsnum.csv", delimiter=',') x = data[0:14] y = data[-1] from sklearn.cross_validation import train_test_split x_train …

4
Para trazar con R, ¿debería aprender ggplot2 o ggvis?
Para trazar con R, ¿debería aprender ggplot2 o ggvis? No necesariamente quiero aprender ambos si uno de ellos es superior en algún aspecto. ¿Por qué la comunidad R sigue creando nuevos paquetes con funcionalidades superpuestas? La publicación del blog de introducción no menciona una palabra de por qué se crea …


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.