Estadísticas y Big Data

Preguntas y respuestas para personas interesadas en estadísticas, aprendizaje automático, análisis de datos, minería de datos y visualización de datos.



4
La diferencia de los núcleos en SVM?
¿Puede alguien decirme la diferencia entre los núcleos en SVM: Lineal Polinomio Gaussiano (RBF) Sigmoideo Porque, como sabemos, ese kernel se utiliza para asignar nuestro espacio de entrada al espacio de características de alta dimensionalidad. Y en ese espacio de características, encontramos el límite linealmente separable. ¿Cuándo se usan (bajo …

3
Distribución de productos escalares de dos vectores unitarios aleatorios en dimensiones
Si xx\mathbf{x} e yy\mathbf{y} son dos vectores unitarios aleatorios independientes en RDRD\mathbb{R}^D (distribuidos uniformemente en una esfera unitaria), ¿cuál es la distribución de su producto escalar (producto de puntos) x⋅yx⋅y\mathbf x \cdot \mathbf y ? DDDlimD→∞σ2(D)→0,limD→∞σ2(D)→0,\lim_{D\to\infty}\sigma^2(D) \to 0,σ2(D)σ2(D)\sigma^2(D) Actualizar Ejecuté algunas simulaciones rápidas. Primero, al generar 10000 pares de vectores …

4
Detección de valores atípicos utilizando desviaciones estándar
Siguiendo mi pregunta aquí , me pregunto si hay opiniones fuertes a favor o en contra del uso de la desviación estándar para detectar valores atípicos (por ejemplo, cualquier punto de datos que tenga más de 2 desviaciones estándar es un valor atípico). Sé que esto depende del contexto del …
27 outliers 


2
Estimaciones de varianza en k-fold cross-validation
La validación cruzada K-fold se puede utilizar para estimar la capacidad de generalización de un clasificador dado. ¿Puedo (o debería) también calcular una varianza agrupada de todas las ejecuciones de validación para obtener una mejor estimación de su varianza? Si no, ¿por qué? He encontrado documentos que usan la desviación …


3
¿El blanqueamiento siempre es bueno?
Un paso común de preprocesamiento para los algoritmos de aprendizaje automático es el blanqueamiento de datos. Parece que siempre es bueno hacer el blanqueamiento, ya que des correlaciona los datos, lo que facilita el modelado. ¿Cuándo no se recomienda el blanqueamiento? Nota: me refiero a la descorrelación de los datos.





2
¿Cuál es la diferencia entre la varianza y el error cuadrático medio?
Me sorprende que esto no se haya preguntado antes, pero no puedo encontrar la pregunta en stats.stackexchange. Esta es la fórmula para calcular la varianza de una muestra distribuida normalmente: ∑(X−X¯)2n−1∑(X−X¯)2n−1\frac{\sum(X - \bar{X}) ^2}{n-1} Esta es la fórmula para calcular el error cuadrático medio de las observaciones en una regresión …
27 variance  error 


Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.