Ciencia de los datos

Preguntas y respuestas para profesionales de la ciencia de datos, especialistas en aprendizaje automático y aquellos interesados ​​en aprender más sobre el campo


2
Agrupación de sindicatos en gráficos bipartitos?
Estoy tratando de encontrar una buena (y rápida) solución al siguiente problema: Tengo dos modelos con los que estoy trabajando, llamémosles jugadores y equipos. Un jugador puede estar en varios equipos y un equipo puede tener varios jugadores). Estoy trabajando en la creación de un elemento de interfaz de usuario …
8 graphs 



2
¿Cómo construir un motor de búsqueda textual?
Tengo una cadena HTML y quiero saber si una palabra que proporciono es relevante en esa cadena. La relevancia podría medirse según la frecuencia en el texto. Un ejemplo para ilustrar mi problema: this is an awesome bike store bikes can be purchased online. the bikes we own rock. check …

1
Error de R al usar el paquete tm (minería de texto)
Estoy intentando usar el paquete tm para convertir un vector de cadenas de texto en un elemento de corpus. Mi código se parece a esto Corpus(d1$Yes) donde d1$Yeses un factor con 124 niveles, cada uno con una cadena de texto. Por ejemplo, d1$Yes[246] = "So we can get the boat …
8 r  text-mining 





3
Matriz de puntuación de similitud de cadena
Tengo una carga de documentos, que tienen una carga de pares de valores clave en ellos. Es posible que la clave no sea única, por lo que puede haber varias claves del mismo tipo con valores diferentes. Quiero comparar la similitud de las claves entre 2 documentos. Más específicamente, la …

4
Tutorial de aprendizaje automático en línea
¿Alguien sabe algunos buenos tutoriales sobre técnicas de aprendizaje automático en línea? Es decir, cómo se puede usar en entornos en tiempo real, cuáles son las diferencias clave en comparación con los métodos normales de aprendizaje automático, etc. UPD: Gracias a todos por las respuestas, por "en línea" me refiero …

1
Error en cascada en la tormenta de Apache
Revisando la presentación y el material de Summingbird por Twitter, una de las razones que se mencionan para usar los clústeres de Storm y Hadoop juntos en Summingbird es que el procesamiento a través de Storm produce una cascada de errores. Para evitar esta cascada de errores y su acumulación, …



Al usar nuestro sitio, usted reconoce que ha leído y comprende nuestra Política de Cookies y Política de Privacidad.
Licensed under cc by-sa 3.0 with attribution required.