Radar · 05/08/2026 · ocurrido el 03/08/2026 · investigación

Video-DeepResearch: los VLM aprenden a ver videos y buscar en la web

Un grupo de investigación liderado por Zhen Fang publicó en arXiv (4 de agosto de 2026) Video-DeepResearch (Video-DR), un framework que extiende los modelos vision-language de fotogramas estáticos a video continuo, combinado con búsqueda web abierta. El agente mira el video, identifica qué no sabe, y busca eso en la web.

El paper documenta dos defectos en los modelos actuales. El primero: el agente ignora las herramientas visuales y resuelve todo como texto. El segundo: responde desde la memoria interna en lugar de usar las herramientas. Video-DR impone un pipeline por etapas: primero mira los fotogramas, luego abre el navegador.

Los números que declara el paper: Video-DR-35B-A3B alcanza 64,0% de precisión en Video-DR-Bench (200 preguntas multi-salto creadas por el equipo), versus 59,0% de Claude-4.5-Sonnet, 52,5% de GPT-5 y 57,5% de Gemini 2.5 Pro. La variante más pequeña, 30B-A3B, llega a 59,3%, competitiva con Claude.

Por qué te importa. Si trabajas con contenido de video, la diferencia entre un modelo que describe lo que ve y uno que cruza lo que ve con fuentes externas es el salto entre un espectador y un investigador. Como contábamos el 4 de agosto, los VLM estaban aprendiendo a razonar sobre el espacio en lugar de solo describirlo. Video-DR desplaza esa misma frontera al video y la web.

El código está abierto en GitHub. Es investigación académica con un benchmark pequeño y resultados auto-reportados: la señal importa más que los números.

En detalle

Los modelos vision-language han avanzado rápidamente en texto e imágenes estáticas, pero el video sigue siendo un territorio difícil. Un video no es una secuencia de fotogramas independientes: es un flujo donde la información se distribuye en el tiempo, y una pregunta útil a menudo requiere conectar un detalle del minuto 3 con uno del minuto 47. Los VLM actuales tienden a muestrear pocos fotogramas y tratarlos como fotos separadas.

El problema de la memoria. Video-DR llama “parametric knowledge leakage” al fenómeno donde un modelo responde una pregunta sobre un video usando lo que ya sabe, sin realmente haber visto el contenido. Si preguntas qué marca de auto se ve en el video, el modelo puede adivinarlo desde la memoria en lugar de buscar el logo en los fotogramas. Este es un defecto estructural: el agente parece funcionar, pero por razones equivocadas.

El problema del sesgo modal. El agente tiene acceso a herramientas visuales (zoom, recorte, extracción de fotogramas) pero las ignora y busca todo como texto. Si le preguntas sobre un evento en el video, hace una búsqueda web en lugar de ver el video. Video-DR resuelve esto imponiendo un orden: la fase de percepción va primero, y las herramientas de búsqueda web se desbloquean solo después de que el agente ha examinado los fotogramas. Inspirándose en una arquitectura por etapas, el pipeline fuerza al modelo a “saber qué ha visto” antes de “buscar qué no sabe”.

La arquitectura. El framework tiene tres componentes. Un pipeline desacoplado que separa percepción y exploración. Un motor de datos que genera preguntas multi-salto diseñadas para no ser eludidas con la memoria paramétrica. Un entrenamiento en dos fases: primero supervised fine-tuning para enseñar patrones básicos, luego Group Relative Policy Optimization (GRPO, una forma de reinforcement learning) para permitir que el agente descubra patrones de uso de herramientas en lugar de copiarlos del conjunto de entrenamiento.

Los números en contexto. Video-DR-Bench tiene 200 instancias, creadas en colaboración humano-IA. Video-DR-35B-A3B (35 mil millones de parámetros totales, 3 mil millones activos en arquitectura MoE) alcanza 64,0%, superando a Claude-4.5-Sonnet por 5 puntos. La variante 30B-A3B llega a 59,3%, demostrando que el método funciona también a escala más compacta. Los números son declarados por el equipo en el paper del 4 de agosto de 2026.

Los límites. El benchmark es pequeño y construido por el mismo equipo que propone el método: conflicto de interés clásico en la evaluación. Las comparaciones con Claude, GPT-5 y Gemini se hacen en una configuración específica, y las condiciones de test para modelos propietarios no son transparentes. El framework es open source en GitHub, pero el entrenamiento requiere recursos significativos. La inferencia en un MoE de 35B es viable en hardware consumer solo con cuantización agresiva.

Qué queda abierto. Video-DR demuestra que el razonamiento sobre flujos de video es abordable con la arquitectura correcta, pero no resuelve la cuestión del costo. Procesar video continuo requiere mucha más compute que una única imagen, y el paper no mide el costo por consulta. Para quienes construyen productos sobre video, además de la precisión del agente importa cuánto cuesta cada respuesta.

Escribe para buscar en curso, playbooks, skills, papers…