DeepSeek lanza Flash Vision, un modelo multimodal que compite en tareas de agente
The Decoder reporta que DeepSeek acaba de liberar un modelo nuevo llamado Flash Vision. Es un modelo multimodal experimental — toma texto e imágenes y devuelve texto. Lo que destaca es que rinde bien en benchmarks de agentes, que miden qué tan bien los modelos realmente hacen el trabajo en lugar de solo chatear amablemente.
Flash Vision se une a un campo lleno de modelos multimodales open. Lo que lo diferencia no es tanto la arquitectura sino el acceso: es open-weight, lo que significa que cualquiera puede correrlo sin pagar una API. Para equipos que ya tienen GPUs, eso es un ahorro de costos significativo. Para el resto, los pesos abiertos significan que pueden fine-tunear el modelo para sus propios casos de uso en lugar de estar atados a los precios y rate limits de un solo vendor.
Los benchmarks que menciona el artículo son benchmarks de agentes — tareas como planning, tool use, y workflows multi-paso. Ahí es donde los modelos cerrados tradicionalmente han tenido ventaja. Si un modelo open puede cerrar esa brecha, cambia la ecuación para cualquier equipo que esté evaluando proprietary versus open.
Por qué nos importa: los modelos open son la única pieza de infraestructura de IA que no te van a quitar un gobierno extranjero o un aumento de precio — y Flash Vision agrega otra opción a ese estante.
“Open-weight means you own the weights — you can run them, fine-tune them, or ship them to a server without asking permission.”