Google responde con Gemini Flash — un modelo más barato y rápido para el mundo real
Google lanzó Gemini Flash, un modelo más rápido y barato que el Gemini Pro que reemplaza, y va directo a los modelos open-source como Mistral y Llama que le han estado comiendo la cena. El modelo es 40% más rápido en producción y cuesta casi la mitad. Corre sobre una arquitectura de 8B parámetros — no los modelos masivos de 70B+ que todos persiguen — y está optimizado para el trabajo que realmente se entrega: chatbots, búsqueda, generación de imágenes, la faena diaria.
La historia real no está en las specs. Es el timing. Los modelos open-source han estado mejorando cada trimestre y son más baratos. Gemini Flash es la respuesta de Google — un modelo que no necesita vencer a GPT-5 en su propio juego, solo hacer el mismo trabajo más barato y rápido. Para la gente que corre APIs, hospeda sus propios modelos, o elige entre vendors: este es el tipo de jugada que mueve los precios sin que nadie se dé cuenta.
Por qué nos importa: Google está haciendo los modelos más baratos y rápidos para que las herramientas de las que dependemos — búsqueda, docs, Translate — no se ralenticen cuando estamos intentando hacer las cosas.
“No es el modelo más grande. Es el que realmente se entrega.”