Issue 74 — 2026-08-05
DeepSeek suelta V4-Flash, un nuevo modelo de IA open en Hugging Face
DeepSeek lanzó DeepSeek-V4-Flash-0731 en Hugging Face, un modelo del 31 de julio de su línea Flash. El modelo está disponible bajo una licencia open, lo que significa que desarrolladores, investigadores y cualquiera con una GPU puede bajarlo y correrlo localmente o en su propia infraestructura. Sin API keys, sin vendor lock-in.
Los modelos Flash de DeepSeek han estado ganando atención por rendir por encima de su peso — buen performance relativo al tamaño, lo que importa cuando estás corriendo en hardware de consumo o con presupuestos de compute ajustados. La versión del 31 de julio actualiza la familia Flash, aunque los benchmarks exactos y las mejoras no están detallados en las notas de lanzamiento.
Por qué nos importa: los modelos open le permiten a Brown y a fundadores Black, devs indie y orgs de la comunidad construir sin pagar el peaje de Big Tech — sin gatekeepers, sin rate limits, sin términos de servicio que puedan cambiar de la noche a la mañana.
El nuevo compilador de ML de Microsoft acelera modelos en CPUs y GPUs
Microsoft lanzó MSLK, un compilador que toma modelos de machine learning y los reescribe para que corran más rápido en cualquier hardware que tengas — CPUs, GPUs, lo que sea. La idea es sencilla: entrenas un modelo una vez, y luego MSLK se encarga de hacer que corra eficiente en tu máquina. Ya no más reescribir el mismo modelo cinco veces distintas para diferentes backends.
Lo que hace esto interesante es que las cargas de trabajo de ML están en todas partes ahora — desde motores de recomendación hasta las funciones de IA que se están integrando en apps cotidianas — y cada vez que despliegas un modelo, estás haciendo elecciones de hardware que afectan el costo y la velocidad. MSLK se coloca entre el modelo y el chip, optimizando la ruta de ejecución. Si estás corriendo inferencia a escala, esta es la clase de herramienta que silenciosamente ahorra dinero en cada request.
Por qué nos importa: mientras más rápido y barato corran estos modelos, más probable es que terminen en las herramientas que usamos todos los días, y menos pagamos por el compute que los hace funcionar.
Qué es el system prompt — y por qué le importa a la migra app
Todo modelo de IA tiene dos partes. Una es lo que le dices — el user prompt. La otra es el system prompt, las instrucciones que nadie ve pero que le dicen al modelo cómo comportarse antes de que le preguntes algo.
Imagina a tu primo que siempre está listo para ayudarte. Si lo mandas a una fiesta sin decirle qué hacer, te va a dar un desorden. Si le dices "sólo habla en español, sé directo, no inventes datos," y listo, ya sabes cómo va a responder.
El system prompt es esa primera instrucción. Las empresas lo usan para darle personalidad al chatbot, fijar límites, o darle contexto de su trabajo. Un bot de banco puede llevar un system prompt que le dice: "no des información médica, si el usuario pregunta sobre recetas, redirige a un profesional." Ese mensaje está ahí antes de que tú hables.
¿Por qué te importa?
Porque la mayoría de los bots que usas — el de tu banco, el de la app de la migra, el de la escuela — tienen un system prompt que define qué puede y qué no puede hacer. Y si quieres que un bot funcione bien para tu negocio, lo que escribes en ese primer mensaje define todo el resto.
Tip: Si estás probando un bot para tu negocio, abre el chat y hazle una pregunta que esté al borde de lo que debería responder. La forma en que se porta es el system prompt hablando por ti.
la calidad tiene que dar dinero o no existe
— benn.substack.com
#quality-has-to-make-money-or-it-doesn-t-exist-b441f0Apple por fin deja que el iPhone copie y pegue en Windows
Apple lanzó una función que te permite copiar texto en tu iPhone y pegarlo directamente en Windows — sin carpetas compartidas, sin trucos de Bluetooth, sin dar vueltas. Ha sido un dolor de cabeza por años. La gente que usa ambas plataformas ha estado buscando soluciones desde…
IA bilingüe que maneja tus documentos — y tus datos
Tu distrito escolar, clínica comunitaria o programa del condado necesita una IA que de verdad funcione en el idioma que usa tu gente. No una que se queda en inglés a mitad de la conversación. No una que mande expedientes médicos sensibles a la nube pública.
BFTS Chat le da a tu organización su propio tenant con ocho herramientas diseñadas para esto: chat, análisis de documentos, borradores de IEP, helpdesk, becas, autorizaciones previas, SOPs y propuestas. Bilingüe por defecto. Español e inglés en el mismo hilo, sin necesidad de cambiar de idioma.
Puedes ejecutarlo con un cerebro on-prem en lugar de una API pública. Tus documentos se quedan donde deben estar.
Por qué nos importa:
La gente merece herramientas que manejen su idioma sin poner en riesgo sus datos ni la información de sus familias.
https://tools.brownforces.io
Anthropic investiga ciberataques con IA mientras Google persigue a Gemini en escritorio
Anthropic acaba de publicar un reporte sobre cómo maneja los ciberataques con IA — del tipo de amenazas que aparecen en los grupos de WhatsApp de los primos, las que le hacen perder plata a la gente. Están rastreando cómo los actores maliciosos están usando modelos de IA para…
Qwen 3.8 ya salió — más potencia open-weight de China
Qwen 3.8 ya salió. El último modelo de la línea Qwen de Alibaba es un modelo de IA open-weight, o sea que los pesos están disponibles públicamente en vez de estar escondidos detrás de un paywall. Los modelos open-weight le permiten a los devs, investigadores y equipos pequeños correr el modelo ellos mismos sin depender de la API de un solo vendor.
Qwen ha estado construyendo una presencia seria en open-source. La familia más amplia de Qwen se ha convertido en una de las alternativas más populares al Big Three en el espacio de IA de EE.UU., y este release añade otro escalón a esa escalera.
Por qué nos importa:
El empuje de IA de Canva: apenas un 1% del camino recorrido
Canva, la herramienta de diseño hecha para gente normal (no solo para diseñadores), todavía está viendo hacia dónde la lleva la IA.
La compañía ha estado armando funciones de IA — generación de imágenes, de texto a diseño, edición inteligente — y el veredicto de su propia…
GitHub lanza gh-stack para construir agentes de código
GitHub acaba de lanzar gh-stack, un framework para construir agentes de código — herramientas de IA que no solo escriben código, sino que lo corren, lo depuran y lo iteran. El stack junta tres piezas en una sola arquitectura: una ventana de contexto que lleva la cuenta de lo que el agente ha visto, una capa de integraciones para que pueda hablar con tus repos y terminales, y un motor de ejecución que le permite al agente hacer trabajo real en vez de solo generar texto.
La idea es sencilla. Ahora mismo, muchos asistentes de código son básicamente un autocompletado con más chamba. gh-stack quiere empujar más allá de eso dándole al agente el ciclo completo — leer, escribir, correr, depurar, repetir. Es open source, está diseñado para devs que quieren construir sus propios agentes en vez de depender de los de otro, y viene junto con las herramientas existentes de Copilot de GitHub.
Por qué nos importa: más agentes significa más herramientas para la gente que realmente escribe código día a día — y los que pueden construir los suyos terminan con una ventaja real sobre los que siguen esperando la próxima suscripción de SaaS.
GM y Ford están echando marcha atrás con los EVs
GM y Ford están mencionando vehículos eléctricos en sus llamadas de inversionistas trimestrales a tasas de antes de la pandemia, según datos nuevos de TechCrunch y Hudson Labs. Eso es un bajón fuerte comparado con los años pico cuando el tema de los EVs dominaba las llamadas…
El post de ingeniería de Spotify sobre indexar data lakes para queries rápidas
El blog de ingeniería de Spotify publicó un post sobre cómo indexar data lakes para hacer point queries — esas que normalmente requieren una capa de base de datos separada. La idea: puedes construir sobre almacenamiento barato y seguir obteniendo lookups en menos de un segundo si indexas bien.
Es parte del cambio más amplio hacia arquitecturas lakehouse — dejar atrás los data warehouses caros y tratar de correr todo sobre almacenamiento tipo S3 con indexación inteligente. La trade-off es real: almacenamiento más barato, pero tienes que resolver el problema de performance de queries tú mismo en vez de externalizarlo a un managed service.
Por qué nos importa: si tu equipo está ahogándose en costos de datos o queries lentas, este es un ángulo concreto que vale la pena revisar — y es un recordatorio de que las herramientas en las que confiamos están construidas por ingenieros que pasaron por el mismo dolor.