El nuevo Muse de Meta convierte texto en video — y el video aguanta
Meta lanzó un modelo nuevo llamado Muse que genera video a partir de un prompt de texto. Un prompt como "a woman walking through a foggy forest" te da un clip que mantiene a la misma mujer durante toda la duración. El modelo maneja movimientos de cámara y objetos múltiples — una carreta rodando frente a una casa, por ejemplo — sin la alucinación típica donde las extremidades se despegan o la gente se transforma entre sí.
No es solo una demo. Meta lo está desplegando para creadores de Facebook e Instagram gratis, y abriendo una API para developers. El gran salto respecto a intentos anteriores es la consistencia: los personajes no cambian de cara a mitad de plano, y el mundo no se disuelve cuando la cámara se mueve. El modelo está construido sobre la arquitectura Llama 4 y corre en los GPU clusters de Meta.
Por qué nos importa: el video se está volviendo la forma default de compartir, y las herramientas gratis que realmente producen clips coherentes le van a permitir a cualquiera — no solo a los estudios — hacer el tipo de video que detiene el scroll.
“El modelo maneja movimientos de cámara y objetos múltiples sin la alucinación típica donde las extremidades se despegan o la gente se transforma entre sí.”