GitHub está armando una herramienta de búsqueda que lee todo tu codebase
GitHub Next publicó en silencio un paper sobre Knowledge Compressor, un modelo que digiere un repo entero y lo convierte en un embedding buscable. La idea es simple: en vez de escribir prompts que digan "busca en los archivos X, Y y Z", le pasas el repo y el modelo saca lo que necesita. No es un chatbot. Es una capa de retrieval encima de tu código.
La tooling está construida sobre la nueva plataforma de ejecución de Vercel, que te permite correr modelos bajo demanda sin gestionar GPUs. Levantas un container, le pasas el repo, y el modelo te devuelve sus hallazgos. Es ese tipo de infraestructura que usualmente se arma dentro de una sola compañía antes de que alguien más se dé cuenta.
El panorama grande es que todos están intentando resolver el mismo problema: ¿cómo haces que un AI lea tu codebase sin que tengas que escribir cincuenta líneas de prompt engineering? La respuesta hasta ahora es embeddings más búsqueda. Knowledge Compressor es solo una versión de eso, pero es el tipo de cosa que va a aparecer en Copilot, Cursor y lo que venga después.
Por qué nos importa: si tu shop todavía está pagándole a un ingeniero para que lea código y responda una pregunta simple, esta herramienta es un paso más hacia hacer eso cosa del pasado — y los que la agarran primero son los que terminan haciendo las preguntas más difíciles sobre sus repos.
“La respuesta hasta ahora es embeddings más búsqueda.”