Spotify está re-indexando su data lake para queries rápidas — y es lección para todos
El data lake de Spotify era un desastre: un bulto grande de archivos que uno podía vaciar adentro, pero las queries eran lentas. Para las búsquedas pequeñas — las que alimentan dashboards y APIs — eso era un problema. Así que el equipo de ingeniería reescribió la capa de indexación. El resultado: las point queries que antes tardaban segundos ahora terminan en milisegundos.
El truco está en el layout del índice. En vez de escanear todo el lake en cada lectura, el nuevo sistema mantiene un índice compacto en memoria. Los datos se quedan en el lake, pero el índice te dice exactamente dónde mirar. Es la misma idea que un catálogo de biblioteca: los libros no se mueven, pero los encuentras rápido.
Este es el tipo de trabajo de infraestructura que rara vez hace titulares pero que en silencio hace más rápido todo lo demás. Cada vez que re-indexan un data lake, la gente que lo usa se lleva un boost de velocidad sin tocar su código.
Por qué nos importa: cuando los sistemas de los que dependemos se vuelven más rápidos, todos nos movemos más rápido — ya lo notemos o no.
“Los libros no se mueven, pero los encuentras rápido.”