duckdb ya hace IO asíncrono — ya no hay que esperar a la red
DuckDB lleva una capa de IO asíncrono que le permite leer archivos mientras hace números. En vez de un solo hilo chupando un archivo Parquet de 200 GB y bloqueando todo el proceso, el motor de consultas puede estar haciendo compute mientras el sistema de archivos busca el siguiente chunk. El resultado: scans más rápidos en cloud storage, y el tipo de paralelismo que normalmente requiere un orquestador entero, ahora dentro del motor de consultas.
Esto importa porque DuckDB ha sido la bestia silenciosa para los equipos de datos que querían Postgres sin el bloat o un warehouse sin la factura. El IO asíncrono era la última pieza que la frenaba — podía escribir rápido, pero leer desde S3, GCS o incluso SSDs locales se estancaba el hilo. Ahora lee por delante, solapa IO con computación, y mantiene la CPU alimentada. El efecto práctico es que un DuckDB de nodo único puede manejar cargas de trabajo que antes requerían un cluster.
Por qué nos importa: la gente que trabaja con datos — en la oficina, en el side hustle, even en el taller — ya no necesita un data warehouse de $5,000 al mes para queries medianas. DuckDB sigue siendo gratis y ahora se mueve más rápido con lo que ya tiene.
“El tipo de paralelismo que normalmente requiere un orquestador entero, ahora dentro del motor de consultas.”