turbopuffer v3 : l'index vectoriel n'est plus le cœur
Original : RIP, vector database
Pourquoi c'est important
La spécialisation pure du vector DB cède place à une base polyvalente : signal fort pour le marché.
turbopuffer annonce une refonte majeure de son architecture de stockage avec la version 3. L'index ANN, jusqu'ici index primaire, devient un index secondaire parmi d'autres. Objectif : accélérer les recherches texte, regex et vectorielle, tout en supportant GROUP BY et les agrégations SQL.
Depuis son lancement, turbopuffer reposait sur un index ANN (Approximate Nearest Neighbor) comme pierre angulaire de son architecture. En v1, les documents n'étaient qu'un identifiant et un vecteur, organisés dans un index de clustering hiérarchique inspiré de SPANN puis SPFresh. En v2, le moteur a intégré la recherche full-text et le filtrage par attributs — des clients comme Cursor, Notion et Linear ont validé ces évolutions en production.
Pourtant, cette architecture « vector-first » montre ses limites : les requêtes GROUP BY et les agrégations restent contraintes par le fait que tout est adressé via l'index ANN. L'ingénieur Dan Harrison explique que l'équipe a « poussé cette architecture aussi loin que possible ».
Avec v3, turbopuffer introduit un nouvel index primaire généraliste, reléguant l'index ANN au rang d'index secondaire. La refonte touche la disposition des documents, l'écriture, la compaction et l'exécution des requêtes. L'équipe promet des gains de vitesse sur tous les types de recherche et ouvre la voie à davantage de requêtes SQL natives. turbopuffer diffuse publiquement sa progression sur cette migration.