turbopuffer v3: Vector DB का अंत, नया Storage Architecture

मूल शीर्षक: RIP, vector database

यह क्यों महत्वपूर्ण है

Vector database की पहचान छोड़कर general-purpose search और analytics engine बनने की यह कोशिश पूरे serverless database segment के लिए एक महत्वपूर्ण दिशा बदलाव है।

turbopuffer ने 30 सितंबर 2026 को घोषणा की कि वे अपना storage architecture पूरी तरह बदल रहे हैं। v3 में ANN vector index को primary index से हटाकर secondary index बनाया जाएगा। इससे text, regex, vector search के साथ-साथ GROUP BY और aggregation queries भी तेज़ होंगी।

turbopuffer ने अपने इंजीनियर Dan Harrison के ब्लॉग पोस्ट में खुलासा किया कि आने वाला v3 अपडेट कंपनी के storage architecture को जड़ से बदल देगा। अब तक ANN (Approximate Nearest Neighbor) vector index पूरे सिस्टम का केंद्र था — documents और indexes इसी के इर्द-गिर्द बने थे।

v1 में turbopuffer सिर्फ ID और vector स्टोर करता था। SPANN और बाद में SPFresh algorithm का उपयोग करके hierarchical clustering index बनाया गया, जो object storage के साथ बेहतर काम करता है। Cursor और Notion जैसे शुरुआती ग्राहकों ने इस approach को validate किया।

v2 में attribute filtering और full-text search जोड़ी गई। Linear जैसी कंपनियाँ इसे syncing engine के लिए उपयोग कर रही हैं — यानी सिर्फ vector search नहीं, बल्कि कई अन्य use cases भी सामने आए।

लेकिन vector-primary architecture की सीमाएँ अब साफ़ दिखने लगी हैं। GROUP BY और aggregation जैसे queries इस design में constrained रहे। इसलिए v3 में एक नया primary index लाया जा रहा है और ANN को 'just another secondary index' का दर्जा दिया जाएगा।

कंपनी का कहना है कि यह बदलाव न केवल search को तेज़ करेगा, बल्कि SQL queries को भी turbopuffer पर fast तरीके से चलाने की नींव रखेगा। turbopuffer ने यह प्रक्रिया खुले तौर पर share करने का फैसला किया है ताकि users इसका progress follow कर सकें।

स्रोत

turbopuffer.com — मूल लेख पढ़ें →