DeepSeek का नया Vision मॉडल लॉन्च

मूल शीर्षक: DeepSeek-v4-flash-vision-exp

यह क्यों महत्वपूर्ण है

DeepSeek का Vision मॉडल multimodal AI क्षमताओं को OpenAI-compatible API के साथ प्रस्तुत करता है, जो डेवलपर्स के लिए इंटीग्रेशन को आसान बनाता है।

DeepSeek ने अपना नया मल्टीमोडल मॉडल 'deepseek-v4-flash-vision-exp' लॉन्च किया है, जो टेक्स्ट के साथ-साथ JPEG, PNG, GIF और WebP फॉर्मेट की इमेज को प्रोसेस कर सकता है। यह मॉडल OpenAI-compatible API के जरिए उपलब्ध है।

DeepSeek ने अपने API में नया Vision मॉडल 'deepseek-v4-flash-vision-exp' जोड़ा है। यह मॉडल इमेज और टेक्स्ट दोनों को एक साथ इनपुट के रूप में स्वीकार करता है, जिससे उपयोगकर्ता तस्वीरें समझाने, स्क्रीनशॉट से टेक्स्ट पढ़ने, चार्ट विश्लेषण करने जैसे कार्य कर सकते हैं।

सपोर्टेड इमेज फॉर्मेट में JPEG, PNG, GIF और WebP शामिल हैं। फॉर्मेट फाइल नाम या MIME टाइप से नहीं, बल्कि वास्तविक फाइल कंटेंट से पहचाना जाता है।

इमेज भेजने के तीन तरीके उपलब्ध हैं:

1. **Base64-encoded inline इमेज**: स्थानीय फाइलों के लिए सरल विकल्प। अनुरोध बॉडी की सीमा 48 MiB है।

2. **External image URL**: सार्वजनिक http/https लिंक से इमेज डाउनलोड होती है। URL अधिकतम 8192 अक्षर, फाइल अधिकतम 32 MiB और डाउनलोड 60 सेकंड के भीतर पूरा होना चाहिए।

3. **Files API के जरिए अपलोड**: एक बार इमेज अपलोड करके बार-बार उपयोग किया जा सकता है। इसमें इमेज का आकार 64 MiB तक हो सकता है।

यह मॉडल OpenAI-compatible Chat Completions API फॉर्मेट का उपयोग करता है और base_url 'https://api.deepseek.com' है।

स्रोत

api-docs.deepseek.com — मूल लेख पढ़ें →