टेक्नोलॉजी

गूगल ने ऑन-डिवाइस मल्टीमॉडल सर्च के लिए एंबेडिंगजेम्मा 2 पेश किया

गूगल ने एंबेडिंगजेम्मा 2 जारी किया है, जो डिवाइस पर ही चलने के लिए बनाया गया ओपन मल्टीमॉडल एंबेडिंग मॉडल है। सीईओ सुंदर पिचाई ने इसे कंपनी का पहला ओपन, मूल रूप से मल्टीमॉडल एंबेडिंग मॉडल बताया। जेम्मा 4 आर्किटेक्चर पर आधारित और अपाचे 2.0 लाइसेंस के तहत जारी इस मॉडल में 740 मिलियन पैरामीटर हैं। टेक्स्ट व कोड संस्करण 270 मिलियन, विजन जोड़ने पर लगभग 440 मिलियन और ऑडियो जोड़ने पर करीब 570 मिलियन पैरामीटर लेता है। टेक्स्ट, कोड, चित्र, वीडियो और ऑडियो 768-डायमेंशनल वेक्टर स्पेस साझा करते हैं। वेट्स हगिंग फेस पर उपलब्ध हैं।

स्रोत

CNN-News18 · मूल ख़बर पढ़ें ↗

#google#ai#embeddinggemma#on-device ai#open source

डेस्क जाँच · स्रोत से तुलना की

डेस्क ने क्या जाँचा (5)
  • Google has launched EmbeddingGemma 2, an open multimodal embedding model for on-device use. — Attributed in source to an announcement by Google CEO Sundar Pichai.
  • The model is based on Gemma 4 architecture and released under the Apache 2.0 licence. — Figure/detail appears in source; attributed to Google.
  • Full model has 740 million parameters; text and code 270 million, with vision about 440 million, with audio about 570 million. — Parameter counts appear consistently in both the body and the source's Quick Answers section.
  • Using 256 dimensions retains most quality for text and code and about 95% for image, video and speech retrieval. — Stated by Google in the source; no independent benchmark provided.
  • Model weights are available through Hugging Face. — Appears in source without further attribution or link.

विश्लेषकों की राय राय

AI टेक्नोलॉजी विश्लेषक

एंबेडिंगजेम्मा 2 कोई चैटबॉट नहीं है — यह सर्च के नीचे बिछी बुनियादी परत है, और इसीलिए यह अहम है। टेक्स्ट, कोड, तस्वीरें, वीडियो और ऑडियो को एक ही साझा 768-डाइमेंशनल वेक्टर स्पेस में लाकर यह अलग-अलग तरह के कंटेंट में एक ही क्वेरी से खोज की क्षमता फोन और लैपटॉप तक पहुंचा देता है। 740 मिलियन पैरामीटर, मॉड्यूलर ढांचा और अपाचे 2.0 लाइसेंस — तीनों मिलकर क्लाउड-आधारित एंबेडिंग API कारोबार पर कीमत का दबाव बढ़ा सकते हैं।

  • एंबेडिंग मॉडल आम उपयोगकर्ता को दिखते नहीं, लेकिन RAG, सेमांटिक सर्च और रेकमेंडेशन की नींव यही होते हैं — यानी यह डेवलपर-इंफ्रा स्तर का कदम है।
  • मॉड्यूलर डिज़ाइन (टेक्स्ट और कोड के लिए 270 मिलियन, विज़न जोड़ने पर करीब 440 मिलियन, ऑडियो के साथ लगभग 570 मिलियन) डेवलपर्स को सिर्फ ज़रूरी हिस्सा लोड करने देता है।
  • मात्रियोश्का रिप्रेज़ेंटेशन लर्निंग से वेक्टर 128 डाइमेंशन तक घटाए जा सकते हैं; गूगल के मुताबिक 256 डाइमेंशन पर इमेज, वीडियो और स्पीच रिट्रीवल की करीब 95% गुणवत्ता बनी रहती है।
  • ऑन-डिवाइस प्रोसेसिंग का मतलब है डेटा क्लाउड तक भेजे बिना खोज — प्राइवेसी, ऑफलाइन इस्तेमाल और लेटेंसी, तीनों में फायदा, खासकर कमज़ोर कनेक्टिविटी वाले बाज़ारों में।
  • अपाचे 2.0 के तहत हगिंग फेस पर वेट्स देना ओपन-वेट मुकाबले में गूगल की स्थिति मज़बूत करता है और बंद एंबेडिंग सेवाओं पर सीधा दबाव डालता है।

किस पर नज़र रखें — देखना होगा कि डेवलपर्स इसे असली ऐप्स में कितनी तेज़ी से अपनाते हैं और स्वतंत्र बेंचमार्क में मौजूदा एंबेडिंग मॉडलों के मुकाबले यह कहां ठहरता है।

खबर में स्वतंत्र बेंचमार्क नतीजे, प्रतिस्पर्धी मॉडलों से सीधी तुलना, या असली डिवाइसों पर गति और बैटरी खपत के आंकड़े नहीं हैं — गुणवत्ता से जुड़े आंकड़े गूगल के अपने दावे हैं।

गहराई से

शोध सारांश · 8 तथ्य · 2 तारीख़ें · परीक्षा के लिए

सार

पृष्ठभूमि

गूगल ने एंबेडिंगजेम्मा 2 नाम से एक नया ओपन "मल्टीमॉडल एंबेडिंग मॉडल" जारी किया है, जो क्लाउड सर्वर की जगह सीधे डिवाइस पर कुशलता से चलने के लिए बनाया गया है। एंबेडिंग मॉडल टेक्स्ट, चित्र, ऑडियो और वीडियो जैसी सूचनाओं को वेक्टर नामक संख्यात्मक रूपों में बदलते हैं, जिससे एआई सिस्टम विभिन्न प्रकार की सूचनाओं के बीच संबंध समझ पाते हैं और खोज अधिक प्रासंगिक बनती है। गूगल के सीईओ सुंदर पिचाई ने इसे कंपनी का पहला ओपन और मूल रूप से मल्टीमॉडल एंबेडिंग मॉडल बताया है। मॉडल के वेट्स हगिंग फेस पर डेवलपर्स के लिए उपलब्ध करा दिए गए हैं।

मुख्य तथ्य

  • एंबेडिंगजेम्मा 2 गूगल के जेम्मा 4 आर्किटेक्चर पर आधारित है और व्यावसायिक रूप से अनुमति देने वाले अपाचे 2.0 लाइसेंस के तहत जारी किया गया है।
  • पूर्ण मॉडल में 740 मिलियन पैरामीटर हैं, जो मल्टीमॉडल एआई कार्यभार के लिहाज से तुलनात्मक रूप से कॉम्पैक्ट है।
  • मॉड्यूलर डिजाइन: केवल टेक्स्ट व कोड संस्करण 270 मिलियन पैरामीटर, विजन जोड़ने पर लगभग 440 मिलियन, ऑडियो जोड़ने पर करीब 570 मिलियन पैरामीटर लेता है।
  • टेक्स्ट, कोड, चित्र, वीडियो और ऑडियो एक ही साझा 768-डायमेंशनल वेक्टर स्पेस में खोजे जा सकते हैं।
  • मैट्रियोश्का रिप्रेजेंटेशन लर्निंग के सहारे 768-डायमेंशनल वेक्टर को घटाकर कम से कम 128 डायमेंशन तक लाया जा सकता है।
  • गूगल के अनुसार 256 डायमेंशन पर टेक्स्ट व कोड खोज की गुणवत्ता लगभग पूरी बनी रहती है, जबकि चित्र, वीडियो व स्पीच रिट्रीवल में करीब 95% गुणवत्ता रहती है।
  • बुनियादी टेक्स्ट व कोड सिस्टम में 8,192-टोकन कॉन्टेक्स्ट विंडो वाला अनुकूलित जेम्मा 4 डिकोडर इस्तेमाल होता है।
  • जेम्मा 4 के साथ जोड़कर इसका उपयोग ऑफलाइन और प्राइवेसी-केंद्रित रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) के लिए किया जा सकता है; वेट्स हगिंग फेस पर उपलब्ध हैं।

समयरेखा

  1. स्रोत में उल्लिखित घोषणागूगल सीईओ सुंदर पिचाई ने एंबेडिंगजेम्मा 2 की घोषणा की, इसे कंपनी का पहला ओपन, मूल रूप से मल्टीमॉडल एंबेडिंग मॉडल बताया।
  2. 07 अक्टूबर 2026, 12:30 IST (रिपोर्ट प्रकाशन)मॉडल के वेट्स हगिंग फेस पर डेवलपर्स के लिए उपलब्ध होने की खबर प्रकाशित।

किसका दाँव

  • गूगल — ओपन-वेट मॉडल पारिस्थितिकी तंत्र में अपनी पकड़; जेम्मा 4 के साथ साझा टोकनाइज़र व ऑडियो आर्किटेक्चर से मेमोरी बचत।
  • सुंदर पिचाई (सीईओ, गूगल) — मॉडल की घोषणा की और इसे कंपनी का पहला ओपन, नेटिवली मल्टीमॉडल एंबेडिंग मॉडल बताया।
  • डेवलपर्स व स्टार्टअप — अपाचे 2.0 लाइसेंस और मॉड्यूलर घटकों से स्थानीय, मल्टीमॉडल एआई ऐप बनाने की सुविधा; सिर्फ जरूरी हिस्से लोड कर सकते हैं।
  • उपयोगकर्ता / प्राइवेसी के प्रति सजग लोग — डेटा क्लाउड भेजे बिना डिवाइस पर ही खोज; वॉइस विवरण से वीडियो क्लिप या टेक्स्ट क्वेरी से घंटों की ऑडियो खोजना संभव।
  • हगिंग फेस — मॉडल वेट्स के वितरण मंच के रूप में भूमिका।
  • कम क्षमता वाले हार्डवेयर निर्माता/डिवाइस — छोटे पैरामीटर संस्करणों और घटे डायमेंशन से सीमित हार्डवेयर पर तैनाती आसान।

क्यों अहम है

ऑन-डिवाइस मल्टीमॉडल एंबेडिंग का अर्थ है कि खोज और एआई प्रोसेसिंग के लिए डेटा क्लाउड सर्वर पर भेजना अनिवार्य नहीं — यह प्राइवेसी और ऑफलाइन उपयोग दोनों के लिए महत्वपूर्ण है। अपाचे 2.0 जैसे अनुमतिपरक लाइसेंस और मॉड्यूलर, कम-पैरामीटर डिजाइन से सीमित हार्डवेयर वाले उपकरणों तक एआई क्षमता पहुंच सकती है। एक ही वेक्टर स्पेस में टेक्स्ट, कोड, चित्र, वीडियो और ऑडियो खोजना सूचना पुनर्प्राप्ति का तरीका बदल सकता है।

UPSC नज़रिया

प्रीलिम्स संकेत

  • एंबेडिंगजेम्मा 2 — गूगल का ओपन मल्टीमॉडल एंबेडिंग मॉडल, जेम्मा 4 आर्किटेक्चर पर आधारित, अपाचे 2.0 लाइसेंस।
  • पूर्ण मॉडल: 740 मिलियन पैरामीटर; टेक्स्ट+कोड 270 मिलियन; +विजन ~440 मिलियन; +ऑडियो ~570 मिलियन।
  • साझा वेक्टर स्पेस 768-डायमेंशनल; मैट्रियोश्का रिप्रेजेंटेशन लर्निंग से 128 डायमेंशन तक घटाया जा सकता है।
  • 256 डायमेंशन पर चित्र, वीडियो व स्पीच रिट्रीवल में लगभग 95% गुणवत्ता बनी रहती है (गूगल के अनुसार)।
  • टेक्स्ट व कोड के लिए 8,192-टोकन कॉन्टेक्स्ट विंडो वाला अनुकूलित जेम्मा 4 डिकोडर।
  • RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) — जेम्मा 4 के साथ ऑफलाइन व प्राइवेसी-केंद्रित उपयोग संभव; वेट्स हगिंग फेस पर।

मेन्स दृष्टिकोण

एआई के विकास में अब जोर केवल बड़े मॉडलों पर नहीं, बल्कि छोटे, कुशल और उपकरण पर ही चलने वाले मॉडलों पर है — एंबेडिंगजेम्मा 2 इसी प्रवृत्ति का उदाहरण है। एंबेडिंग मॉडल सूचना को वेक्टर में बदलकर विभिन्न प्रकार की सामग्री के बीच संबंध समझने योग्य बनाते हैं; यहां टेक्स्ट, कोड, चित्र, वीडियो और ऑडियो को एक ही 768-डायमेंशनल स्पेस में रखने से बहु-माध्यम खोज एक ही मॉडल से संभव होती है। 740 मिलियन पैरामीटर वाला यह मॉडल मॉड्यूलर है (टेक्स्ट-कोड 270 मिलियन से शुरू), और मैट्रियोश्का रिप्रेजेंटेशन लर्निंग से वेक्टर आकार 128 डायमेंशन तक घटाकर भंडारण बचाया जा सकता है — यानी हार्डवेयर-भिन्नता वाले उपकरणों पर तैनाती आसान। नीतिगत दृष्टि से महत्व दो स्तरों पर है: पहला, स्थानीय प्रोसेसिंग से डेटा क्लाउड पर भेजने की आवश्यकता घटती है, जो प्राइवेसी और ऑफलाइन पहुंच के लिए अनुकूल है; दूसरा, अपाचे 2.0 जैसा व्यावसायिक रूप से अनुमतिपरक लाइसेंस और हगिंग फेस पर वेट्स की उपलब्धता ओपन-मॉडल पारिस्थितिकी तंत्र को मजबूत करती है। आगे की राह में डेवलपर्स के लिए यह देखना होगा कि घटे डायमेंशन पर गुणवत्ता-भंडारण संतुलन (गूगल के अनुसार 256 डायमेंशन पर इमेज/वीडियो/स्पीच में ~95% गुणवत्ता) व्यावहारिक अनुप्रयोगों में कैसा प्रदर्शन देता है; शेष मूल्यांकन स्रोत में नहीं दिया गया है।

मुख्य शब्द

एंबेडिंग मॉडल
टेक्स्ट, चित्र, ऑडियो, वीडियो जैसी सूचनाओं को वेक्टर नामक संख्यात्मक रूपों में बदलने वाला मॉडल, जिससे खोज अधिक प्रासंगिक बनती है।
मल्टीमॉडल
एक ही सिस्टम में टेक्स्ट, कोड, चित्र, वीडियो और ऑडियो—कई प्रकार की सामग्री—को संभालने की क्षमता।
अपाचे 2.0 लाइसेंस
व्यावसायिक रूप से अनुमति देने वाला ओपन लाइसेंस, जिसके तहत एंबेडिंगजेम्मा 2 जारी किया गया है।
RAG (रिट्रीवल-ऑगमेंटेड जनरेशन)
संबंधित जानकारी खोजकर उसके आधार पर उत्तर तैयार करने की तकनीक; जेम्मा 4 के साथ ऑफलाइन व प्राइवेसी-केंद्रित रूप में संभव।
मैट्रियोश्का रिप्रेजेंटेशन लर्निंग
वह तकनीक जिससे 768-डायमेंशनल वेक्टर को 128 डायमेंशन तक छोटा किया जा सकता है, गुणवत्ता का बड़ा हिस्सा बचाते हुए।
कॉन्टेक्स्ट विंडो
मॉडल एक बार में जितनी सामग्री पढ़ सकता है; यहां टेक्स्ट व कोड डिकोडर के लिए 8,192 टोकन।

अभ्यास प्रश्न

  1. ऑन-डिवाइस एआई प्रोसेसिंग डेटा प्राइवेसी और डिजिटल समावेशन की दृष्टि से क्यों महत्वपूर्ण है? एंबेडिंगजेम्मा 2 के उदाहरण से समझाइए।
  2. मल्टीमॉडल एंबेडिंग मॉडल क्या होते हैं और साझा वेक्टर स्पेस सूचना पुनर्प्राप्ति को कैसे बदल सकता है?
  3. ओपन-वेट और अनुमतिपरक लाइसेंस (जैसे अपाचे 2.0) वाले एआई मॉडल भारत के स्टार्टअप व डेवलपर पारिस्थितिकी तंत्र के लिए क्या अवसर और चुनौतियां उत्पन्न करते हैं?

सिर्फ़ मूल ख़बर के आधार पर — आँकड़े और तारीख़ें स्रोत की हैं, अनुमान नहीं।

अगली ख़बरगुवाहाटी में वाम दलों का प्रदर्शन, बाढ़ पीड़ितों को 25 लाख की मांग →
← सभी ख़बरें