ओपनएआई क्या चालू कर रहा है
ओपनएआई ने सोमवार को कहा कि आने वाले हफ्तों में वह यूरोपीय संघ में चैटजीपीटी और कोडेक्स से बने पात्र टेक्स्ट पर एक अदृश्य जलचिह्न लगाएगा, सभी योजनाओं पर। उसी दिन से दुनिया भर के एपीआई ग्राहक चुनिंदा मॉडलों के लिए इसे स्वयं चालू कर सकते हैं। एपीआई में यह डिफ़ॉल्ट रूप से बंद रहता है, और कंपनी ने कहा कि वह “शुरुआत में टेक्स्ट जलचिह्न को वैश्विक डिफ़ॉल्ट नहीं बना रही है”।
इसकी वजह यूरोपीय संघ का एआई कानून है, जो जनरेटिव एआई प्रदाताओं से कहता है कि मशीन से बने टेक्स्ट को मशीन-पठनीय तरीके से पहचान योग्य बनाया जाए। ओपनएआई अपने डिटेक्टर तक पहुंच के लिए आवेदन भी खोल रहा है, जो यूरोपीय आचार संहिता के अनुरूप स्वीकृत शोधकर्ताओं और विशेषज्ञ संस्थाओं को मामला-दर-मामला दी जाएगी। यह सार्वजनिक रूप से उपलब्ध नहीं होगा।
टेक्स्टग्रेन, और वह मॉडल के साथ क्या करता है
तकनीक का नाम टेक्स्टग्रेन है, और यह मॉडल के शब्द-चयन में एक अदृश्य सांख्यिकीय संकेत जोड़कर काम करती है। ओपनएआई ने कहा कि टेक्स्टग्रेन ने उन सभी तरीकों की बराबरी की या उनसे बेहतर प्रदर्शन किया जिन्हें उसने परखा, जिनमें गूगल का टेक्स्ट के लिए सिंथआईडी भी शामिल है, और वह इस तकनीक को ओपन सोर्स में जारी करने की योजना बना रही है।

कंपनी ने एस्ट्रा के लिए जलचिह्न के साथ और बिना परीक्षा परिणाम प्रकाशित किए और कोई उल्लेखनीय अंतर नहीं बताया: आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स पर 49.57 बनाम 49.76 अंक, जीपीक्यूए डायमंड पर 94.44% बनाम 93.94%, और टर्मिनल-बेंच 4.0 पर 53.90% बनाम 56.06%। ये ओपनएआई के अपने मॉडल पर उसके अपने आंकड़े हैं।
वे आंकड़े जो इस विचार को कमजोर करते हैं
इस पोस्ट का अधिक दिलचस्प हिस्सा यह है कि वह सीमाएं कितनी साफगोई से बताती है। एक प्रतिशत झूठी पहचान की लक्षित दर पर ओपनएआई ने बताया कि उसके डिटेक्टर ने मनोविज्ञान जैसी सामग्री में 200 टोकन के लगभग 80% अंशों और 400 टोकन के लगभग 95% अंशों में जलचिह्न पाया। गणित में, जहां शब्द-चयन अधिक बंधा होता है, पहचान काफी कम रही।
संपादन इसे और तेजी से कमजोर करता है। 400 टोकन के अंशों के एक मूल्यांकन में 10% शब्दों को पर्यायवाची से बदलने पर पहचान लगभग 92% से घटकर 66% रह गई। 25% बदलने पर वह 17% पर आ गई। यही वह आंकड़ा है जिसे याद रखना चाहिए: हल्का सा फिर से लिखना निशान को हरा देता है।

ओपनएआई स्पष्ट है कि पहचान मानवीय योगदान नहीं मापती, स्वामित्व या जिम्मेदारी तय नहीं करती, उपयोगकर्ता की शिनाख्त नहीं करती और सटीकता की पुष्टि नहीं करती — और जलचिह्न का न मिलना यह साबित नहीं करता कि पाठ किसी व्यक्ति ने लिखा, क्योंकि वह बहुत छोटा, संपादित, अनूदित, असमर्थित मॉडल से या किसी अन्य कंपनी के औजारों से आया हो सकता है।
आगे क्या देखना है
कंपनी समर्थित छवियों पर पहले से कंटेंट क्रेडेंशियल्स लगाती है, सी2पीए के अनुरूप है, और समर्थित छवियों तथा ऑडियो में सिंथआईडी निशान जड़ती है, दोनों के लिए सार्वजनिक जांच औजारों के साथ। टेक्स्ट वही हिस्सा है जो इस तरीके का प्रतिरोध करता है, क्योंकि लोग टेक्स्ट को ही दोबारा लिखते हैं। अब देखने लायक हैं: संशोधित तकनीकी रिपोर्ट, ओपन सोर्स रिलीज, और क्या डिटेक्टर तक पहुंच स्वीकृत सूची से आगे बढ़ती है।