याचिका

माइक्रोसॉफ़्ट ने 4 सितंबर को मैनहटन की संघीय अदालत में न्यायाधीश सिडनी स्टाइन के समक्ष चल रहे संयुक्त एआई कॉपीराइट मुक़दमे में संक्षिप्त निर्णय की माँग दायर की। उसका तर्क है कि किताबों और समाचार लेखों पर बड़े भाषा मॉडलों का प्रशिक्षण उचित उपयोग है और इसे मुक़दमे तक ले जाने के बजाय क़ानून के प्रश्न के रूप में तय किया जाना चाहिए। संयुक्त मामले में द न्यूयॉर्क टाइम्स, ऑथर्स गिल्ड और लगभग 400 स्थानीय अख़बारों समेत कई पक्षों के दावे शामिल हैं।

तर्क केवल सिद्धांत पर नहीं, साक्ष्य-चरण के आँकड़ों पर टिका है।

लॉग क्या दिखाते हैं

माइक्रोसॉफ़्ट ने समाचार प्रकाशकों द्वारा नियुक्त एक विशेषज्ञ को कोपायलट संवादों के 82 लाख लॉग सौंपे। यह नमूना यादृच्छिक नहीं था: इसे वादी संस्थानों की वेबसाइटों से जुड़े मुख्य शब्दों के आधार पर चुना गया था, यानी उसे छानकर ट्रैफ़िक का वही हिस्सा रखा गया जिसमें उनकी पत्रकारिता होने की सबसे अधिक संभावना थी।

इन 82 लाख अभिलेखों में से 59,545 में उस समाचार सामग्री से कम से कम 16 शब्द मेल खाते थे जिस पर मॉडल प्रशिक्षित हुआ था — नमूने के एक प्रतिशत से भी कम। किताबों के मामले में माइक्रोसॉफ़्ट का दस्तावेज़ आँकड़ा और नीचे रखता है: उन्हीं 82 लाख संवादों में पुनरुत्पादित अंशों के 24 उदाहरण, यानी 0.00029 प्रतिशत, और विवादित 212 किताबों में से 202 के लिए कोई मेल नहीं।

पत्थर के स्तंभों वाली एक अदालत की इमारत का बाहरी दृश्य
याचिका न्यूयॉर्क के दक्षिणी ज़िले में न्यायाधीश सिडनी स्टाइन के समक्ष है। Phil Evenden · pexels · Pexels License

लड़ाई ढाँचे की क्यों है

आँकड़े पर असल विवाद नहीं है; विवाद उसके अर्थ पर है। माइक्रोसॉफ़्ट का पक्ष है कि जानबूझकर अपने ही ख़िलाफ़ झुकाए गए नमूने में इतनी कम दर यह दिखाती है कि कोपायलट मूल पत्रकारिता का विकल्प नहीं है, और प्रशिक्षण उस अर्थ में रूपांतरकारी है जिसकी उचित उपयोग माँग करता है।

प्रकाशक पूरे मुक़दमे में दूसरी बात कहते रहे हैं: नुक़सान मुख्यतः शब्दशः पुनरुत्पादन का नहीं, बल्कि कृति का उपयोग करके ऐसा उत्पाद बनाने का है जो उन प्रश्नों का उत्तर देता है जो पाठक अन्यथा प्रकाशन तक ले जाता। इस तर्क में पुनरुत्पादन की कम दर अप्रासंगिक है। माइक्रोसॉफ़्ट का दस्तावेज़ इस असहमति को हल नहीं करता — वह नक़ल के उस प्रश्न को संबोधित करता है जो प्रकाशकों ने भी उठाया था, और अदालत से कहता है कि उसी को पूरा मामला माना जाए।

“कम से कम 16 मेल खाते शब्द” की सीमा भी ग़ौर करने लायक़ है। यह अतिव्यापन की यांत्रिक जाँच है और ऐसे मेल भी गिनती है जो किसी भी व्याख्या में उल्लंघन नहीं होंगे। इससे दोनों तरफ़ असर पड़ता है: कच्ची गिनती बढ़ जाती है, पर परिणाम एक ऊपरी सीमा बन जाता है, न्यूनतम नहीं।

क़ानूनी पुस्तकालय में जिल्दबंद विधिक ग्रंथों से भरी अलमारियाँ
किसी अमेरिकी अपीलीय अदालत ने अब तक तय नहीं किया कि कॉपीराइट पाठ पर मॉडल प्रशिक्षण उचित उपयोग है या नहीं। Christian Wasserfallen · pexels · Pexels License

यह कहाँ बैठता है

यह दस्तावेज़ उसी अदालत में अमेरिकी न्याय विभाग द्वारा यह कहे जाने के दो दिन बाद आया कि समाचारों पर एआई का प्रशिक्षण उचित उपयोग है — एक ऐसा रुख़ जिसने अख़बार द्वारा दायर मुक़दमे में संघीय सरकार को प्रतिवादियों के पक्ष में खड़ा कर दिया। दूसरी ओर, माइक्रोसॉफ़्ट ने 2 सितंबर को अपने फ़ाउंड्री मंच के ज़रिए ओपनएआई का जीपीटी-6 एस्ट्रा बेचना शुरू किया, दस डॉलर प्रति दस लाख इनपुट टोकन पर।

मॉडल प्रशिक्षण के लिए उचित उपयोग के प्रश्न का उत्तर किसी अमेरिकी अपीलीय अदालत ने अब तक नहीं दिया है, और ज़िला न्यायाधीश परस्पर विरोधी निष्कर्षों पर पहुँचे हैं। इस याचिका पर न्यायाधीश स्टाइन का फ़ैसला राष्ट्रीय स्तर पर मामला नहीं सुलझाएगा, पर अख़बारों के मुक़दमों में यह अब तक का सबसे महत्वपूर्ण फ़ैसला होगा — और यदि वे इसे ख़ारिज करते हैं, तो प्रश्न जूरी के पास चला जाएगा।