प्लॅटफॉर्म डेटा स्क्रॅपिंग आणि पुनर्वापर: कायदेशीर चौकट

प्लॅटफॉर्म डेटा स्क्रॅप करणे आणि त्याचा पुनर्वापर करणे

हा लेख डच आणि युरोपीय कायद्यांतर्गत एक सामान्य कायदेशीर चौकट मांडतो. हा कोणत्याही विशिष्ट परिस्थितीसाठी सल्ला नाही. स्क्रॅपिंगच्या प्रश्नाचा निकाल नेहमी अचूक तथ्यांवर अवलंबून असतो: वापरलेले तंत्र, डेटाचे स्वरूप, तो कसा संग्रहित केला जातो, त्याचा अभिप्रेत वापर आणि स्रोताची तांत्रिक संरचना.

सार्वजनिक म्हणजे वापरण्यास मोफत असा अर्थ होत नाही.

जो कोणी ऑनलाइन प्लॅटफॉर्मवरून डेटा गोळा करतो आणि तो इतरत्र उपलब्ध करून देतो, तो अशा क्षेत्रात काम करतो ज्याला अनेकदा 'अस्पष्ट' म्हटले जाते, परंतु बारकाईने पाहिल्यास ते गृहीत धरल्यापेक्षा अधिक सुस्पष्ट असल्याचे दिसून येते. हा प्रश्न किंमत तुलना सेवा, भरती साधने आणि बाजार संशोधन कंपन्यांच्या बाबतीत उद्भवतो, आणि अलिकडच्या वर्षांत, विशेषतः मोठ्या प्रमाणावर एआय मॉडेल्ससाठी प्रशिक्षण डेटा गोळा करणाऱ्या संस्थांच्या बाबतीत.

सार्वजनिकरित्या उपलब्ध असलेल्या डेटाच्या संकलनावर कोणताही कायदा मनाई करत नाही. त्याचप्रमाणे, याच्या उलटही खरे नाही: लॉग इन न करता डेटा दिसतो याचा अर्थ असा नाही की त्याचा पुनर्वापर करण्यास मुभा आहे. जो कोणी डेटा गोळा करतो, साठवतो आणि त्याचा पुनर्वापर करतो, तो पाच क्षेत्रांच्या संगमावर काम करत असतो: डेटाबेस अधिकार, कॉपीराइट, करार कायदा, फौजदारी कायदा आणि जनरल डेटा प्रोटेक्शन रेग्युलेशन . डेटा सार्वजनिक होता की नाही यावर निकाल अवलंबून नसतो, तर तो कसा मिळवला गेला, साठवला गेला आणि पुन्हा उपलब्ध करून दिला गेला यावर अवलंबून असतो.

डेटा संकलनाचे तीन मॉडेल, तीन जोखीम प्रोफाइल

कार्य करण्याच्या तीन पद्धतींमध्ये फरक करणे उपयुक्त ठरते. लिंकिंग आणि एम्बेडिंगमध्ये, सेवा केवळ त्या सामग्रीचा संदर्भ घेते जी प्लॅटफॉर्मने स्वतःच आधीच सार्वजनिक केली आहे. स्वतंत्र पुनर्प्राप्ती आणि साठवणुकीमध्ये, सेवा डेटा गोळा करते, तो स्वतःच्या सर्व्हरवर ठेवते आणि तेथूनच तो उपलब्ध करून देते. तिसऱ्या मॉडेलमध्येही असेच घडते, परंतु या प्रक्रियेत लॉगिन वॉल, टोकनची आवश्यकता, कॅप्चा किंवा इतर तांत्रिक प्रवेश निर्बंध टाळले जातात.

पहिल्या मॉडेलमध्ये सर्वात कमी धोका असतो: जोपर्यंत सामग्री आधीपासूनच मुक्तपणे उपलब्ध आहे आणि कोणत्याही तांत्रिक निर्बंधाचे उल्लंघन केले जात नाही, तोपर्यंत कॉपीराइटच्या दृष्टीने कोणताही नवीन सार्वजनिक घटक समोर येत नाही. तरीही ते पूर्णपणे धोकारहित नाही: फ्रेमिंग, दिशाभूल करणारे सादरीकरण, ट्रेडमार्कचा वापर किंवा एम्बेड्सद्वारे आयपी ॲड्रेससारख्या वैयक्तिक डेटाचे हस्तांतरण यामुळे माहिती उघड होऊ शकते. दुसरे मॉडेल वादग्रस्त आहे आणि ते काय घेतले जात आहे याच्या व्याप्तीवर आणि स्वरूपावर मोठ्या प्रमाणावर अवलंबून असते. तिसरे मॉडेल आतापर्यंतचे सर्वात जास्त धोक्याचे आहे, कारण त्यामुळे एकाच वेळी दिवाणी, फौजदारी आणि डेटा संरक्षण दायित्व निर्माण होऊ शकते.

खालील तक्ता कायद्याचा निश्चित नियम न देता, एक प्राथमिक, तात्पुरता संकेत देतो.

संकलनाची पद्धतदिवाणी आणि बौद्धिक संपदा जोखीमडेटा संरक्षण धोकागुन्हेगारी धोकामुख्य चाचणी
लिंकिंग आणि एम्बेडिंगकमी ते मध्यममर्यादित (आयपी पत्ता हस्तांतरण)उपेक्षणीयनवीन प्रेक्षक नाही (स्वेन्सन); निर्बंधांचे उल्लंघन नाही (व्हीजी बिल्ड-कुन्स्ट)
स्वतंत्र पुनर्प्राप्ती आणि साठवणूकमध्यम ते उच्चवैयक्तिक डेटाच्या बाबतीत उच्चजेथे स्रोत सार्वजनिक आहे तेथे कमीडेटाबेसचा महत्त्वपूर्ण भाग; भरीव गुंतवणूक; वैध GDPR आधार
निर्बंधांचे उल्लंघनखूप उंचखूप उंचवास्तविक (कलम 138ab डच फौजदारी संहिता)सुरक्षा भंग करणे किंवा खोट्या चावीचा वापर करणे; कराराचा भंग; अपकृत्य

डेटाबेस अधिकार: भरीव गुंतवणूक

एखाद्या प्लॅटफॉर्मसाठी, विशिष्ट प्रकारचा डेटाबेस अधिकार हा सामान्यतः सर्वात आश्वासक आधार असतो. डच डेटाबेस कायद्यामध्ये लागू केलेला निर्देश ९६/९/ईसी , डेटाबेसच्या निर्मात्याचे, त्यातील सामग्रीच्या महत्त्वपूर्ण भागाचे निष्कर्षण किंवा पुनर्वापर करण्यापासून, तसेच जिथे हे सामान्य शोषणात अडथळा आणते तिथे लहान भागांचे वारंवार आणि पद्धतशीरपणे निष्कर्षण करण्यापासून संरक्षण करतो.

निर्माण करणे विरुद्ध मिळवणे

ब्रिटिश हॉर्सरेसिंग बोर्ड विरुद्ध विल्यम हिल (C-203/02) या खटल्यात, न्याय न्यायालयाने असे ठरवले की केवळ अस्तित्वात असलेला डेटा मिळवणे, त्याची पडताळणी करणे आणि तो सादर करणे यासाठी केलेली गुंतवणूकच ग्राह्य धरली जाते, तो तयार करण्याचा खर्च नाही.

वापरकर्त्याने व्युत्पन्न केलेली सामग्री

ज्या प्लॅटफॉर्मवर वापरकर्ते विनामूल्य सामग्री देतात, त्यांच्यासाठी हा फरक दुधारी तलवारीसारखा असतो आणि तो आपोआपच अनुकूल ठरत नाही. एकीकडे, प्लॅटफॉर्म स्वतः डेटा तयार करत नाही, ज्यामुळे संरक्षणाचा मार्ग मोकळा होतो. दुसरीकडे, तो मिळवण्यासाठी काहीही खर्च येत नाही: वापरकर्ते स्वेच्छेने आणि स्वतःच्या पुढाकाराने डेटा अपलोड करतात, त्यामुळे त्या टप्प्यावर गुंतवणूक करण्यासाठी फार कमी खर्च येतो. म्हणूनच, संरक्षण हे डेटासेटच्या आकारावरून मिळत नाही, तर केवळ तेव्हाच मिळते जेव्हा प्लॅटफॉर्म डेटा संकलनानंतरच्या प्रक्रियेत भरीव गुंतवणूक केल्याचे दाखवू शकते: जसे की पडताळणी, नियंत्रण आणि शुद्धीकरण, गुणवत्ता नियंत्रण, अनुक्रमणिका आणि डेटाचे पायाभूत सादरीकरण. या सर्व गुंतवणुकी मिळून आवश्यक निकष पूर्ण करतात की नाही, हा एक वस्तुस्थितीचा प्रश्न आहे, जो प्रत्येक प्लॅटफॉर्म आणि प्रत्येक डेटासेटनुसार सिद्ध करावा लागतो. यासाठी वापरकर्त्यांच्या संख्येचा संदर्भ देण्याऐवजी कर्मचारी, पायाभूत सुविधा आणि प्रणालींविषयीच्या आकडेवारीचा आधार घ्यावा लागतो.

मेटा शोध इंजिन आणि स्क्रॅपर्स

इनोवेब विरुद्ध वेगेनर (C-202/12) या खटल्यात, न्यायालयाने असे ठरवले की, जी सेवा रिअल-टाइम शोध क्वेरी दुसऱ्या पक्षाच्या डेटाबेसकडे पाठवते आणि त्याचे परिणाम स्वतःच्या इंटरफेसमध्ये दाखवते, ती त्या डेटाबेसचा पुनर्वापर करते, मग तो डेटा स्थानिक पातळीवर कायमस्वरूपी साठवलेला असो वा नसो. अनेक स्क्रॅपर्स आणि पर्यायी इंटरफेसेसच्या कार्याचा हाच गाभा आहे, जरी ते स्वतःकडे काहीही राखून ठेवत नसले तरीही.

मजकूर आणि डेटा मायनिंग अपवाद

डच कॉपीराइट कायद्याच्या कलम १५n आणि १५o मध्ये लागू केलेले, DSM निर्देशाचे कलम ३ आणि ४ , मजकूर आणि डेटा मायनिंगसाठी एक अपवाद प्रदान करतात. व्यावसायिक पक्षांसाठी हा अपवाद केवळ तेव्हाच लागू होतो जेव्हा हक्कधारकाने आपले हक्क स्पष्टपणे राखून ठेवलेले नसतात, आणि हे आरक्षण मशीन-वाचनीय स्वरूपात नोंदवले जाणे आवश्यक असते, उदाहरणार्थ API मेटाडेटा, करारनाम्यातील तरतुदी किंवा robots.txt निर्देशांद्वारे.

कॉपीराइट आणि प्लॅटफॉर्म इंटरफेस

वापरकर्त्यांची सामग्री असलेल्या प्लॅटफॉर्मवर, कॉपीराइटचे श्रेय सर्रासपणे चुकीच्या पक्षाला दिले जाते. तत्त्वतः, पोस्ट्स आणि प्रतिमा त्यांच्या वैयक्तिक लेखकांच्या मालकीच्या असतात, मात्र अट ही आहे की ते काम इन्फोपाक (C-5/08) च्या व्याख्येनुसार लेखकाची स्वतःची बौद्धिक निर्मिती असावी. लहान, वस्तुनिष्ठ पोस्ट्स अनेकदा ही अट पूर्ण करत नाहीत, त्यामुळे बऱ्याच प्रकरणांमध्ये संरक्षण करण्यासारखे काहीच नसते.

कोण अंमलबजावणी करू शकतो

वापराच्या अटी सामान्यतः प्लॅटफॉर्मला केवळ एक गैर-अनन्य परवाना देतात. येथे अनेकदा तीन प्रश्न एकत्र मिसळले जातात: मूळ कॉपीराइट, जो लेखकाकडेच राहतो; उल्लंघनास प्रतिबंध करण्याचा अधिकार, जो तत्त्वतः केवळ हक्कधारकाकडे किंवा अनन्य परवानाधारकाकडे असतो; आणि खटला दाखल करण्याची क्षमता, जी प्लॅटफॉर्म हक्कधारकांकडून स्पष्ट आदेश मिळवल्यावर वापरू शकते.

डच कायद्यानुसार, केवळ गैर-अनन्य परवानाधारकाला उल्लंघनासाठी स्वतंत्रपणे दावा करण्याचा कोणताही अधिकार नसतो. तथापि, प्लॅटफॉर्म सामग्रीपासून स्वतंत्रपणे स्वतःच्या अधिकारांवर कारवाई करू शकते: ग्राफिकल युझर इंटरफेस, डेटाबेस संरचना आणि आयकॉन्सवरील कॉपीराइट, तसेच व्यापार नावे आणि लोगोंवरील ट्रेडमार्क अधिकार. परिचित दिसण्यासाठी या घटकांचा वापर करणारी सेवा, प्लॅटफॉर्मला असा आधार मिळवून देते जो मूळ सामग्रीच्या संदर्भात तिच्याकडे नव्हता.

लिंकिंग आणि कॉपी करणे

येथे न्याय न्यायालयाच्या न्यायनिर्णयाच्या तीन ओळी लागू होतात. आधीच विनामूल्य उपलब्ध असलेल्या स्रोताला हायपरलिंक करणे हे जनतेसाठी नवीन संप्रेषण नाही (स्वेन्सन, सी-४६६/१२). एखादे साहित्य डाउनलोड करून ते स्वतःच्या सर्व्हरवर ठेवणे हे मात्र नवीन संप्रेषण आहे, कारण त्यामुळे ते साहित्य एका वेगळ्या जनसमुदायासाठी उपलब्ध होते (रेनकॉफ, सी-१६१/१७). आणि तांत्रिक संरक्षण उपायांना बगल देऊन अशा जनसमुदायापर्यंत पोहोचणे, ज्याचा हक्कधारकाने विचार केलेला नव्हता, हे देखील जनतेसाठी एक नवीन संप्रेषण ठरते (व्हीजी बिल्ड-कुन्स्ट, सी-३९२/१९).

करार कायदा: वापराच्या अटी आणि रायनएअर विरोधाभास

जवळजवळ प्रत्येक प्लॅटफॉर्म आपल्या अटींमध्ये स्वयंचलित प्रवेशास मनाई करतो. तथापि, पहिला प्रश्न हा आहे की मुळात करार अस्तित्वात आला का, आणि सार्वजनिक अभ्यागत व नोंदणीकृत खात्यांमध्ये यात मोठा फरक असतो. केवळ 'ब्राउझ-रॅप', म्हणजेच पानाच्या तळाशी असलेला एक संदर्भ, डच कायद्यानुसार अभ्यागताला क्वचितच बंधनकारक ठरतो, जोपर्यंत सक्रिय स्वीकृती सिद्ध होत नाही. 'क्लिक-रॅप'च्या बाबतीत, जिथे नोंदणी करताना अटी स्पष्टपणे स्वीकारल्या जातात, तिथे त्या अटी तत्त्वतः बंधनकारक ठरतात आणि स्वयंचलित खाते निर्मिती हा स्वतःच एक कराराचा भंग ठरतो.

रायनएअर विरोधाभास

Ryanair विरुद्ध PR Aviation (C-30/14) या खटल्यात, युरोपियन कोर्ट ऑफ जस्टिसने असा निर्णय दिला की, जेव्हा एखादा डेटाबेस कॉपीराइट किंवा सुई जेनेरिस (sui generis) अधिकाराने संरक्षित नसतो, तेव्हा डेटाबेस निर्देशांतर्गत असलेले अनिवार्य वापरकर्ता अधिकार लागू होत नाहीत. अशावेळी ऑपरेटर कराराद्वारे पुनर्वापरावर मोठ्या प्रमाणावर निर्बंध घालू शकतो. बौद्धिक संपदेची स्थिती जितकी कमकुवत असेल, तितकीच कराराची स्थिती अधिक मजबूत सिद्ध होऊ शकते. त्या प्राथमिक निर्णयानंतर, हा खटला डच न्यायालयांकडे परत गेला आणि २३ जानेवारी २०१८ रोजी दिलेल्या आपल्या निकालात, हेग कोर्ट ऑफ अपीलने असे ठरवले की, पूर्वीच्या निष्कर्षाच्या विरुद्ध, Ryanair च्या अटींमधील डेटाबेस वापरावरील बंदी आपोआपच रद्दबातल नव्हती. तो निकाल हे देखील दाखवतो की अटींवर लागू होणाऱ्या कायद्यावर किती अवलंबून आहे: न्यायालयाने ब्राउझ-रॅपद्वारे झालेली स्वीकृती डच कायद्यानुसार नव्हे, तर Ryanair ने त्या अटींमध्ये निवडलेल्या कायद्यानुसार तपासली.

शून्यता जिथे डेटाबेस संरक्षित आहे

जेव्हा एखाद्या डेटाबेसवर विशेष संरक्षण लागू असते, तेव्हा डेटाबेस निर्देशाच्या कलम १५ अन्वये, त्यातील नगण्य भाग काढण्यावरील करारानुसार असलेली बंदी अवैध ठरते. हे संरक्षण केवळ कायदेशीर वापरकर्ता म्हणून पात्र ठरणाऱ्या पक्षालाच उपलब्ध असते, आणि हा दर्जा डेटाबेसमध्ये प्रवेश कसा मिळवला गेला यावर अवलंबून असतो.

कराराच्या दाव्याची व्यावहारिक कमजोरी

हे केवळ प्रतिपक्षाला बंधनकारक असते, त्याच्या अंतिम वापरकर्त्यांना नाही; प्लॅटफॉर्म विनामूल्य असल्यास होणारे नुकसान मोजणे कठीण असते; आणि अनेकदा त्यात व्यवहार्य दंडात्मक कलमाचा अभाव असतो. त्यामुळे, करारात्मक आधार हा जवळजवळ नेहमीच डेटाबेस अधिकार, कॉपीराइट किंवा अपकृत्य यांच्याशी जोडलेला असतो.

फौजदारी कायद्याच्या मर्यादा: अनधिकृत प्रवेश

प्रवेशाच्या अटींचे प्रत्येक उल्लंघन म्हणजे अनधिकृत प्रवेश नव्हे, आणि चर्चा फारच सहजपणे त्या निष्कर्षाकडे वळते. डच फौजदारी संहितेच्या कलम 138ab नुसार , स्वयंचलित प्रणालीमध्ये हेतुपुरस्सर आणि बेकायदेशीर घुसखोरी करणे आवश्यक आहे, उदाहरणार्थ सुरक्षा भेदून, तांत्रिक हस्तक्षेप करून, खोट्या चावीचा वापर करून किंवा खोटी ओळख धारण करून.

प्रोव्हायडरच्या अपेक्षेपेक्षा जास्त वेगाने विनंत्या पाठवणे, robots.txt कडे दुर्लक्ष करणे, किंवा टोपणनावाने किंवा बनावट तपशिलांसह खाते नोंदवणे, हे स्वतःहून घुसखोरी ठरत नाही. सार्वजनिक नोंदणी अर्ज सर्वांसाठी खुला असतो आणि त्यात कोणताही नियमभंग होत नाही. त्यामुळे वापराच्या अटींचा भंग होऊ शकतो, परंतु ती एक दिवाणी बाब आहे.

ठोस तांत्रिक प्रवेश अडथळे पार करताच गुन्हेगारीचा धोका वाढतो: जसे की हस्तगत केलेले ऑथेंटिकेशन टोकन्स किंवा API कीजचा पुनर्वापर करणे, किंवा इंटरॅक्टिव्ह अँटी-बॉट आणि कॅप्चा (CAPTCHA) प्रणालींना हेतुपुरस्सर टाळणे. वापरलेल्या तंत्राच्या नावावरून त्याचे कायदेशीर वर्गीकरण आपोआप होत नाही. एखादी गोष्ट घुसखोरी, तांत्रिक हस्तक्षेप किंवा खोट्या कीचा वापर म्हणून गणली जाते की नाही, हे सुरक्षा यंत्रणा कशी कार्य करते, वापरकर्त्याचा हेतू आणि नेमके काय टाळले जात आहे याचे स्वरूप यावर अवलंबून असलेले वस्तुस्थिती-विशिष्ट मूल्यांकन असते.

मोठ्या प्रमाणावरील स्क्रॅपिंगमध्ये डेटा संरक्षण

एकदा स्क्रॅप केलेला डेटा, ज्यामध्ये युझरनेम, प्रोफाइल पिक्चर्स, पोस्ट्स, आयपी ॲड्रेसेस आणि प्रोफाइल स्टॅटिस्टिक्स यांचा समावेश आहे, प्रत्यक्ष किंवा अप्रत्यक्षपणे नैसर्गिक व्यक्तींशी जोडला जाऊ लागला की, स्क्रॅपर सामान्यतः नियंत्रक म्हणून पात्र ठरतो: म्हणजेच, डेटा प्रक्रियेचे उद्देश आणि साधने निश्चित करणारी व्यक्ती.

व्यवहारात, वैध हितसंबंधांचा आधार अनेकदा घेतला जातो. तो एक संभाव्य आधार आहे, आपोआप मिळणारी परवानगी नव्हे: त्यासाठी उद्देशावरील मर्यादा, आवश्यकता आणि दुय्यमता यांचे मूल्यांकन करणे, तसेच एक संतुलन साधणे आवश्यक असते, ज्यामध्ये डेटा धारकाच्या वाजवी अपेक्षांनाही महत्त्व दिले जाते. जिथे संवेदनशील डेटा, मोठ्या प्रमाणावरील देखरेख किंवा प्रोफाइलिंगचा समावेश असतो, तिथे हे संतुलन उलट होऊ शकते.

जीडीपीआरचे कलम १४(५)(ब) माहिती देण्याच्या कर्तव्यातून सूट देते, जिथे माहिती देणे अशक्य आहे किंवा त्यासाठी प्रमाणाबाहेर प्रयत्न करावे लागतील, जे मोठ्या प्रमाणावर गोळा केलेल्या डेटाच्या बाबतीत अनेकदा घडते. ही सूट केवळ माहिती देण्याच्या कर्तव्यालाच लागू होते. उद्देशावर मर्यादा घालणे आणि डेटा कमीत कमी ठेवणे, प्रक्रिया कार्यांची नोंद ठेवणे, डेटा धारकांचे हक्क ज्यात प्रवेश, आक्षेप आणि डेटा हटवणे यांचा समावेश आहे, योग्य सुरक्षा उपाय, आणि जिथे प्रक्रिया मोठ्या प्रमाणावर असेल तिथे डेटा संरक्षण प्रभाव मूल्यांकन, हे सर्व पूर्णपणे लागू राहतात.

वैयक्तिक माहिती एखाद्या प्लॅटफॉर्मवर सार्वजनिकरित्या उपलब्ध आहे, केवळ या वस्तुस्थितीमुळे माहितीधारकाचे हक्क हिरावले जात नाहीत आणि ही माहितीवर पुढील प्रक्रिया किंवा प्रोफाइलिंगसाठी दिलेली परवानगी ठरत नाही. तसेच, या कार्यप्रणालीचा हा एक असा भाग आहे, ज्याची अंमलबजावणी प्लॅटफॉर्मद्वारे नव्हे, तर पर्यवेक्षक प्राधिकरण आणि संबंधित व्यक्तींद्वारे केली जाते, ज्यामुळे माहितीच्या स्रोताने कारवाई केली असो वा नसो, हा धोका अस्तित्वात राहतोच.

वैयक्तिक माहिती गोळा करणाऱ्यांसाठी तपासणी सूची

  • नेमका कोणता डेटा गोळा केला जातो, आणि तो सामान्य श्रेणीतील वैयक्तिक डेटा आहे की विशेष श्रेणीतील?
  • प्रक्रियेचा नेमका उद्देश काय आहे?
  • कायदेशीर आधार काय आहे, आणि तो आवश्यकता व संतुलन मूल्यांकनात टिकतो का?
  • डेटा धारकांना माहिती कशी दिली जाते, आणि माहिती देण्याच्या कर्तव्यातून सूट लागू होते का?
  • डेटा किती कालावधीसाठी जतन करून ठेवला जातो?
  • युरोपियन आर्थिक क्षेत्राच्या बाहेर डेटा हस्तांतरित केला जातो का?
  • प्रक्रियेचे प्रमाण आणि स्वरूप पाहता, डेटा संरक्षण प्रभाव मूल्यांकनाची आवश्यकता आहे का?
  • प्रवेश, सुधारणा आणि हटवण्याच्या विनंत्या तांत्रिकदृष्ट्या प्रत्यक्षात कार्यान्वित केल्या जाऊ शकतात का?

एआय प्रशिक्षण डेटा: एक वेगळी चिंता

स्क्रॅप केलेल्या डेटावर एआय आणि भाषा मॉडेल्सना प्रशिक्षित केल्याने , वरील चौकटींवर आणखी कायदेशीर स्तर जोडले जातात. डेटा गोळा करणे, साठवणे आणि प्रशिक्षण देणे या दोन वेगवेगळ्या गोष्टी आहेत आणि प्रत्येकाची स्वतःची स्वतंत्र तपासणी असते. प्रशिक्षण डेटा गोळा करणे आणि तात्पुरता साठवणे हे मजकूर आणि डेटा मायनिंगच्या अपवादांतर्गत येऊ शकते; परंतु त्या डेटाचा वापर करून मॉडेलला प्रशिक्षित करणे आणि त्याच्या आउटपुटचा व्यावसायिक फायदा घेणे ही एक वेगळी कृती आहे, जिचे कॉपीराइट, डेटाबेस अधिकार आणि जीडीपीआरच्या (GDPR) संदर्भात नव्याने मूल्यांकन करणे आवश्यक आहे.

व्यावसायिक एआय विकसक तत्त्वतः मायनिंग अपवादावर अवलंबून राहू शकतात, परंतु केवळ तोपर्यंतच जोपर्यंत प्लॅटफॉर्मने मशीन-रीडेबल ऑप्ट-आउट लागू केलेला नाही. जिथे प्रशिक्षण डेटा अंशतः संरक्षित डेटाबेसच्या महत्त्वपूर्ण भागाचा बनलेला असतो, तिथे अपवादात कॉपीराइट घटकाचा समावेश आहे की नाही याची पर्वा न करता, सुई जेनेरिस अधिकार संबंधित राहतो.

जीडीपीआर (GDPR) अंतर्गत, प्रशिक्षणाच्या उद्देशाने वैयक्तिक डेटा गोळा करण्यासाठी एक ठोस कायदेशीर आधार आणि मोठ्या प्रमाणावर परिणामांचे मूल्यांकन आवश्यक आहे. एक विशिष्ट अनुपालन धोका हा आहे की, प्रशिक्षित मॉडेलमध्ये आधीच समाविष्ट केलेल्या पॅरामीटर्सवर डेटा हटवण्याचा आणि दुरुस्त करण्याचा अधिकार लागू करणे कठीण आहे: मॉडेलमधून डेटा काढून टाकणे ही क्वचितच एक सरळ तांत्रिक प्रक्रिया असते. कायदेशीर बंधन आणि तांत्रिक व्यवहार्यता यांमधील हा तणाव पर्यवेक्षक प्राधिकरणांसाठी एक ज्वलंत चिंतेचा विषय आहे. रायनएअरचा तर्क येथेही लागू होतो: बौद्धिक संपदा संरक्षण कमकुवत असलेले प्लॅटफॉर्मसुद्धा, जर करार अस्तित्वात असेल तर, त्यांच्या अटींद्वारे एआय (AI) प्रशिक्षणासाठी डेटाच्या पुनर्वापरावर मोठ्या प्रमाणावर निर्बंध घालू शकतात.

अंमलबजावणी आणि खटला चालवण्याची पद्धत

व्यवहार स्थापित करणे हा क्वचितच कठीण भाग असतो. सर्व्हर लॉग, आयपी रेंज, ब्राउझर फिंगरप्रिंटिंग आणि रिक्वेस्ट पॅटर्न ट्रॅफिकला खात्यांशी जोडतात. प्लॅटफॉर्म कॅनरी डेटा देखील एम्बेड करतात: हे कृत्रिम, सहज लक्षात न येणारे डेटा पॉइंट्स असतात, जे इतरत्र दिसल्यावर त्यांचा उगम सिद्ध करतात. ओपन सोर्स प्रोजेक्ट्समध्ये सोर्स कोड सार्वजनिक असतो आणि नेमके कोणते एंडपॉइंट्स कॉल केले जातात हे त्यात नमूद केलेले असते.

जेव्हा कामकाज प्रॉक्सी सर्व्हर किंवा अनामिक डोमेनच्या मागे चालते, तेव्हा जबाबदार धरण्यासाठी पक्ष शोधणे अधिक कठीण होते. अशावेळी, 'लायकोस विरुद्ध पेसर्स' खटल्यात डच सर्वोच्च न्यायालयाने ठरवून दिलेल्या निकषांनुसार, होस्टिंग प्रोव्हायडरसारख्या मध्यस्थाकडून ओळख पटवणाऱ्या तपशिलांची माहिती मागितली जाऊ शकते.

दिवाणी अंमलबजावणी मुख्यत्वे अपकृत्य किंवा बौद्धिक संपदा उल्लंघनाच्या आधारावर अंतरिम कार्यवाहीद्वारे चालते, जिथे एक संभाव्य प्रकरण पुरेसे असते आणि दंडासह तातडीच्या मनाई हुकुमाची मागणी केली जाते. संपूर्ण कार्यवाहीचा खर्च आणि पुराव्याचा भार लक्षात घेता, प्लॅटफॉर्म व्यवहारात अनेकदा होस्टिंग प्रदाते, CDN सेवा, ॲप स्टोअर्स आणि डोमेन रजिस्ट्रार यांना सूचना देण्यासोबत तांत्रिक उपाययोजनांचाही वापर करतात. डिजिटल सेवा कायदा त्या उद्देशासाठी एक प्रमाणित सूचना प्रक्रिया प्रदान करतो. एखादे वर्तन बेकायदेशीर आहे की नाही हे तो स्वतः ठरवत नाही; तो केवळ त्यावर उपाययोजना करण्यासाठी एक जलद मार्ग उपलब्ध करून देतो, आणि त्याची अंमलबजावणी संबंधित सेवेची भूमिका व सूचनेच्या स्वरूपावर अवलंबून असते.

सतत विचारले जाणारे प्रश्न

नेदरलँड्समध्ये सार्वजनिक वेबसाइट्स स्क्रॅप करण्यास मनाई आहे का?

नाही. कोणताही कायदा सार्वजनिकरित्या उपलब्ध डेटा गोळा करण्यास स्पष्टपणे मनाई करत नाही. त्याला परवानगी आहे की नाही हे काय गोळा केले जाते, प्रवेश कसा मिळवला गेला आणि नंतर त्याचे काय केले जाते यावर अवलंबून असते. सार्वजनिकरित्या उपलब्ध असण्याचा अर्थ मुक्तपणे पुनर्वापर करण्यायोग्य असा होत नाही.

मी व्यावसायिक सेवेसाठी प्लॅटफॉर्म डेटा वापरू शकतो का?

त्यासाठी प्रत्येक प्रकरणात चार बाबींवर मूल्यांकन करणे आवश्यक आहे: डेटासेटमध्ये संरक्षित डेटाबेसचा महत्त्वपूर्ण भाग आहे का, त्यात कॉपीराइट संरक्षित कामांचा समावेश आहे का, प्लॅटफॉर्मसोबत करार झाला आहे का, आणि वैयक्तिक डेटावर प्रक्रिया केली जात आहे का. लॉग इन न करता प्रोफाइल दिसतात ही केवळ वस्तुस्थिती त्या चारपैकी एकाही प्रश्नाचे उत्तर देत नाही.

वापराच्या अटींचे उल्लंघन करणे हा फौजदारी गुन्हा आहे का?

स्वतःहून नाही. कराराचा भंग ही एक दिवाणी बाब आहे. फौजदारी दायित्व तेव्हाच उद्भवते जेव्हा डच फौजदारी संहितेच्या कलम 138ab च्या अर्थाअंतर्गत घुसखोरी होते, ज्यामध्ये भंग झालेली सुरक्षा, तांत्रिक हस्तक्षेप, बनावट चावी किंवा बनावट ओळख गृहीत धरली जाते.

टोपणनावाने खाते तयार करणे हा अनधिकृत प्रवेश आहे का?

तत्त्वतः नाही. सार्वजनिक नोंदणी अर्ज सर्वांसाठी खुला असतो आणि त्यात कोणताही नियमभंग होत नाही. तरीही, त्यामुळे वापराच्या अटींचा भंग होऊ शकतो. जेव्हा ती नोंदणी स्वयंचलित करण्यासाठी अँटी-बॉट किंवा कॅप्चा प्रणाली टाळली जाते, किंवा वापरकर्त्याला जारी न केलेले टोकन वापरले जातात, तेव्हा परिस्थिती वेगळी असते.

मी एआय मॉडेलला प्रशिक्षित करण्यासाठी स्क्रॅप केलेला डेटा वापरू शकतो का?

मजकूर आणि डेटा मायनिंगचा अपवाद व्यावसायिक पक्षांसाठी वाव ठेवतो, परंतु केवळ तोपर्यंतच जोपर्यंत हक्कधारकाने मशीन-वाचनीय आरक्षण केलेले नाही. डेटाबेस हक्क आणि GDPR स्वतंत्रपणे लागू राहतात, आणि संकलन, साठवणूक व प्रशिक्षण या तीन कायदेशीररित्या भिन्न कृती आहेत, ज्या प्रत्येकाचे स्वतंत्रपणे मूल्यांकन केले जाईल.

डेटाबेसचा महत्त्वपूर्ण भाग कशाला म्हणतात?

याचे मोजमाप संख्यात्मक आणि गुणात्मक अशा दोन्ही प्रकारे केले जाते आणि ही एक निश्चित टक्केवारी नसते. पद्धतशीरपणे अल्प प्रमाणात निष्कर्षण करणे हे सामान्य शोषणाशी विसंगत असल्यास ते उल्लंघन ठरू शकते. हे मूल्यांकन वस्तुनिष्ठ असून प्रत्येक डेटासेटनुसार भिन्न असते.

वैयक्तिक माहिती आधीच सार्वजनिक असल्यास, मला कायदेशीर आधाराची गरज आहे का?

होय. प्रसिद्धीमुळे डेटा धारकांना त्यांच्या हक्कांपासून वंचित ठेवले जात नाही. हेतू आणि साधने निश्चित करणारा पक्ष हा नियंत्रक असतो आणि त्याला कायदेशीर आधाराची आवश्यकता असते, जो व्यवहारात सामान्यतः वैध हितसंबंध असतो, आणि तो आवश्यकता व संतुलन मूल्यांकनानंतरही टिकून राहिला पाहिजे.

प्रत्यक्षात स्क्रॅपिंगच्या बाबतीत एखादे प्लॅटफॉर्म काय करू शकते?

सहसा ही संपूर्ण कार्यवाही नसते. प्रवेश बंद करणे, तांत्रिक उपाययोजना करणे आणि होस्टिंग प्रदाते, सीडीएन सेवा, ॲप स्टोअर्स व रजिस्ट्रार यांच्याकडे सूचना दाखल करणे. जिथे कार्यवाही केली जाते, ती जवळजवळ नेहमीच अंतरिम कार्यवाही असते, ज्यात एक संभाव्य प्रकरण पुरेसे ठरते. सर्वात कठीण भाग म्हणजे एका अज्ञात ऑपरेटरला ओळखणे.

एखादे प्लॅटफॉर्म स्वतःचे स्थान कसे मजबूत करते?

सत्यापन, नियंत्रण, अनुक्रमणिका आणि सादरीकरण यामधील गुंतवणुकीचे ठोस शब्दांत दस्तऐवजीकरण करून, पानाच्या तळाशी असलेल्या संदर्भावर अवलंबून न राहता नोंदणी करताना अटींची स्वीकृती नोंदवून, मशीन-वाचनीय मायनिंग आरक्षण लागू करून, आणि तांत्रिक उपाययोजना अशा प्रकारे संरचित करून की त्यांचे उल्लंघन सिद्ध करण्यायोग्य आणि कायदेशीरदृष्ट्या अर्थपूर्ण असेल.

सूत्रांनी दिलेल्या माहितीनुसार,

CJEU ९ नोव्हेंबर २००४, C-२०३/०२ (ब्रिटिश हॉर्सरेसिंग बोर्ड विरुद्ध विल्यम हिल)

CJEU 16 जुलै 2009, C-5/08 (Infopaq)

CJEU 19 डिसेंबर 2013, C-202/12 (Innoweb v Wegener)

CJEU 13 फेब्रुवारी 2014, C-466/12 (Svensson)

CJEU १५ जानेवारी २०१५, C-३०/१४ (रायनएअर विरुद्ध पीआर एव्हिएशन)

CJEU 7 ऑगस्ट 2018, C-161/17 (Renckhoff)

CJEU 9 मार्च 2021, C-392/19 (VG Bild-Kunst)

हेग अपील न्यायालय २३ जानेवारी २०१८, ECLI:NL:GHDHA:2018:61 (रायनएअर विरुद्ध पीआर एव्हिएशन, संदर्भानंतर)

डच सर्वोच्च न्यायालय २५ नोव्हेंबर २००५, ECLI:NL:HR:2005:AU4019 (लायकोस विरुद्ध पेसर्स)

डच डेटाबेस कायद्यात लागू केलेला निर्देश ९६/९/ईसी (डेटाबेस निर्देश).

निर्देश (ईयू) २०१९/७९० (डीएसएम निर्देश), कलम ३ आणि ४; डच कॉपीराइट कायदा कलम १५एन आणि १५ओ

डच कॉपीराइट कायदा, कलम १ आणि २७

डच फौजदारी संहिता, कलम १३८एबी

नियमन (ईयू) 2016/679 (जीडीपीआर), कलमे 4, 5, 6, 14, 15-21, 30, 32 आणि 35

नियमन (ईयू) २०२२/२०६५ (डिजिटल सेवा कायदा)

डच नागरी संहिता पुस्तक ६, कलम १६२ आणि २१७; डच दिवाणी प्रक्रिया संहिता, कलम २५४ आणि १०१९

Law & More तृतीय पक्षांच्या डेटावर प्रक्रिया करणाऱ्या कंपन्यांना आणि स्वतःच्या डेटा संग्रहांचे संरक्षण करू इच्छिणाऱ्या पक्षांना सल्ला देते. कृपया मोकळेपणाने संपर्क साधा. आमच्याशी संपर्क एखाद्या विशिष्ट परिस्थितीच्या मूल्यांकनासाठी.

तुम्हाला कायदेशीर मदतीची गरज आहे का?

संपर्क Law & More तुमच्या कायदेशीर बाबींवर तज्ज्ञ मार्गदर्शनासाठी, आमची बहुभाषिक टीम मदतीसाठी सज्ज आहे.

तुम्हाला कायदेशीर सल्ला हवा आहे का?

आमचे अनुभवी वकील तुमच्या कायदेशीर प्रश्नांबाबत मदत करण्यास तयार आहेत.

संबंधित लेख

रॅन्समवेअर, फिशिंग, डीडॉस हल्ले आणि संगणक घुसखोरी यांसारख्या सायबर हल्ल्यांचा परिणाम क्वचितच केवळ संस्थेवर होतो.

जवळपास प्रत्येक व्यावसायिक सॉफ्टवेअर उत्पादनात ओपन सोर्स घटक असतात, सहसा शेकडो, जे डेव्हलपर्सद्वारे निवडलेले असतात.

एआय पॉलिसी म्हणजे अंतर्गत नियमांचा असा संच आहे जो ठरवतो की कसे, का आणि कोणत्या परिस्थितीत.

हॅशटॅगची ट्रेडमार्क म्हणून नोंदणी केली जाऊ शकते, आणि अनेकांची तशी नोंदणी झालीही आहे.

GDPR मध्ये डेटा जतन करण्याच्या कालावधीबद्दल कोणताही तक्ता दिलेला नाही. नियम असा आहे की वैयक्तिक डेटा...

डिजिटल सेवा कायदा डिजिटल मार्केटिंगमध्ये तीन ठोस प्रकारे बदल घडवतो: प्रत्येक जाहिरात

डच कायद्याबद्दल अद्ययावत रहा

नवीनतम कायदेशीर माहिती, नियामक अद्यतने आणि व्यावहारिक सल्ल्यासाठी आमच्या वृत्तपत्रिकेची सदस्यता घ्या.