मेन्यू

देश डेटा कवरेज जाँच सूची: तीन अवस्थाएँ और न्यूनतम फ़ील्ड सेट

देश डेटा कवरेज जाँच सूची तभी अर्थ रखती है जब वह लागू, लागू नहीं और अनुपलब्ध मानों को अलग रखे। ऐसी सूची बनाने और पढ़ने का तरीका यहाँ है।

प्रकाशित

  • कवरेज
  • परीक्षण डेटा
  • लेखा परीक्षण

देश डेटा कवरेज जाँच सूची किसी संख्या पर पहली बहस तक सरल दिखती है। दो लोग एक ही डेटासेट गिनते हैं, दो अलग जोड़ निकालते हैं, और दोनों में से कोई गलत नहीं होता। असहमति लगभग कभी गणित की नहीं होती; वह इस बात की होती है कि गिना क्या जा रहा था और किसने तय किया कि खाली खाना एक समस्या है।

यह लेख जाँच सूची को एक मापन यंत्र की तरह देखता है। इसमें फ़ील्ड की तीन अवस्थाएँ, ऐसा हर भाजक चुनना जो प्रतिशत को अर्थ दे, और ऐसी सूची का आकार शामिल है जिसे कोई दूसरा व्यक्ति आपसे पूछे बिना जाँच सके कि आपका आशय क्या था।

कवरेज जाँच सूची को असल में क्या गिनना चाहिए?

ईमानदार उत्तर यह है कि वह मान नहीं, सहमतियाँ गिनती है। देश और फ़ील्ड के हर जोड़े के लिए सूची में यह दर्ज होना चाहिए कि डेटा मॉडल की अपेक्षा और उस देश की वास्तविकता एक-दूसरे से मिलती हैं या नहीं।

यह ढाँचा बदल देता है कि कमी कैसी दिखती है। खाली खाना अपने आप दोष नहीं होता, और भरा खाना अपने आप कवरेज नहीं होता। जिस इकाई को मापा जा रहा है वह एक निर्णय है: इस देश के लिए, क्या यह फ़ील्ड कुछ रखनी चाहिए, और क्या वह रखती है? सूची में बाकी सब इस प्रश्न को हर तालिका के बजाय हर देश के लिए उत्तर देने से निकलता है।

जो सूची एक ही बड़ा आँकड़ा बताती है वह इसी कारण लगभग बेकार है। वह हज़ारों निर्णयों को एक संख्या में समेट देती है और वह जानकारी फेंक देती है जो पाठक को कुछ करने के लिए चाहिए।

तीन अवस्थाएँ: लागू, लागू नहीं, अनुपलब्ध

तीन अवस्थाओं को अलग-अलग दर्ज करना ज़रूरी है, और इनमें से किन्हीं दो को मिला देना ही कवरेज के आँकड़ों को वास्तविकता से सपाट कर देता है।

अवस्था अर्थ यह जो माँगती है
लागू और मौजूद इस देश में इस तरह का डेटा है और मान संचित है कुछ नहीं, बस उसे अद्यतन रखना
लागू नहीं इस देश की व्यवस्था में ऐसी फ़ील्ड ही नहीं है स्पष्ट चिह्न, ताकि कोई ऐसा मान न ढूँढ़े जो हो ही नहीं सकता
अनुपलब्ध इस देश में मान होना चाहिए और नहीं है सुधार, एक ज़िम्मेदार व्यक्ति और एक तारीख़

बीच वाली अवस्था ही खो जाती है। जब उसे खाली खाने के रूप में दर्ज किया जाता है, तो बाद में वह कमी पढ़ी जाती है, और कोई एक हफ़्ता ऐसी चीज़ भरने में लगा देता है जिसका कोई स्रोत ही नहीं। जब उसे एक मान के रूप में दर्ज किया जाता है — शून्य या खाली पाठ जैसा प्लेसहोल्डर — तो नीचे की रिपोर्टें एक झूठा तथ्य विरासत में ले लेती हैं और उसे सच मान लेती हैं।

तीनों अवस्थाओं को अलग दर्ज करना ही भाजक को ईमानदार रखता है। लागू फ़ील्डों पर मापा गया कवरेज एक प्रश्न का उत्तर देता है; सभी फ़ील्डों पर मापा गया कवरेज दूसरे का, और सुधार केवल पहले वाले में ही होता है।

कवरेज देश के हिसाब से मापें या फ़ील्ड के हिसाब से?

दोनों तरह से, और यह चुनाव लिखा जाना चाहिए, क्योंकि ये दो आँकड़े तेज़ी से अलग हो सकते हैं।

देश के हिसाब से प्रश्न यह है कि कोई देश कितनी पूर्णता से दर्शाया गया है। देशों के आर-पार फ़ील्ड के हिसाब से प्रश्न यह है कि कोई फ़ील्ड व्यापक रूप से उपयोगी है या कुछ गिनी-चुनी प्रविष्टियों के लिए मौजूद है। जो फ़ील्ड एक क्षेत्र को छोड़कर हर जगह मौजूद है, वह फ़ील्ड के हिसाब से उत्तम दिखती है और देश के हिसाब से एक छेद जैसी।

दो परंपराएँ अधिकतर उलझन रोक देती हैं। भाजक को फ़ुटनोट के बजाय तालिका के शीर्षक में लिखें। और भारित तथा अभारित आँकड़ों को अलग रखें: ट्रैफ़िक, आमदनी या रिकॉर्ड संख्या से भार देना किसी व्यावसायिक प्रश्न का उत्तर है, जबकि देश गिनना किसी डेटा प्रश्न का। जो सूची इन दोनों को मिला देती है वह ऐसी संख्या निकालती है जिसे कोई नहीं बचा सकता।

न्यूनतम फ़ील्ड सेट और उसके ऊपर का सब कुछ

उन फ़ील्डों से शुरू करें जो लगभग हर देश में किसी न किसी रूप में होती हैं — एक कोड, एक नाम, एक मुद्रा, एक समय क्षेत्र — और उसे न्यूनतम सेट कहें। इसे पहले मापें और अलग प्रकाशित करें।

कारण संकेत और शोर का अनुपात है। वैकल्पिक फ़ील्डें देशों के बीच इतनी भिन्न होती हैं कि एक मिलाया हुआ कुल जोड़ किसी भी समूह के बारे में लगभग कुछ नहीं बताता। न्यूनतम सेट को एक खंड में रखने का अर्थ है कि वहाँ की विफलता एक असली चेतावनी है, जबकि किसी पतली वैकल्पिक फ़ील्ड पर उसकी अपनी शर्तों पर बात हो सकती है।

न्यूनतम सेट के ऊपर हर वैकल्पिक फ़ील्ड को उन देशों के साथ सूचीबद्ध करें जहाँ वह लागू होती है, उन देशों के साथ जहाँ नहीं, और उन देशों के साथ जहाँ उत्तर अब भी अज्ञात है। तीसरा स्तंभ ही वह हिस्सा है जिसे अधिकतर सूचियाँ छोड़ देती हैं, और आम तौर पर वही सबसे उपयोगी होता है, क्योंकि वह फ़ैसला नहीं, काम की क़तार है।

जिस देश में एक से अधिक राजभाषा हों, उसे कैसे दर्ज करें?

जिस देश में कई राजभाषाएँ हैं वह इस मान्यता को तोड़ता है कि हर पंक्ति में हर स्तंभ के लिए एक ही मान होता है। भाषा स्तंभ एक मान रखता है या अनेक, यह एक मॉडलिंग निर्णय है, और यह पहली पंक्ति भरने से पहले लिया जाना चाहिए, न कि पहली रिपोर्ट गलत आने के बाद।

यदि स्तंभ एक मान रखता है, तो बाकी कुछ और — एक अलग तालिका या एक स्पष्ट नियम — उठाना पड़ेगा, और सूची को बताना होगा कि कौन सा। यदि वह कई मान रखता है, तो शीट की हर गिनती को यह स्पष्ट करना होगा कि कई मानों वाला देश एक पंक्ति जोड़ता है या कई, क्योंकि वह चुनाव नीचे के हर जोड़ को बदल देता है।

यही प्रश्न मुद्रा और प्रभाग नामों पर भी लागू होता है, जो एक ही देश के भीतर बहुवचन हो सकते हैं। सूची को मॉडलिंग की बहस सुलझानी नहीं है, पर यह दर्ज करना है कि कौन सा उत्तर चुना गया, ताकि बाद का पाठक निर्णय को भूल से अलग पहचान सके।

डेवलपरों के लिए: सूची को प्रश्न-योग्य बनाएँ

जो सूची किसी दस्तावेज़ में रहती है वह एक बार पढ़ी जाती है और छोड़ दी जाती है। जो सूची प्रश्न-योग्य होती है वह किसी प्रक्रिया में जाँची जाती है और सही बनी रहती है।

उसे डेटा के रूप में दर्शाएँ: प्रति देश और प्रति फ़ील्ड एक रिकॉर्ड, जिसमें अवस्था, स्रोत, वह तारीख़ जब अवस्था तय हुई, और ज़िम्मेदार व्यक्ति हो। फिर मायने रखने वाले प्रश्न साधारण क्वेरी बन जाते हैं। किन देशों में वह फ़ील्ड नहीं है जो न्यूनतम सेट माँगता है? पिछली रिलीज़ के बाद किन फ़ील्डों की अवस्था बदली? किन देशों की अवस्था एक रिलीज़ चक्र से अधिक समय से अज्ञात है?

अज्ञात को छानकर हटाने के बजाय दिखाई देने दें। डिफ़ॉल्ट के पीछे छिपा अज्ञात सबसे महँगा होता है, क्योंकि वह चुपचाप वही गिना जाता है जो डिफ़ॉल्ट कहता है। और जब आप पाठक को भीतर के देश-नोट्स की ओर भेजें, तो देश और क्षेत्र निर्देशिका तटस्थ जगह है, जबकि जर्मनी प्रविष्टि जैसा पृष्ठ दिखाता है कि एक देश से किस स्तर का विवरण अपेक्षित है। जोड़ाई से जुड़े प्रश्नों के लिए देश और प्रभाग कोड मार्गदर्शिका उस कोड पक्ष को समझाती है जिसे यह सूची जानबूझकर छोड़ती है।

यहाँ दिखाया गया सब कुछ उदाहरण मात्र है। इस सूची में दिए फ़ील्ड नाम, अवस्थाएँ और उदाहरण मान परीक्षण की चर्चा के लिए लिखी गई काल्पनिक सामग्री हैं, किसी वास्तविक सिस्टम, संस्था या डेटासेट का मापन नहीं, और इन्हें किसी निष्कर्ष के रूप में उद्धृत नहीं किया जाना चाहिए।

आगे के कदम

सूची का पहला संस्करण एक ऐसी फ़ील्ड के लिए बनाएँ जिस पर आपको पहले से भरोसा है और एक ऐसी के लिए जिस पर संदेह है, और दोनों को साथ रखकर देखें। यह अंतर आम तौर पर एक घंटे के भीतर दिखा देता है कि शीट कुछ माप रही है या नहीं। जब सूची स्थिर हो जाए, तो देशों के आर-पार परीक्षण डेटा फैलाने की मार्गदर्शिका वहाँ से आगे उठाती है जहाँ मापन रुकता है, और परीक्षण डेटा के लिए देश चुनने की मार्गदर्शिका बताती है कि इसके नीचे की देश-सूची चुनी ही कैसे जाए। दोनों यहाँ से पढ़ें: देशों के आर-पार परीक्षण डेटा फैलाना और परीक्षण डेटा के लिए देश चुनना।

आगे पढ़ें

86 देशों के लिए पता और पहचान डेटा प्रारूप संबंधित गाइड

86 देशों के लिए पता और पहचान डेटा प्रारूप संबंधित गाइड

यहाँ केवल इस पृष्ठ के विषय से जुड़े लेख दिखाए गए हैं।