टूल
गाइड

CSV टूलकिट

फ़ॉर्मेट

papaparse द्वारा CSV/TSV को पार्स, संरेखित और पूर्वावलोकन करें — कस्टम डिलिमिटर और उद्धरण चिह्नों के साथ, या CSV और JSON के बीच रूपांतरण करें। कॉलम छाँटें और डुप्लिकेट हटाएँ।

100% क्लाइंट-साइड कोई बैकएंड नहीं

दूरस्थ URL लाए नहीं जाते; अपना JSON सीधे पेस्ट करें।

इनपुट
आउटपुट
बाईं ओर CSV चिपकाएँ, फिर मोड चुनें।

यूरोप में अक्सर ; को CSV डिलिमिटर के रूप में उपयोग करते हैं।

इस पृष्ठ पर

CSV टूलकिट क्या है?#

CSV सारणीबद्ध डेटा के लिए सबसे-छोटा-साझा-भाजक फ़ॉर्मेट है — हर स्प्रेडशीट, हर डेटाबेस इम्पोर्ट विज़ार्ड, और हर एनालिटिक्स औज़ार इसे पढ़ सकता है, और उनमें से लगभग कोई भी विवरों पर सहमत नहीं है। क्या डिलिमीटर कॉमा है या सेमीकॉलन? क्या पहली पंक्ति हेडर रखती है? क्या वैल्यूज़ " या ' से कोट होते हैं? एक फ़ाइल जो एक औज़ार में सही खुलती है वह दूसरे में गड़बड़ आ सकती है, बस इसलिए कि डिफ़ॉल्ट भिन्न होते हैं। एक CSV टूलकिट इन विकल्पों को स्पष्ट बनाने और किसी फ़ाइल को इस तरह से पुनर्संरचित करने के लिए मौजूद है कि वह वह करे जो आपको ज़रूरत है।

यह पेज चार काम करता है, सब papaparse द्वारा चालित। संरेखित करें फ़ाइल पार्स करता है और हर सेल को उसके कॉलम की चौड़ाई तक पैड करता है, जो एक मोनोस्पेस, कॉलम-संरेखित ग्रिड बनाता है जिसे आप सीधे किसी कोड समीक्षा, README, या बग रिपोर्ट में चिपका सकते हैं — वह लेआउट जो किसी गलत संरेखित पंक्ति को तुरंत उभारता है। पूर्वावलोकन पार्स करता है और तालिका को पेज में रेंडर करता है, ताकि आप कुछ करने से पहले डेटा को आँखों से देख सकें। CSV → JSON पंक्तियों को JSON ऐरे (हेडर होने पर ऑब्जेक्ट्स का, अन्यथा ऐरेज़ का) में बदलता है। JSON → CSV दूसरी ओर जाता है, एक JSON ऐरे लेकर CSV निकालता है। इन सबके ऊपर, आप किसी भी कॉलम से सॉर्ट कर सकते हैं, पूर्ण पंक्तियाँ डी-डुप्लिकेट कर सकते हैं, डिलिमीटर (कॉमा, सेमीकॉलन, टैब, या कस्टम एकल कैरेक्टर) बदल सकते हैं, और कोट कैरेक्टर चुन सकते हैं — ठीक वे नॉब जो तय करते हैं कि फ़ाइल आपके पाइपलाइन में अगले औज़ार से बचेगी या नहीं।

इसका उपयोग कैसे करें#

  1. अपना CSV (या JSON → CSV मोड में JSON) बाईं ओर इनपुट पैनल में चिपकाएँ। प्लेसहोल्डर अपेक्षित आकार दिखाता है; नमूना एक छोटा डेटासेट लोड करता है।
  2. कोई मोड बटन चुनें: संरेखित करें, पूर्वावलोकन, या JSON। JSON चुना जाने पर, दिशा के लिए एक दूसरा बटन समूह दिखता है — CSV → JSON या JSON → CSV
  3. टूलबार पर संरचनात्मक विकल्प सेट करें:
    • डिलिमीटर — कॉमा, सेमीकॉलन, टैब, या कस्टम (कस्टम वैल्यू के लिए एक एकल-कैरेक्टर फ़ील्ड दिखता है, डिफ़ॉल्ट |)।
    • कोट — डबल (") या सिंगल (')।
    • पहली पंक्ति हेडर है — जब पंक्ति 1 कॉलम नाम रखती हो तब टिक करें; हेडररहित डेटा के लिए अनटिक करें। हेडर मोड पार्सिंग और JSON आउटपुट आकार दोनों को चलाता है।
  4. वैकल्पिक रूप से डेटा व्यवस्थित करें: कोई क्रमबद्ध करें कॉलम चुनें (आपके हेडर से भरा, या हेडररहित इनपुट के लिए एक न्यूमेरिक इंडेक्स), आरोही या अवरोही क्रम चुनें, और पूरी तरह डुप्लिकेट पंक्तियाँ गिराने के लिए डीडुप टिक करें।
  5. परिणाम आउटपुट पैनल (या पूर्वावलोकन मोड में पूर्वावलोकन ग्रिड) में पढ़ें। हेडर आउटपुट आकार और पंक्ति गणना दिखाता है; उसे लेने के लिए कॉपी का उपयोग करें। साफ़ करें दोनों पैनलों को रीसेट करता है।

यदि किसी पंक्ति में फ़ील्ड्स की ग़लत संख्या हो, या इनपुट विकृत हो, तो स्थिति पट्टी पंक्ति संख्या रिपोर्ट करती है ताकि आप स्रोत को ठीक कर सकें बजाय अनुमान लगाने के।

प्रमुख विशेषताएँ#

  • कॉलम-संरेखित आउटपुट। संरेखित करें मोड हर सेल को उसके कॉलम के सबसे लंबे वैल्यू तक पैड करता है, इसलिए कॉमा की दीवार जैसा दिखने वाला CSV अचानक संरेखित हो जाता है — किसी ऐसी पंक्ति को पहचानने के लिए अमूल्य जो एक फ़ील्ड छोटी है।
  • JSON तक दोनों दिशाएँ। CSV → JSON ऑब्जेक्ट्स का ऐरे (हेडर के साथ) या ऐरेज़ का ऐरे (हेडररहित) बनाता है। JSON → CSV दोनों में से किसी भी आकार को वापस स्वीकार करता है।
  • डिलिमीटर-जागरूक। कॉमा, सेमीकॉलन (यूरोपीय लोकेल में आम जहाँ कॉमा दशमलव विभाजक है), टैब (TSV), या कस्टम कैरेक्टर के बीच स्विच करें। टूलबार के नीचे का संकेत आपको याद दिलाता है कि सेमीकॉलन क्यों मौजूद हैं।
  • क्रमबद्ध और डी-डुप्लिकेट। जब दोनों वैल्यूज़ नंबर जैसे दिखते हों तब न्यूमेरिक रूप से सॉर्ट करें, अन्यथा लेक्सिकोग्राफ़िक रूप से। डीडुप सटीक पूर्ण-पंक्ति दोहराव हटाता है (हेडर पंक्ति हमेशा रखी जाती)।
  • सुरक्षित पूर्वावलोकन। पूर्वावलोकन ग्रिड सुरक्षित DOM API से बनता है — केवल textContent, कभी आपके डेटा का innerHTML नहीं — इसलिए <script> टैग्स से भरा CSV भी निष्क्रिय टेक्स्ट के रूप में रेंडर होता है।
  • सख्ती से क्लाइंट-साइड, 1 MB से ऊपर के इनपुट्स के लिए एक Web Worker के साथ।

कार्य उदाहरण#

एक छोटी रोस्टर जिसमें एक डुप्लिकेट पंक्ति और एक हेडर के साथ चिपकाई गई:

इनपुट:

name,role,city
Ada,Engineer,London
Lin,Designer,Taipei
Ada,Engineer,London
Sam,Manager,Berlin

तीसरी पंक्ति Ada को सटीक रूप से दोहराती है। कॉमा डिलिमीटर, हेडर चालू के साथ संरेखित करें पर क्लिक करें, फिर डीडुप टिक करें:

name role     city
Ada  Engineer London
Lin  Designer Taipei
Sam  Manager  Berlin

हर कॉलम अपने सबसे चौड़े वैल्यू तक पैड किया गया, इसलिए तीनों पंक्तियाँ संरेखित होती हैं और डुप्लिकेट Ada चली गई — स्थिति पट्टी एक पंक्ति हटाई गई बताती है। अब मोड को उन्हीं विकल्पों के साथ JSON (CSV → JSON) पर स्विच करें:

[
  { "name": "Ada", "role": "Engineer", "city": "London" },
  { "name": "Lin", "role": "Designer", "city": "Taipei" },
  { "name": "Sam", "role": "Manager", "city": "Berlin" }
]

हेडर पंक्ति ऑब्जेक्ट कुंजीयाँ बन गई; हर बची हुई डेटा पंक्ति एक ऑब्जेक्ट बन गई। role से सॉर्ट करना पंक्तियों को लेक्सिकोग्राफ़िक रूप से पुनर्व्यवस्थित करता; किसी न्यूमेरिक कॉलम से सॉर्ट करना वैल्यू से सॉर्ट करता।

अक्सर पूछे जाने वाले प्रश्न#

मुझे कॉमा के बजाय सेमीकॉलन कब उपयोग करना चाहिए?#

जब डेटा में वैल्यूज़ के हिस्से के रूप में कॉमा हों और आप किसी ऐसे लोकेल (यूरोप का अधिकांश, लैटिन अमेरिका) में हों जहाँ कॉमा दशमलव विभाजक है — 3,14 वहाँ एक एकल नंबर है, दो फ़ील्ड नहीं। उन लोकेलों में Excel डिफ़ॉल्ट रूप से सेमीकॉलनों के साथ CSV एक्सपोर्ट करता है। यदि कोई फ़ाइल सब कुछ कॉलम A में जाम कर खुलती है तो डिलिमीटर लगभग निश्चित रूप से ग़लत है; सेमीकॉलन पर स्विच करें और दोबारा संरेखित करें।

डीडुप वास्तव में किसकी तुलना करता है?#

यह हेडर अलग होने के बाद पूर्ण समानता के लिए संपूर्ण पंक्तियों की तुलना करता है। दो पंक्तियाँ केवल तभी डुप्लिकेट होती हैं जब हर फ़ील्ड, सेल-दर-सेल मेल खाता हो। हेडर पंक्ति कभी डुप्लिकेट नहीं मानी जाती और हमेशा रखी जाती है। आंशिक मिलान (समान नाम, अलग शहर) डुप्लिकेट नहीं होते।

CSV → JSON ऑब्जेक्ट्स और ऐरेज़ के बीच कैसे तय करता है?#

यदि पहली पंक्ति हेडर है टिक हो, तो हर डेटा पंक्ति एक ऑब्जेक्ट बन जाती है जिसकी कुंजीयाँ हेडर नाम हैं। यदि वह अनटिक हो, तो हर पंक्ति स्ट्रिंग्स का एक ऐरे बन जाती है, जो केवल पूर्वावलोकन में Col 1, Col 2 इत्यादि के रूप में लेबल किए जाते हैं — JSON आउटपुट ऐरेज़ का एक सादा ऐरे है। हेडर विकल्प तब टिक करें जब पंक्ति 1 सच में कॉलम नाम हों; कच्चे न्यूमेरिक ग्रिड के लिए इसे अनटिक रखें।

क्या मेरा डेटा कहीं अपलोड होता है?#

नहीं। पार्सिंग और अनपार्सिंग दोनों papaparse के ज़रिए आपके ब्राउज़र में चलते हैं, जो पेज के साथ बंडल है। 1 MB से ऊपर की फ़ाइलें एक Web Worker में संभाली जाती हैं ताकि UI प्रतिक्रियाशील रहे, पर डेटा कभी आपका डिवाइस नहीं छोड़ता।