समझिए
1. Interviewer असल में क्या जाँच रहा है
"क्या आप Remove Duplicates दबा सकते हैं" नहीं — बल्कि: क्या आप कच्चा डेटा सुरक्षित रखते हैं? क्या पूछते हैं कि आउटपुट किसलिए है? क्या गणना से पहले समस्याएँ ढूँढते हैं? क्या टोटल जाँचते हैं? क्या मान्यताएँ समझा सकते हैं?
2. 7 कदम का framework
- सुरक्षित रखें — मूल फ़ाइल को न छुएँ; कॉपी पर या Power Query में काम करें।
- स्पष्ट करें — आउटपुट को किस सवाल का जवाब देना है, किसके लिए, कब तक?
- समझें — रो, कॉलम, grain ("एक रो = एक इनवॉइस लाइन?"), तारीख़ की रेंज, इकाइयाँ।
- Profile करें — कुछ भी ठीक करने से पहले हर समस्या की लिस्ट बनाएँ।
- साफ़ करें — बेहतर है Power Query में ताकि दोहराया जा सके; हर स्टेप लिखें।
- जाँचें — पहले बनाम बाद में रो की गिनती और टोटल; किसी जाने-पहचाने नंबर से मिलान।
- जवाब और बातचीत — नतीजा, मान्यताएँ, और स्रोत पर क्या ठीक करेंगे।
3. पहले दो मिनट — क्या कहें
"कुछ छूने से पहले मैं कच्ची फ़ाइल की कॉपी रखूँगा। क्या मैं पक्का कर सकता हूँ कि इससे क्या बनना है — मान लीजिए रीजन के हिसाब से मासिक बिक्री? पहले मैं बनावट देखूँगा: हेडर रो, डेटा टाइप, तारीख़ें, टोटल, डुप्लिकेट, और समस्याओं की लिस्ट बनाऊँगा। फिर Power Query में साफ़ करूँगा ताकि अगले महीने की फ़ाइल refresh हो सके, और आख़िरी टोटल का मिलान करूँगा।"
4. अभ्यास: messy_sales_export.csv
पहली लाइनें:
ABC Traders Pvt Ltd - Sales Register
Period: 01/01/2026 to 31/01/2026
Inv No,Inv Date,Customer,Region,Item,Qty,Amount (Rs)
INV-1001,2026-01-20,Sharma Traders,West,Chair,6,27000
INV-1002,25/01/2026,Sharma Traders,South,Laptop,6,330000
INV-1003,16/01/2026,Sharma Traders,north ,Laptop,4,220000
INV-1004,2026-01-14,Sharma Traders,north ,Desk,2,"24,000"
मिली समस्याएँ (profile स्टेप):
| # | समस्या | इलाज |
|---|---|---|
| 1 | हेडर के ऊपर 3 टाइटल/खाली लाइनें | Remove Top Rows (3), Use First Row as Headers |
| 2 | 3 फ़ॉर्मेट में तारीख़ें: 2026-01-20 (11 रो), 25/01/2026 (8), 20-Jan-26 (13) |
हर फ़ॉर्मेट साफ़-साफ़ पार्स करें (dd/mm/yyyy के लिए locale en-IN); ISO तारीख़ों को कभी day-first न पढ़ने दें — 2026-01-10 10-Jan ही रहे, 1-Oct नहीं |
| 3 | कॉमा वाले टेक्स्ट में Amount ("24,000") |
"," हटाएँ फिर टाइप नंबर करें |
| 4 | Region में case/स्पेस: north , WEST |
Trim + Proper/Capitalize Each Word |
| 5 | Customer के रूप: Gupta & Sons, sharma traders |
Trim + Proper; बाद में customer master |
| 6 | हूबहू डुप्लिकेट रो (INV-1010 दो बार) | Inv No पर डुप्लिकेट हटाएँ (पक्का करने के बाद कि सच में डुप्लिकेट हैं) |
| 7 | डेटा के अंदर एक खाली रो और 9,99,999 वाली "Sub Total" रो | वे रो फ़िल्टर करें जिनका Inv No "INV" से शुरू नहीं होता |
| 8 | Amount में "x" वाली "Grand Total" रो | वही फ़िल्टर |
जाँच: 32 साफ़ इनवॉइस · कुल ₹32,90,500 · North 12,31,000 · South 11,56,500 · West 9,03,000 · सारी तारीख़ें जनवरी 2026 के अंदर (2–30 Jan)। कच्चे कॉलम को जोड़ने पर डुप्लिकेट (36,000) और नकली subtotal (9,99,999) जुड़ जाते — या "x" पर फ़ेल हो जाता।
बातचीत: "32 इनवॉइस से साफ़ टोटल ₹32.9 लाख। मैंने एक डुप्लिकेट और दो टोटल रो हटाईं, रीजन और ग्राहक एक जैसे किए, और तीन तारीख़ फ़ॉर्मेट पार्स किए। सुझाव: ERP टीम से एक तारीख़ फ़ॉर्मेट और बिना subtotal वाला export माँगें; तब तक यह Power Query अगले महीने की फ़ाइल refresh करेगी।"
5. आप जो सवाल पूछ सकते हैं (इनसे अंक मिलते हैं)
- "Amount GST से पहले है या बाद?"
- "रद्द/credit-note इनवॉइस हटाने हैं?"
- "क्या यही अकेला स्रोत है, या इसे accounts के टोटल से मिलना चाहिए?"
- "आउटपुट कौन इस्तेमाल करता है, और कितनी बार?"
6. अगर सिर्फ़ 15 मिनट हों
1–4 स्टेप ज़ोर से करें, जवाब पर असर डालने वाली समस्याएँ ठीक करें (हेडर, रकम, टोटल रो, डुप्लिकेट, रीजन नाम), साफ़ "मान्यताएँ" लाइन के साथ टोटल दें, और बताएँ कि ज़्यादा समय मिलने पर बाकी क्या ठीक करते।
आम गलतियाँ
कच्चे डेटा पर pivot से शुरू करना। पहले लिस्ट बनाए बिना एक-एक समस्या हाथ से ठीक करना। टोटल का मिलान न करना। मान्यताएँ छिपाना।