अपने डेटा पर AI ट्रेन करना: क्या काम करता है, क्या नहीं

अपनी कंपनी के डेटा पर AI चाहने वाले लगभग हर कारोबारी वह चीज़ माँगते हैं जिसकी उन्हें ज़रूरत नहीं। सस्ता विकल्प बेहतर काम करता है और उसे जाँचना भी आसान है।

Terence
9 मिनट पढ़ना

अपने डेटा पर AI ट्रेन करना। फ़ोन करने वाले ज़्यादातर कारोबारी इसे इसी तरह कहते हैं। उन्हें ऐसा सहायक चाहिए जो उनकी रेट लिस्ट जानता हो, उनके अनुबंध, उनकी मैनुअल और किसी ग्राहक के साथ कभी हुई बातें। इंटरनेट जानने वाला AI नहीं, बल्कि उनका कारोबार जानने वाला। पूरी तरह तार्किक। बस दस में से नौ बार ट्रेन करना वह काम नहीं है जो होना चाहिए, और इससे काफ़ी पैसा बचता है।

यह लेख तीन बातों पर है: उस एक वाक्य के पीछे छिपे तीन मतलब, आप शायद कौन-सा कह रहे हैं, और व्यवहार में गड़बड़ कहाँ होती है। आँकड़ों के साथ, और तकनीकी भाषा के बिना।

अपने डेटा पर AI ट्रेन करने के तीन अलग मतलब

जब तीन कारोबारी एक ही वाक्य बोलते हैं, तो अक्सर उनका मतलब तीन अलग चीज़ों से होता है। इन्हें अलग करना फ़ायदेमंद है, क्योंकि इनकी कीमत में हज़ार गुना का फ़र्क है।

  • बातचीत में दस्तावेज़ जोड़ना। आप एक pdf को चैट विंडो में खींचते हैं और उस पर सवाल पूछते हैं। मुफ़्त, तुरंत, और बातचीत ख़त्म होते ही ग़ायब।
  • AI को अपने ही संग्रह में खोजने देना। आपके दस्तावेज़ ऐसे तैयार किए जाते हैं कि हर सवाल पर पहले सही हिस्से निकाले जाएँ और जवाब उन्हीं पर बने, साथ में दस्तावेज़ का नाम भी।
  • मॉडल को ही ढालना। आप किसी मौजूदा AI मॉडल को अपनी सामग्री से सिखाते हैं ताकि उसका व्यवहार बदल जाए।

पहला तो लगभग हर कोई पहले से इस्तेमाल कर रहा है। तीसरा वही है जो ज़्यादातर लोग ट्रेन करना कहते समय सोचते हैं। और दूसरा वही है जो उन्हें असल में चाहिए।

तीसरा हम कम ही बनाते हैं। इसलिए नहीं कि यह हो नहीं सकता, बल्कि इसलिए कि लगभग हर मामले में इससे आपको कुछ नहीं मिलता और पैसा फिर भी लगता है। कोई आपको आपके डेटा पर ट्रेन किया मॉडल बेच रहा हो, तो पहले पूछिए कि अगर वह ऐसा न करे तो क्या बिगड़ जाएगा।

मॉडल को दोबारा ट्रेन करना लगभग कभी जवाब क्यों नहीं होता

दोबारा ट्रेन करने से मॉडल का बर्ताव बदलता है: उसका लहजा, उसका ढाँचा, उसके पेशेवर शब्द। जो वह भरोसे से नहीं करता, वह है तथ्य याद रखना। और तथ्य ही वह चीज़ है जो आप ढूँढ रहे होते हैं जब जानना हो कि 2023 के उस अनुबंध में वारंटी की अवधि क्या लिखी है।

  • तथ्य धुँधले पड़ जाते हैं। दोबारा ट्रेन किया मॉडल ऐसा जवाब देता है जो आपके दस्तावेज़ों जैसा लगता है, ज़रूरी नहीं कि वही हो जो उनमें लिखा है।
  • आप जाँच नहीं सकते कि जवाब कहाँ से आया। न दस्तावेज़, न पृष्ठ संख्या, न नियंत्रण।
  • हर बदलाव पर नया दौर लगता है। जनवरी में नई रेट लिस्ट? फिर से शुरू।
  • कुछ हटाना मुश्किल है। जो ग्राहक पूछे कि उसका डेटा सचमुच मिट गया या नहीं, वह ज़्यादातर हिस्सा जैसा जवाब नहीं मानेगा।
  • यह विकल्पों से काफ़ी महँगा है, पैसे में भी और समय में भी।

एक अपवाद है, और छोटे कारोबार में वह सच में दुर्लभ है। अगर आपको दिन में बहुत बार ठीक एक ही तरह का पाठ अपने तय ढाँचे में बनाना पड़ता है, जैसे हज़ारों छोटे मानकीकृत आकलन, तो दोबारा ट्रेन करना समझ में आ सकता है। तब आप ढाँचा ख़रीद रहे हैं, ज्ञान नहीं। अगर यह आपकी बात नहीं है, तो यह आपके लिए नहीं है।

जो काम करता है: पहले खोजो, फिर जवाब दो

जो आपको लगभग हमेशा चाहिए, वह समझने में आसान है। आपके दस्तावेज़, यानी मैनुअल, कोटेशन, अनुबंध, बैठक की कार्यवाही और दरों के समझौते, ऐसे तैयार किए जाते हैं कि उनमें अर्थ के आधार पर खोजा जा सके, सिर्फ़ ठीक-ठीक शब्दों से नहीं। कोई आम भाषा में सवाल पूछता है। सिस्टम वही चंद हिस्से निकालता है जो सचमुच मायने रखते हैं। उसके बाद ही उन हिस्सों के आधार पर जवाब लिखा जाता है।

आज आपके पास जो खोज सुविधा है उससे फ़र्क यह है: वह फ़ाइलें ढूँढती है, यह जवाब ढूँढता है। आज सोलर पैनल वारंटी खोजिए तो बारह फ़ाइल नाम मिलेंगे और पढ़ना आपको ही है। दूसरी सूरत में मिलेगा: लगाने पर पाँच साल, पैनल पर पच्चीस साल, और नीचे लिखा कि यह किस दस्तावेज़ से आया।

यह स्रोत बताना सजावट नहीं है। यही एकमात्र चीज़ है जिससे कोई जवाब पर अमल करने से पहले उसकी सच्चाई जाँच सकता है। जो सिस्टम स्रोत नहीं बता सकता, वह कारोबारी इस्तेमाल के लिए अधूरा है।

~1 सेंट

हज़ार पन्नों की एक बार की तैयारी, प्रकाशित दरों पर

मैं एक निःशुल्क परिचय बातचीत से शुरुआत करता हूँ। हम चर्चा करते हैं कि किन कामों में समय लगता है, आप कौन से सिस्टम इस्तेमाल करते हैं और ऑटोमेशन कहाँ मदद कर सकता है। इसके बाद आपको ऑटोमेशन के अवसरों, कनेक्शन, समय-योजना और लागत का प्रस्ताव मिलता है।

गड़बड़ कहाँ होती है: तकनीक में नहीं, आपके दस्तावेज़ों में

इस मोड़ पर अटकने वाले लगभग हर प्रोजेक्ट में वजह AI नहीं होती। पाँच जानी-पहचानी वजहें।

  • आपस में टकराते संस्करण। फ़ोल्डर में तीन रेट लिस्ट हों और कोई मान्य न हो, तो कभी एक मिलेगी कभी दूसरी। यह AI की गलती नहीं, आपके संग्रह की है।
  • बिना पाठ के स्कैन किए दस्तावेज़। फ़ोटो खींचा गया अटैचमेंट कंप्यूटर के लिए बस एक तस्वीर है। हल हो सकता है, पर मेहनत लगती है।
  • अनुमतियाँ। सब कुछ खोजने योग्य होगा तो कर्मचारी फ़ाइल भी होगी। कौन क्या देख सकता है, यह पहले तय होता है, किसी के ढूँढ लेने के बाद नहीं।
  • जो जानकारी सिर्फ़ लोगों के दिमाग़ में है। जो कहीं लिखा ही नहीं, वह मिल भी नहीं सकता। कभी-कभी पहला कदम यही है कि वे दस बार-बार पूछी जाने वाली बातें लिख डालिए।
  • बहुत कम सवाल। हफ़्ते में पाँच बार कुछ ढूँढा जाता हो तो सिस्टम की लागत नहीं निकलेगी। तब जवाब एक सुव्यवस्थित फ़ोल्डर है।

बिखरे दस्तावेज़ों में खोजने वाला सहायक गड़बड़ी सुलझाने के बजाय उसे दिखा देता है। पहली ही बातचीत में अगर हमें दिखे कि असली समस्या संग्रह है, तो हम यह कह देते हैं। तब पहला कदम व्यवस्थित करना है, बनाना नहीं।

हमें अपनी भाषा का मॉडल चाहिए, और यह ग़लतफ़हमी क्यों है

सोच तार्किक है: आपके दस्तावेज़ एक भाषा में हैं, तो आप उसी भाषा का मॉडल चाहते हैं। सितंबर 2025 में इसकी जाँच करने वाला पहला गंभीर अध्ययन आया। एंटवर्प विश्वविद्यालय के भाषा-तकनीक शोधकर्ताओं ने MTEB-NL बनाया, चालीस डच परीक्षण सेटों वाला एक पैमाना, जिनमें क़ानूनी पाठ और निविदाएँ भी शामिल थीं।

नतीजा उम्मीद के उलट है। ख़ास तौर पर डच पाठ पर बने मॉडल, BERTje और RobBERT, सही हिस्सा ढूँढने में 17,6 और 18,3 अंक ला पाए। अंतरराष्ट्रीय बहुभाषी मॉडल 59,1 तक पहुँचे। पाठ पहचानने और वर्गीकृत करने में वही मॉडल ठीक-ठाक रहे, 50,9 बनाम 60,2। भाषा वे अच्छी तरह समझते हैं। बस कुछ ढूँढ नहीं पाते।

17,6 बनाम 59,1

भाषा-विशिष्ट मॉडल बनाम बहुभाषी मॉडल का खोज स्कोर (MTEB-NL, एंटवर्प विश्वविद्यालय, सितंबर 2025)

इसकी वजह उसी अध्ययन में है: खोजना एक अलग हुनर है जिसके लिए मॉडल को अलग से ढालना पड़ता है। वही मॉडल लीजिए और उसे खोज के लिए ढालिए, स्कोर 18,3 से उछलकर 51,6 हो जाता है। तो बात मॉडल की भाषा की नहीं, बल्कि इसकी है कि उसे आपकी भाषा में खोजने पर परखा गया है या नहीं। यही पूछिए। यह आपकी भाषा का मॉडल है, इस सवाल का जवाब नहीं है।

क्या आपके दस्तावेज़ देश में ही रहेंगे?

यह सवाल सबसे ज़्यादा पूछा जाता है और सबसे कम ठीक से सुलझाया जाता है। खोज वाले हिस्से के लिए अच्छी ख़बर है: उस अध्ययन में सबसे बेहतर मॉडल खुले रूप से उपलब्ध हैं और आपके अपने सर्वर पर चल सकते हैं। अच्छा स्कोर लाने वालों में एक इतना छोटा है कि भारी मशीन की ज़रूरत नहीं। यानी आपके संग्रह को इमारत से बाहर जाने की ज़रूरत नहीं।

जवाब लिखने वाले हिस्से में बात अलग है। वहाँ आमतौर पर किसी बड़े प्रदाता का बड़ा मॉडल इस्तेमाल होता है, और सवाल यह है कि वह चलता कहाँ है। कुछ प्रदाता यूरोप के भीतर प्रसंस्करण देते हैं, कुछ नहीं, और उनकी पेशकश के हिस्सों में भी फ़र्क होता है। पूछिए, अनुबंध में लिखवाइए, और सब ठीक रहेगा जैसे जवाब पर मत मानिए।

यह फ़ायदेमंद होने के लिए संग्रह कितना बड़ा चाहिए?

एक मोटा नियम है। मुट्ठी भर दस्तावेज़ हों तो आप उन्हें हर बार साथ भेज सकते हैं। यह ठीक चलता है और सस्ता भी है। लगभग चालीस पन्नों के ऊपर पलड़ा बदल जाता है: सब कुछ भेजना, चाहे जितनी बार इस्तेमाल करें, लक्षित खोज से महँगा हो जाता है। और उसके बाद संग्रह जितना बड़ा हो, फ़र्क उतना ही कम। लक्षित खोज में हज़ार पन्नों का सवाल लगभग उतना ही खर्च करता है जितना चालीस पन्नों का।

व्यवहार में: उत्पाद सूची, अनुबंधों का फ़ोल्डर या स्थापना निर्देशों का संग्रह हमेशा इससे कहीं ऊपर होता है। पाँच प्रक्रियाएँ और एक कर्मचारी पुस्तिका नहीं।

छोटे कारोबार आज कहाँ खड़े हैं

यह हारी हुई लड़ाई नहीं है, पर ऐसी दौड़ भी नहीं जो आप पहले ही हार चुके हों। नीदरलैंड के सांख्यिकी विभाग के अनुसार 2025 में दस या उससे ज़्यादा कर्मचारियों वाली 33 प्रतिशत कंपनियों ने AI इस्तेमाल किया, 2024 में 23 प्रतिशत और 2023 में 14 प्रतिशत के मुक़ाबले। दस से पचास कर्मचारियों वाली श्रेणी में यह 28 प्रतिशत है।

33%

2025 में 10 या अधिक कर्मचारियों वाली कंपनियों में AI का उपयोग; 10 से 50 कर्मचारियों पर 28 प्रतिशत (नीदरलैंड सांख्यिकी)

और यह इस्तेमाल उथला है। सितंबर 2025 में डच सरकार द्वारा प्रकाशित छोटे कारोबारों में AI उपयोग के अध्ययन से पता चलता है कि यह मुख्यतः पाठ लिखने, संवाद और दस्तावेज़ों के सार पर टिका है। ज़्यादा विशेषीकृत उपयोग कम ही हैं। यानी ठीक वहीं, आपके अपने दस्तावेज़ों से जुड़े काम में, जगह अब भी खुली है।

प्रतिशत से ज़्यादा दिलचस्प यह है कि कंपनियाँ शुरू क्यों नहीं करतीं। उन्हीं आँकड़ों में जो इस्तेमाल नहीं करते वे ज्ञान और अनुभव की कमी को ज़्यादा लागत के मुक़ाबले लगभग चार गुना ज़्यादा बार कारण बताते हैं। यानी यह पैसे की समस्या नहीं है। यह मुझे नहीं पता कहाँ से शुरू करूँ वाली समस्या है।

इसे कैसे शुरू करें

  • दो हफ़्ते तक लिखिए कि सचमुच कौन-से सवाल पूछे जाते हैं और जवाब कहाँ था। याद से नहीं, लिखकर, साथ में यह भी कि ढूँढने में कितना समय लगा।
  • गिनिए कि असल में कितने पन्नों की बात है। आमतौर पर यह फ़ोल्डर में पड़े ढेर का छोटा-सा हिस्सा होता है।
  • हर विषय के लिए एक मान्य दस्तावेज़ तय कीजिए और बाक़ी स्रोत से हटा दीजिए। प्रोजेक्ट इसी कदम पर टिकता या गिरता है।
  • एक टीम के एक तरह के सवाल से शुरू कीजिए। सब कुछ खोजने योग्य नहीं, बल्कि हमारे तकनीशियन स्थापना निर्देश देख सकें।
  • हर जवाब के साथ स्रोत माँगिए और एक हफ़्ते तक दो लोगों से नमूना जाँच करवाइए।
  • एक महीने बाद वही मापिए जो पहले कदम में मापा था। खोजने का समय कम नहीं हुआ, तो रोक दीजिए।

इससे जो मिलता है वह देखने में शायद ही शानदार होता है। कोई चतुर रोबोट नहीं आता। ऐसा व्यक्ति आता है जिसे यह जानने के लिए तीन साथियों को फ़ोन नहीं करना पड़ता कि कौन-सी वारंटी लागू है। वैसे, सौंपने के बाद सबसे ज़्यादा जो बात हम सुनते हैं वह AI के बारे में नहीं, दस्तावेज़ों के बारे में होती है: हमें पता ही नहीं था कि इतनी अव्यवस्था है।

यह मत कीजिए अगर आपके दस्तावेज़ ढूँढने के बजाय अभी लिखे ही जाने हैं, अगर हफ़्ते में मुट्ठी भर सवाल हैं, या अगर असली समस्या यह है कि कोई नहीं जानता कौन-सा दस्तावेज़ मान्य है। आख़िरी वाली बात सहमति से हल होती है, सॉफ़्टवेयर से नहीं।

शुरू करने के लिए तैयार हैं?

मुफ़्त परामर्श का अनुरोध करें। हम मिलकर देखते हैं कि आप कहाँ समय खो रहे हैं।

मुफ़्त कॉल शेड्यूल करें

क्या आप अपने व्यवसाय में यह पहचानते हैं?

एक मुफ़्त कॉल शेड्यूल करें। हम मिलकर देखते हैं कि आप कहाँ समय खो रहे हैं, और क्या AI समाधान है।

मुफ़्त कॉल शेड्यूल करें