मॉडल

कार्यस्थल कार्यों के लिए बड़े भाषा मॉडलों का चयन और परीक्षण

5 अक्टूबर 2026 · 2 मिनट पठन

इन भाषाओं में भी प्रकाशित Italiano

Abstract blue glowing dots forming wave patterns
jonakoh _ / Unsplash

एक विशेषज्ञ ने व्यावसायिक कार्यों के लिए Claude, GPT और Gemini जैसे बड़े भाषा मॉडलों का मूल्यांकन करने और उन्हें चुनने के तरीके साझा किए हैं। उन्होंने बताया कि प्रकाशित परीक्षण मॉडल तुलना के लिए शुरुआती बिंदु प्रदान करते हैं, लेकिन वास्तविक चयन के लिए विशिष्ट कार्यों और स्पष्ट स्वीकृति शर्तों की आवश्यकता होती है।

कोड सुधार और दस्तावेज़ तैयार करने के संदर्भ में, Fable 5.1 ने पहली बार में लगभग त्रुटिहीन कोड प्रदान करके सकारात्मक प्रभाव डाला है। कोड की गुणवत्ता जांचने के लिए एक मौजूदा परियोजना में छोटे सुधार, जैसे कि तारीख के प्रारूप के कारण विफल होने वाले CSV आयात को ठीक करना, एक प्रभावी तरीका है। इसमें यह देखा जाता है कि क्या नया परीक्षण त्रुटि को पकड़ता है, क्या सुधार उसे दूर करता है और क्या मौजूदा जांचें पास होती रहती हैं। दस्तावेज़ों के लिए, रिपोर्ट से प्रस्तुति तैयार करने की क्षमता का परीक्षण किया जाता है ताकि यह सुनिश्चित हो सके कि मूल संख्याएं और संदर्भ सुरक्षित हैं।

Anthropic के API मूल्य निर्धारण के अनुसार, Fable 5.1 के लिए प्रति दस लाख इनपुट टोकन की लागत $10 और प्रति दस लाख आउटपुट टोकन की लागत $50 है। इसकी तुलना में, Opus 5 की दरें $5 और $25 हैं, जबकि Sonnet 5 के लिए ये $2 और $10 हैं। इन गणनाओं के आधार पर, Fable मॉडल Opus से दोगुना और Sonnet से पांच गुना अधिक महंगा है।

Fable के अपडेट में एक महत्वपूर्ण बदलाव यह है कि कैश पढ़ना $1 से घटकर $0.25 प्रति दस लाख टोकन हो गया है। Anthropic का यह दावा कि यह 45% तक सस्ता हो सकता है, विशेष रूप से उन लंबी एजेंट परिदृश्यों के लिए प्रासंगिक है जहाँ संदर्भ का बार-बार उपयोग किया जाता है, हालांकि यह हर एकल अनुरोध पर लागू नहीं होता है।