कार्यस्थल कार्यों के लिए बड़े भाषा मॉडलों का चयन और परीक्षण
5 अक्टूबर 2026 · 2 मिनट पठन
इन भाषाओं में भी प्रकाशित Italiano
एक विशेषज्ञ ने व्यावसायिक कार्यों के लिए Claude, GPT और Gemini जैसे बड़े भाषा मॉडलों का मूल्यांकन करने और उन्हें चुनने के तरीके साझा किए हैं। उन्होंने बताया कि प्रकाशित परीक्षण मॉडल तुलना के लिए शुरुआती बिंदु प्रदान करते हैं, लेकिन वास्तविक चयन के लिए विशिष्ट कार्यों और स्पष्ट स्वीकृति शर्तों की आवश्यकता होती है।
कोड सुधार और दस्तावेज़ तैयार करने के संदर्भ में, Fable 5.1 ने पहली बार में लगभग त्रुटिहीन कोड प्रदान करके सकारात्मक प्रभाव डाला है। कोड की गुणवत्ता जांचने के लिए एक मौजूदा परियोजना में छोटे सुधार, जैसे कि तारीख के प्रारूप के कारण विफल होने वाले CSV आयात को ठीक करना, एक प्रभावी तरीका है। इसमें यह देखा जाता है कि क्या नया परीक्षण त्रुटि को पकड़ता है, क्या सुधार उसे दूर करता है और क्या मौजूदा जांचें पास होती रहती हैं। दस्तावेज़ों के लिए, रिपोर्ट से प्रस्तुति तैयार करने की क्षमता का परीक्षण किया जाता है ताकि यह सुनिश्चित हो सके कि मूल संख्याएं और संदर्भ सुरक्षित हैं।
Anthropic के API मूल्य निर्धारण के अनुसार, Fable 5.1 के लिए प्रति दस लाख इनपुट टोकन की लागत $10 और प्रति दस लाख आउटपुट टोकन की लागत $50 है। इसकी तुलना में, Opus 5 की दरें $5 और $25 हैं, जबकि Sonnet 5 के लिए ये $2 और $10 हैं। इन गणनाओं के आधार पर, Fable मॉडल Opus से दोगुना और Sonnet से पांच गुना अधिक महंगा है।
Fable के अपडेट में एक महत्वपूर्ण बदलाव यह है कि कैश पढ़ना $1 से घटकर $0.25 प्रति दस लाख टोकन हो गया है। Anthropic का यह दावा कि यह 45% तक सस्ता हो सकता है, विशेष रूप से उन लंबी एजेंट परिदृश्यों के लिए प्रासंगिक है जहाँ संदर्भ का बार-बार उपयोग किया जाता है, हालांकि यह हर एकल अनुरोध पर लागू नहीं होता है।