Skip to content
ModelCap

Benchmark leaderboard

τ²-Bench Telecom (Artificial Analysis run)

τ²-Bench Telecom measures whether an agent can resolve telecom customer-service tasks through tool calls while a simulated user talks back. Artificial Analysis runs every model through the same harness, so the pass rate compares models rather than scaffolds. This page lists every model ModelCap tracks with a published AA τ²-Bench Telecom result, its best evaluated configuration, the source's own rank, and the model's ModelCap Index position, API price and context window.

Snapshot as of 1 September 2026

GLM 5.2 from Z.ai leads the τ²-Bench Telecom (Artificial Analysis run) among the 110 tracked models with 99.1% (tau2-bench-telecom configuration), per the source snapshot published 1 September 2026.

Tracked models with a result
110
Entries on the source board
439
Open-weight models listed
39

AA τ²-Bench Telecom standings (110 models)

Sorted by published score, one row per model. Source: Artificial Analysis.

τ²-Bench Telecom (Artificial Analysis run): every tracked model's published score, source rank, ModelCap Index position, price and context
#ModelScoreConfigurationSource rankModelCap IndexOutput $/1MContextWeightsPublished
1GLM 5.2Z.ai99.1%tau2-bench-telecom#1 / 439$3.041MOpen weights1 September 2026
2GLM 4.7 FlashZ.ai98.8%tau2-bench-telecom#3 / 439$0.40203KOpen weights1 September 2026
3Claude Fable 5Anthropic98.5%tau2-bench-telecom#4 / 439#1$50.001MAPI only1 September 2026
4GLM 5 TurboZ.ai98.5%tau2-bench-telecom#4 / 439#44$4.00203KAPI only1 September 2026
5GLM 5V TurboZ.ai98.5%tau2-bench-telecom#4 / 439#32$4.00203KAPI only1 September 2026
6Step 3.7 FlashStepFun98.5%tau2-bench-telecom#4 / 439#75$1.15262KOpen weights1 September 2026
7GLM 5Z.ai98.2%tau2-bench-telecom#8 / 439$1.92205KOpen weights1 September 2026
8GLM 5.1Z.ai97.7%tau2-bench-telecom#9 / 439$3.04205KOpen weights1 September 2026
9Grok 4.3xAI97.7%tau2-bench-telecom#9 / 439$2.501MAPI only1 September 2026
10Qwen3.6 PlusQwen97.7%tau2-bench-telecom#9 / 439$1.951MAPI only1 September 2026
11GLM 4.7Z.ai95.9%tau2-bench-telecom#16 / 439$1.75205KOpen weights1 September 2026
12Kimi K2.5Moonshot AI95.9%tau2-bench-telecom#16 / 439$2.25262KRestricted license1 September 2026
13Kimi K2.6Moonshot AI95.9%tau2-bench-telecom#16 / 439$4.00262KRestricted license1 September 2026
14Gemini 3.1 Pro PreviewGoogle95.6%tau2-bench-telecom#20 / 439#8$12.001MAPI only1 September 2026
15Qwen3.5 397B A17BQwen95.6%tau2-bench-telecom#20 / 439#28$3.50262KOpen weights1 September 2026
16Gemini 3.5 FlashGoogle95.3%tau2-bench-telecom#24 / 439$9.001MAPI only1 September 2026
17Qwen3.6 35B A3BQwen95.3%tau2-bench-telecom#24 / 439#66$0.90262KOpen weights1 September 2026
18Qwen3.7 MaxQwen94.7%tau2-bench-telecom#30 / 439$4.421MAPI only1 September 2026
19Claude Opus 4.8Anthropic94.4%tau2-bench-telecom#31 / 439$25.001MAPI only1 September 2026
20Mistral Medium 3.5Mistral AI94.2%tau2-bench-telecom#34 / 439#41$7.50262KAPI only1 September 2026
21Qwen3.6 27BQwen94.2%tau2-bench-telecom#34 / 439$3.60262KOpen weights1 September 2026
22GPT-5.5OpenAI93.9%tau2-bench-telecom#39 / 439#9$30.001MAPI only1 September 2026
23Qwen3.5-27BQwen93.9%tau2-bench-telecom#39 / 439$1.56262KOpen weights1 September 2026
24Qwen3.5-122B-A10BQwen93.6%tau2-bench-telecom#42 / 439#43$2.40262KOpen weights1 September 2026
25Grok 4.20xAI93.0%tau2-bench-telecom#47 / 439$2.502MAPI only1 September 2026
26Kimi K2 ThinkingMoonshot AI93.0%tau2-bench-telecom#47 / 439#34$2.50262KRestricted license1 September 2026
27Qwen3.7 PlusQwen93.0%tau2-bench-telecom#47 / 439#21$1.281MAPI only1 September 2026
28Hy3 previewTencent92.7%tau2-bench-telecom#52 / 439$0.60262KRestricted license1 September 2026
29GPT-5.2-CodexOpenAI92.1%tau2-bench-telecom#55 / 439$14.00400KAPI only1 September 2026
30Kimi K2.7 CodeMoonshot AI90.1%tau2-bench-telecom#68 / 439#30$3.40262KRestricted license1 September 2026
31Trinity Large ThinkingArcee AI90.1%tau2-bench-telecom#68 / 439#78$0.80262KRestricted license1 September 2026
32KAT-Coder-Pro V2Kuaishou89.5%tau2-bench-telecom#71 / 439#57$1.20262KAPI only1 September 2026
33Qwen3.5-35B-A3BQwen89.2%tau2-bench-telecom#73 / 439$1.25262KOpen weights1 September 2026
34MiniMax M3MiniMax88.9%tau2-bench-telecom#74 / 439#25$1.201MRestricted license1 September 2026
35Claude Opus 4.7Anthropic88.6%tau2-bench-telecom#76 / 439$25.001MAPI only1 September 2026
36Step 3.5 FlashStepFun87.4%tau2-bench-telecom#82 / 439$0.30262KOpen weights1 September 2026
37GPT-5.4OpenAI87.1%tau2-bench-telecom#84 / 439$15.001MAPI only1 September 2026
38Qwen3.5-9BQwen86.8%tau2-bench-telecom#87 / 439#87$0.15262KOpen weights1 September 2026
39Claude Opus 4.5Anthropic86.3%tau2-bench-telecom#92 / 439$25.00200KAPI only1 September 2026
40GPT-5.6 TerraOpenAI86.3%tau2-bench-telecom#92 / 439#13$12.001MAPI only1 September 2026
41Solar Pro 3Upstage86.3%tau2-bench-telecom#92 / 439$0.60131KAPI only1 September 2026
42GPT-5.3-CodexOpenAI86.0%tau2-bench-telecom#96 / 439#24$14.00400KAPI only1 September 2026
43GPT-5.6 SolOpenAI85.1%tau2-bench-telecom#99 / 439#5$10.001MAPI only1 September 2026
44Claude Opus 4.6Anthropic84.8%tau2-bench-telecom#102 / 439$25.001MAPI only1 September 2026
45GPT-5OpenAI84.8%tau2-bench-telecom#102 / 439$10.00400KAPI only1 September 2026
46GPT-5.2OpenAI84.8%tau2-bench-telecom#102 / 439$14.00400KAPI only1 September 2026
47Qwen3 Max ThinkingQwen83.6%tau2-bench-telecom#114 / 439#64$3.90262KAPI only1 September 2026
48GPT-5.4 MiniOpenAI83.3%tau2-bench-telecom#116 / 439#22$4.50400KAPI only1 September 2026
49Nemotron 3 UltraNVIDIA83.3%tau2-bench-telecom#116 / 439#48$2.40262KRestricted license1 September 2026
50GPT-5.1-CodexOpenAI83.0%tau2-bench-telecom#119 / 439$10.00400KAPI only1 September 2026
51GPT-5.1OpenAI81.9%tau2-bench-telecom#121 / 439$10.00400KAPI only1 September 2026
52Nex-N2-ProNex AGI81.6%tau2-bench-telecom#122 / 439#33$1.00262KOpen weights1 September 2026
53o3OpenAI80.7%tau2-bench-telecom#128 / 439#39$8.00200KAPI only1 September 2026
54Claude Sonnet 4.6Anthropic79.5%tau2-bench-telecom#133 / 439$15.001MAPI only1 September 2026
55Qwen3 Coder NextQwen79.5%tau2-bench-telecom#133 / 439#91$0.80262KOpen weights1 September 2026
56GLM 4.6Z.ai76.9%tau2-bench-telecom#141 / 439$2.20205KOpen weights1 September 2026
57GPT-5.4 NanoOpenAI76.0%tau2-bench-telecom#142 / 439#47$1.25400KAPI only1 September 2026
58Qwen3 MaxQwen74.3%tau2-bench-telecom#149 / 439$3.90262KAPI only1 September 2026
59Mercury 2Inception Labs70.8%tau2-bench-telecom#162 / 439#85$0.75128KAPI only1 September 2026
60GPT-5 MiniOpenAI68.4%tau2-bench-telecom#169 / 439$2.00400KAPI only1 September 2026
61Nemotron 3 SuperNVIDIA67.8%tau2-bench-telecom#172 / 439#79$0.401MRestricted license1 September 2026
62GPT-5.1-Codex-MiniOpenAI62.9%tau2-bench-telecom#185 / 439#69$2.00400KAPI only1 September 2026
63o1OpenAI62.6%tau2-bench-telecom#186 / 439$60.00200KAPI only1 September 2026
64Gemma 4 31BGoogle59.9%tau2-bench-telecom#191 / 439#31$0.34262KOpen weights1 September 2026
65o4 MiniOpenAI55.6%tau2-bench-telecom#196 / 439#62$4.40200KAPI only1 September 2026
66Gemini 2.5 ProGoogle54.1%tau2-bench-telecom#199 / 439$10.001MAPI only1 September 2026
67GPT-4.1 MiniOpenAI52.9%tau2-bench-telecom#203 / 439$1.601MAPI only1 September 2026
68GPT-4.1OpenAI47.1%tau2-bench-telecom#214 / 439$8.001MAPI only1 September 2026
69GLM 4.5 AirZ.ai46.5%tau2-bench-telecom#217 / 439#76$0.85131KOpen weights1 September 2026
70Gemma 4 26B A4BGoogle43.6%tau2-bench-telecom#226 / 439#38$0.34262KOpen weights1 September 2026
71Qwen3 Coder 480B A35BQwen43.6%tau2-bench-telecom#226 / 439#65$1.00262KOpen weights1 September 2026
72GLM 4.5Z.ai43.0%tau2-bench-telecom#229 / 439$2.20131KOpen weights1 September 2026
73Mistral Medium 3.1Mistral AI40.6%tau2-bench-telecom#234 / 439$2.00131KAPI only1 September 2026
74North Mini CodeCohere37.4%tau2-bench-telecom#238 / 439#96Free256KOpen weights1 September 2026
75GPT-5 NanoOpenAI36.5%tau2-bench-telecom#242 / 439$0.40400KAPI only1 September 2026
76Qwen3 VL 235B A22B InstructQwen35.1%tau2-bench-telecom#248 / 439#56$1.90262KOpen weights1 September 2026
77Qwen2.5 72B InstructQwen34.5%tau2-bench-telecom#251 / 439#180$0.4033KRestricted license1 September 2026
78Qwen3 Coder 30B A3B InstructQwen34.5%tau2-bench-telecom#251 / 439#181$0.28262KOpen weights1 September 2026
79MiniMax M1 80kMiniMaxAI34.2%tau2-bench-telecom#255 / 439#1711MOpen weights1 September 2026
80Qwen3 235B A22B Instruct 2507Qwen33.3%tau2-bench-telecom#258 / 439#50$0.35262KOpen weights1 September 2026
81Mistral Large 2407Mistral AI33.0%tau2-bench-telecom#259 / 439$6.00131KAPI only1 September 2026
82Gemini 3.1 Flash Lite PreviewGoogle31.3%tau2-bench-telecom#270 / 439$1.501MAPI only1 September 2026
83GLM 4.6VZ.ai30.7%tau2-bench-telecom#272 / 439#81$0.90131KOpen weights1 September 2026
84Qwen3 VL 32B InstructQwen29.2%tau2-bench-telecom#280 / 439#191$0.416131KOpen weights1 September 2026
85Qwen3 VL 8B InstructQwen29.2%tau2-bench-telecom#280 / 439#204$0.455262KOpen weights1 September 2026
86GPT-4o (2024-08-06)OpenAI28.9%tau2-bench-telecom#282 / 439#110$10.00128KAPI only1 September 2026
87o3 MiniOpenAI28.7%tau2-bench-telecom#283 / 439$4.40200KAPI only1 September 2026
88Granite 4.1 8BIBM Granite27.8%tau2-bench-telecom#290 / 439$0.10131KOpen weights1 September 2026
89Nemotron 3 Nano 30B A3BNVIDIA25.4%tau2-bench-telecom#309 / 439#179$0.20262KRestricted license1 September 2026
90GPT-4oOpenAI25.1%tau2-bench-telecom#312 / 439$10.00128KAPI only1 September 2026
91Mistral Medium 3Mistral AI24.3%tau2-bench-telecom#321 / 439$2.00131KAPI only1 September 2026
92R1 Distill Llama 70BDeepSeek21.9%tau2-bench-telecom#337 / 439#196$0.808KOpen weights1 September 2026
93Qwen3 Next 80B A3B InstructQwen21.6%tau2-bench-telecom#339 / 439#63$1.10262KOpen weights1 September 2026
94Claude 3 HaikuAnthropic21.1%tau2-bench-telecom#346 / 439$1.25200KAPI only1 September 2026
95GLM 4.5VZ.ai19.6%tau2-bench-telecom#357 / 439$1.8066KOpen weights1 September 2026
96Mistral Small 3Mistral AI19.6%tau2-bench-telecom#357 / 439$0.0833KOpen weights1 September 2026
97Gemini 2.5 Flash LiteGoogle19.0%tau2-bench-telecom#363 / 439$0.401MAPI only1 September 2026
98Qwen3 VL 30B A3B InstructQwen19.0%tau2-bench-telecom#363 / 439#194$0.60262KOpen weights1 September 2026
99Llama 4 MaverickMeta17.8%tau2-bench-telecom#369 / 439#102$0.6961MGated access1 September 2026
100GPT-4.1 NanoOpenAI17.3%tau2-bench-telecom#371 / 439$0.401MAPI only1 September 2026
101Llama 4 ScoutMeta15.5%tau2-bench-telecom#380 / 439#172$0.301.3MGated access1 September 2026
102Command ACohere15.2%tau2-bench-telecom#382 / 439#97$10.00256KGated access1 September 2026
103Gemini 2.5 FlashGoogle14.9%tau2-bench-telecom#384 / 439$2.501MAPI only1 September 2026
104Granite 4.0 MicroIBM Granite12.6%tau2-bench-telecom#395 / 439#214$0.112131KOpen weights1 September 2026
105Gemma 3 12BGoogle10.8%tau2-bench-telecom#404 / 439#175$0.15131KGated access1 September 2026
106Gemma 3 27BGoogle10.5%tau2-bench-telecom#406 / 439#90$0.45131KGated access1 September 2026
107Gemma 3 4BGoogle5.0%tau2-bench-telecom#414 / 439#195$0.10131KGated access1 September 2026
108Phi 4Microsoft0.0%tau2-bench-telecom#417 / 439#198$0.1416KOpen weights1 September 2026
109Reka Flash 3Reka0.0%tau2-bench-telecom#417 / 439#217$0.2066KOpen weights1 September 2026
110tiny aya globalCohereLabs0.0%tau2-bench-telecom#417 / 439#212Gated access1 September 2026

How ModelCap uses AA τ²-Bench Telecom

AA τ²-Bench Telecom ranks models by τ²-Bench Telecom task pass rate. ModelCap ingests the board as published, matches each entry to a catalogue model with a reviewed identity, and shows the source's score, interval and rank unchanged. Where a model has an admitted result, it feeds the ModelCap Index as agent evidence alongside the other public boards; the methodology documents the weighting and the identity rules.

AA τ²-Bench Telecom leaderboard: common questions

What is the AA τ²-Bench Telecom benchmark?

τ²-Bench Telecom measures whether an agent can resolve telecom customer-service tasks through tool calls while a simulated user talks back. Artificial Analysis runs every model through the same harness, so the pass rate compares models rather than scaffolds. It is published by Artificial Analysis.

Which AI model leads AA τ²-Bench Telecom right now?

GLM 5.2 (Z.ai) holds the top AA τ²-Bench Telecom score among the models ModelCap tracks, at 99.1% as of the source snapshot published 1 September 2026.

How many models are ranked on the AA τ²-Bench Telecom leaderboard here?

110 tracked models have a published AA τ²-Bench Telecom result on ModelCap; the source board itself lists 439 entries. Each row shows the model's best evaluated configuration.

What is the best open-weight model on AA τ²-Bench Telecom?

GLM 5.2 from Z.ai is the highest-scoring model with openly downloadable weights on this board, at 99.1%.

Which model offers the best value on AA τ²-Bench Telecom?

Among the ten highest-scoring priced models, GLM 4.7 Flash has the lowest listed output price at $0.40 per 1M tokens while scoring 98.8%.

How is AA τ²-Bench Telecom scored?

The board ranks models by τ²-Bench Telecom task pass rate; higher scores are better. ModelCap shows the source's own score, interval and rank and never re-runs the evaluation.

Does AA τ²-Bench Telecom decide the ModelCap Index rank?

Not on its own. The ModelCap Index combines several public capability sources with published uncertainty; AA τ²-Bench Telecom contributes as agent evidence where a model has an admitted result. The methodology page documents the weighting.

How recent are the AA τ²-Bench Telecom results?

The newest AA τ²-Bench Telecom publication ModelCap holds is dated 1 September 2026. The page re-renders every minute from the sealed dataset, so it reflects the latest refresh of the source board.

Which AA τ²-Bench Telecom model ranks highest on the ModelCap Index?

Claude Fable 5 is the highest-scoring model on this board that currently holds a ModelCap Index position (#1).

Explore further