IT之家 7 月 9 日消息,Arena(arena.ai)平臺公布了最新一期大模型對戰(zhàn)周榜,本期統(tǒng)計覆蓋 2026 年 6 月 29 日 ~7 月 5 日。本周榜首位置依舊由 ???? Anthropic 的 claude-fable-5 牢牢占據(jù),分?jǐn)?shù)微漲 1 分,美國廠商在頭部占據(jù)絕對優(yōu)勢,國產(chǎn)模型整體保持穩(wěn)定,多款模型躋身前 30 行列。
IT之家附各主要領(lǐng)域榜單如下:
綜合榜
本期綜合榜整體格局變動不大,頭部前 5 名均為 ???? Anthropic 旗下 Claude 系列模型,彼此之間 ELO 分差在 15 分以內(nèi),處于統(tǒng)計誤差范圍內(nèi),視為第一梯隊。
前十名全部被美國廠商包攬,排名變動基本在 1~2 位,僅 ???? gemini-3.5-flash 上升 2 位至第 11 名,是前十名外排名提升最多的模型。
國產(chǎn)模型整體處于中上游位置,梯隊相對穩(wěn)定:
阿里 qwen3.7-max-preview 排名最高,位列第 15 名,ELO 1475 分,較上周上升 1 位;
cn glm-5.1 下滑 3 位至第 22 名,排名變動相對明顯;
百度 ernie-5.1 位列第 27 名,ELO 1468 分,排名持平;
小米 mimo-v2.5-pro 位列第 29 名,ELO 1466 分,排名持平。
| 排名 | 模型 | 廠商 | 分?jǐn)?shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | ???? claude-fable-5 | Anthropic | 1509 ±9 | 4350 | $10 / $50 | 1M |
| 2 | ???? claude-opus-4-6-thinking | Anthropic | 1504 ±4 | 55102 | $5 / $25 | 1M |
| 3 | ???? claude-opus-4-7-thinking | Anthropic | 1502 ±4 | 41868 | $5 / $25 | 1M |
| 4 | ???? claude-opus-4-6 | Anthropic | 1499 ±4 | 58565 | $5 / $25 | 1M |
| 5 | ???? claude-opus-4-7 | Anthropic | 1494 ±4 | 43053 | $5 / $25 | 1M |
| 6 | ???? muse-spark | Meta | 1487 ±6 | 13591 | N/A | N/A |
| 7 | ???? gemini-3.1-pro-preview | 谷歌 | 1486 ±4 | 73099 | $2 / $12 | 1.05M |
| 8 | ???? gemini-3-pro | 谷歌 | 1486 ±4 | 41306 | $2 / $12 | 1.05M |
| 9 | ???? claude-opus-4-8-thinking | Anthropic | 1484 ±5 | 22340 | $5 / $25 | 1M |
| 10 | ???? gpt-5.5-high | OpenAI | 1481 ±5 | 37260 | $5 / $30 | 1.05M |
| — 以下為 Top 10 外的國產(chǎn)模型 — | ||||||
| 15 ↑1 | ???? qwen3.7-max-preview 預(yù)發(fā)布 | 阿里 | 1475 ±10 | 3727 | $1.25 / $3.75 | 1M |
| 22 ↓3 | cn glm-5.1 | 智譜 | 1472±5 | 22,689 | $1.40 / $4.40 | 202.8K |
| 27 — | ???? ernie-5.1 | 百度 | 1468 ±5 | 32742 | N/A | N/A |
| 29 — | ???? mimo-v2.5-pro | 小米 | 1466 ±5 | 34468 | $0.44 / $0.87 | 1.05M |
代碼榜
代碼榜依然被 ???? Anthropic 壟斷前九席位,頭部排名沒有變化,???? claude-fable-5 以 1563 分穩(wěn)居第一,領(lǐng)先第二名 ???? claude-opus-4-7-thinking 僅 10 分,分差在誤差范圍內(nèi)。
排名變動較大的是 cn glm-5.2 (max),從第 13 位大跌 8 位至第 21 位,ELO 分下降 10 分; ???? gemini-3.5-flash 在創(chuàng)意寫作榜提升 4 位,但代碼榜無明顯變動,國產(chǎn) ???? qwen3.7-plus 排名上升 2 位進(jìn)入前 30。
國產(chǎn)模型在代碼榜表現(xiàn)亮眼,已有多款進(jìn)入前 30:
阿里 qwen3.7-max-preview 位列第 10 名,ELO 1526 分,排名持平;
小米 mimo-v2.5-pro 位列第 17 名,ELO 1520 分,較上周上升 1 位;
智譜 glm-5.2 (max) 位列第 21 名,ELO 1515 分,較上周下降 8 位;
月之暗面 kimi-k2.6 位列第 28 名,ELO 1512 分,排名持平;
百度 ernie-5.1 位列第 29 名,ELO 1512 分,較上周下降 2 位;
阿里 qwen3.7-plus 位列第 30 名,ELO 1512 分,較上周上升 2 位。
| 排名 | 模型 | 廠商 | 分?jǐn)?shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | ???? claude-fable-5 | Anthropic | 1563 ±18 | 1123 | $10 / $50 | 1M |
| 2 | ???? claude-opus-4-7-thinking | Anthropic | 1553 ±7 | 11799 | $5 / $25 | 1M |
| 3 | ???? claude-opus-4-6-thinking | Anthropic | 1551 ±6 | 14089 | $5 / $25 | 1M |
| 4 | ???? claude-opus-4-7 | Anthropic | 1550 ±7 | 12135 | $5 / $25 | 1M |
| 5 | ???? claude-opus-4-6 | Anthropic | 1548 ±6 | 15989 | $5 / $25 | 1M |
| 6 | ???? claude-opus-4-8 | Anthropic | 1537 ±9 | 6195 | $5 / $25 | 1M |
| 7 | ???? claude-opus-4-8-thinking | Anthropic | 1537 ±9 | 6075 | $5 / $25 | 1M |
| 8 | ???? claude-opus-4-5-20251101-thinking-32k | Anthropic | 1530 ±7 | 7622 | $5 / $25 | 200K |
| 9 | ???? claude-sonnet-4-6 | Anthropic | 1527 ±7 | 13275 | $3 / $15 | 1M |
| 10 | ???? qwen3.7-max-preview 預(yù)發(fā)布 | 阿里 | 1526 ±18 | 1128 | $1.25 / $3.75 | 1M |
| — 以下為 Top 10 外的國產(chǎn)模型 — | ||||||
| 17 ↑1 | ???? mimo-v2.5-pro | 小米 | 1520 ±8 | 9398 | $0.44 / $0.87 | 1.05M |
| 21 ↓8 | cn glm-5.2 (max) | 智譜 | 1515 ±12 | 2,520 | $1.40 / $4.40 | 1M |
| 28 — | ???? kimi-k2.6 | 月之暗面 | 1512 ±7 | 8944 | $0.95 / $4 | 262.1K |
| 29 ↓2 | ???? ernie-5.1 | 百度 | 1512 ±7 | 9043 | N/A | N/A |
| 30 ↑2 | ???? qwen3.7-plus | 阿里 | 1512 ±10 | 4288 | $0.32 / $1.28 | 1M |
數(shù)學(xué)榜
數(shù)學(xué)榜頭部依然被 ???? Anthropic 占據(jù),???? claude-opus-4-6-thinking 以 1518 分穩(wěn)居第一,???? gpt-5.5 排名提升 4 位來到第 8 名,是本次榜單中排名上升最多的模型,cn glm-5.2 (max) 排名提升 8 位至第 24 名,變動幅度較大。
國產(chǎn)模型方面,月之暗面 kimi-k2.6 排名提升 2 位至第 13 名,阿里 qwen3.7-max-preview 上升 1 位至第 10 名,整體保持穩(wěn)定。
長文本榜
長文本榜本周榜首易主,???? claude-fable-5 從第二升至第一,ELO 分?jǐn)?shù)達(dá)到 1524 分,原榜首 ???? claude-opus-4-6-thinking 降至第二,兩者分差僅 1 分,屬于統(tǒng)計誤差范圍內(nèi)并列。國產(chǎn)小米 mimo-v2.5-pro 排名上升 1 位至第 14 名,OpenAI gpt-5.5-high 排名提升 3 位至第 16 名,變動較為明顯。
總體來看,本周 Arena 大模型周榜整體格局穩(wěn)定,Anthropic 依然在各榜單頭部占據(jù)壟斷地位,美國廠商頭部優(yōu)勢依舊明顯。國產(chǎn)模型整體排名保持穩(wěn)定,阿里 qwen3.7-max-preview 在多個榜單中穩(wěn)居前 15~20 名,已經(jīng)進(jìn)入全球第一梯隊末尾水平。下周值得關(guān)注國產(chǎn)新模型的動態(tài),以及谷歌、OpenAI 新模型是否會帶來排名格局變化。
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。