IT之家 7 月 13 日消息,Arena(arena.ai)平臺發(fā)布了最新一期 AI 大模型周榜,本期覆蓋 2026 年 7 月 6 日 ~2026 年 7 月 12 日。
本周核心變化為代碼榜榜首易主,claude-opus-4-7-thinking 從第二升至第一,原榜首 claude-fable-5 跌落至第五;綜合榜榜首仍由 claude-fable-5 蟬聯(lián),頭部均為 Anthropic 模型占據(jù)。國產(chǎn)模型整體處于中上游梯隊,排名相對穩(wěn)定。
綜合榜
本周綜合榜格局基本穩(wěn)定,claude-fable-5 繼續(xù)占據(jù)榜首位置,ELO 分?jǐn)?shù) 1505 ,較上周下降 4 分;第二至第五名依次為 claude-opus-4-6-thinking 、 claude-opus-4-7-thinking 、 claude-opus-4-6 、 claude-opus-4-7 ,前五名均來自 Anthropic,分?jǐn)?shù)差距均在 30 分以內(nèi),在統(tǒng)計誤差范圍內(nèi)視為并列。頭部模型中僅有 muse-spark-1.1 從第五下降一位至第六,排名變動較小。
國產(chǎn)模型僅有三款進(jìn)入前 30 ,整體排名保持穩(wěn)定:
qwen3.7-max-preview 排名最高,位列第 17 名,ELO 1475 分,排名無變化;
glm-5.1 位列第 25 名,ELO 1472 分,排名下滑 3 名;
ernie-5.1 位列第 30 名,ELO 1468 分,排名持平。
| 排名 | 模型 | 廠商 | 分?jǐn)?shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 | ???? claude-fable-5 | Anthropic | 1505 ±8 | 7252 | $10 / $50 | 1M |
| 2 | ???? claude-opus-4-6-thinking | Anthropic | 1504 ±4 | 58968 | $5 / $25 | 1M |
| 3 | ???? claude-opus-4-7-thinking | Anthropic | 1503 ±4 | 46183 | $5 / $25 | 1M |
| 4 | ???? claude-opus-4-6 | Anthropic | 1498 ±4 | 62650 | $5 / $25 | 1M |
| 5 | ???? claude-opus-4-7 | Anthropic | 1494 ±4 | 47222 | $5 / $25 | 1M |
| 6 ↓1 | ???? muse-spark-1.1 | Meta | 1490 ±10 | 3750 | $1.25 / $4.25 | N/A |
| 7 ↑1 | ???? muse-spark | Meta | 1488 ±6 | 13573 | N/A | N/A |
| 8 | ???? gpt-5.6-sol-xhigh | OpenAI | 1486 ±14 | 1740 | $5 / $30 | 1.05M |
| 9 ↓1 | ???? gemini-3-pro | 谷歌 | 1486 ±4 | 41308 | $2 / $12 | 1.05M |
| 10 ↓3 | ???? gemini-3.1-pro-preview | 谷歌 | 1485 ±4 | 78561 | $2 / $12 | 1.05M |
| — 以下為 Top 10 外的國產(chǎn)模型 — | ||||||
| 17 | ???? qwen3.7-max-preview | 阿里 | 1475 ±10 | 3719 | $1.25 / $3.75 | 1M |
| 25 ↓3 | cn glm-5.1 | 智譜 | 1472±5 | 26549 | $1.40 / $4.40 | 202.8K |
| 30 | ???? ernie-5.1 | 百度 | 1468 ±5 | 36321 | N/A | N/A |
代碼榜
本周代碼榜發(fā)生榜首變動,原第二名 claude-opus-4-7-thinking 上升一位登頂榜首,ELO 分?jǐn)?shù)為 1553 ;原榜首 claude-fable-5 大幅下滑 4 位至第五名,ELO 分?jǐn)?shù)從 1563 降至 1546 ,跌幅達(dá) 17 分。
第二名至第四名依次為 claude-opus-4-6-thinking 、 claude-opus-4-7 、 claude-opus-4-6 ,頭部前 5 名依舊均被 Anthropic 旗下模型包攬,分?jǐn)?shù)差距在 10 分以內(nèi),視為并列水平。
grok-4.5 排名上升 5 位至第 14 名,是榜單中漲幅最大的模型之一。
國產(chǎn)模型共有五款上榜,具體排名分?jǐn)?shù)如下:
qwen3.7-max-preview 排名最高,位列第 12 名,ELO 1526 分,較上周下降 2 位;
glm-5.1 位列第 18 名,ELO 1521 分;
mimo-v2.5-pro 位列第 23 名,ELO 1518 分,較上周下降 6 位;
kimi-k2.6 位列第 25 名,ELO 1514 分,較上周上升 3 位;
ernie-5.1 位列第 26 名,ELO 1514 分,較上周上升 3 位;
glm-5.2 (max) 位列第 27 名,ELO 1513 分,較上周下降 6 位。
| 排名 | 模型 | 廠商 | 分?jǐn)?shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 ↑1 | ???? claude-opus-4-7-thinking | Anthropic | 1553 ±7 | 13130 | $5 / $25 | 1M |
| 2 ↑1 | ???? claude-opus-4-6-thinking | Anthropic | 1550 ±6 | 15192 | $5 / $25 | 1M |
| 3 ↑1 | ???? claude-opus-4-7 | Anthropic | 1550 ±7 | 13419 | $5 / $25 | 1M |
| 4 ↑1 | ???? claude-opus-4-6 | Anthropic | 1547 ±6 | 17275 | $5 / $25 | 1M |
| 5 ↓4 | ???? claude-fable-5 | Anthropic | 1546 ±14 | 2036 | $10 / $50 | 1M |
| 6 ↑1 | ???? claude-opus-4-8-thinking | Anthropic | 1537 ±8 | 7366 | $5 / $25 | 1M |
| 7 ↓1 | ???? claude-opus-4-8 | Anthropic | 1533 ±8 | 7507 | $5 / $25 | 1M |
| 8 ↑1 | ???? muse-spark-1.1 | Meta | 1530 ±18 | 1122 | $1.25 / $4.25 | N/A |
| 9 ↓1 | ???? claude-opus-4-5-20251101-thinking-32k | Anthropic | 1530 ±7 | 7620 | $5 / $25 | 200K |
| 10 | ???? gpt-5.6-sol-xhigh | OpenAI | 1528 ±29 | 449 | $5 / $30 | 1.05M |
| — 以下為 Top 10 外的國產(chǎn)模型 — | ||||||
| 12 | ???? qwen3.7-max-preview | 阿里 | 1526 ±18 | 1125 | $1.25 / $3.75 | 1M |
| 18 | ???? glm-5.1 | 智譜 | 1521±8 | 7397 | $1.40 / $4.40 | 202.8K |
| 23 | ???? mimo-v2.5-pro | 小米 | 1518 ±7 | 10474 | $0.44 / $0.87 | 1.05M |
| 25 | ???? kimi-k2.6 | 月之暗面 | 1514 ±7 | 9903 | $0.95 / $4 | 262.1K |
| 26 | ???? ernie-5.1 | 百度 | 1514 ±7 | 10049 | N/A | N/A |
| 27 | cn glm-5.2 (max) | 智譜 | 1513±10 | 3727 | $1.40 / $4.40 | 1M |
數(shù)學(xué)榜
本周 claude-fable-5 從第二名上升至榜首,ELO 分?jǐn)?shù)大幅提升 31 分至 1548 ,原榜首 claude-opus-4-6-thinking 下降一位至第二名,分?jǐn)?shù)保持 1518 不變。
國產(chǎn)模型中 ernie-5.1 排名上升 2 位至第 14 名,qwen3.7-max-preview 下降一位至第 11 名,整體分?jǐn)?shù)差距在誤差范圍內(nèi)。
高難度指令榜
本周榜單頭部發(fā)生換位,claude-opus-4-6-thinking 從第二升至第一,claude-fable-5 從第一降至第二,二者分?jǐn)?shù)均為 1532 ,在誤差范圍內(nèi)并列。排名變動幅度均在 3 位以內(nèi),整體格局穩(wěn)定。
國產(chǎn)模型 qwen3.7-max-preview 排名第 19 位,分?jǐn)?shù)微漲 1 分;glm-5.1 排名第 21;glm-5.2 (max) 排名第 30 位,分?jǐn)?shù)無變化。
多輪對話榜
本周 claude-fable-5 從榜首跌至第四,排名下降 3 位,claude-opus-4-7 上升 1 位登頂榜首,頭部格局小幅變動。muse-spark-1.1 從第 13 位大幅升至第 8 位,漲幅最為明顯。國產(chǎn)模型 qwen3.7-max-preview 排名第 22 位,分?jǐn)?shù)微漲 1 分。
本周榜單整體來看,Anthropic 旗下模型仍占據(jù)絕大多數(shù)頭部位置,在綜合、代碼等多個榜單中包攬前幾名,美國廠商整體優(yōu)勢依舊明顯。國產(chǎn)模型整體穩(wěn)定在中上游區(qū)間,qwen3.7-max-preview 在多個榜單中保持領(lǐng)先位置,kimi-k2.6 、 ernie-5.1 在代碼榜實(shí)現(xiàn)排名上升。下周可關(guān)注新入圍模型表現(xiàn)以及國產(chǎn)模型是否能進(jìn)一步?jīng)_擊頭部位置。
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。