IT之家 7 月 20 日消息,Arena(arena.ai)平臺發(fā)布了 2026-29 期大模型排行榜,統(tǒng)計周期為 2026 年 7 月 13 日 ~2026 年 7 月 19 日。
本周榜單迎來大規(guī)模新模型集中入榜,其中最受關(guān)注的是國產(chǎn)模型 kimi-k3 的突出表現(xiàn):它不僅首次殺入綜合榜 Top 10,更直接登頂前端開發(fā)榜榜首,在細分能力上實現(xiàn)了對多數(shù)海外頭部模型的反超。
整體來看,多款國產(chǎn)模型在多個榜單的前列位置站穩(wěn)腳跟,梯隊完整度進一步提升。
綜合榜
綜合榜頭部位置由 Claude、Meta、谷歌、OpenAI 等廠商的新模型主導,第一名依然由 claude-fable-5 占據(jù),ELO 為 1507 分。Anthropic 旗下多款思考版本模型集中入駐 Top 5,彼此之間分差全部在 15 分以內(nèi),在誤差范圍內(nèi)屬于并列第一梯隊。
本周最大的亮點是國產(chǎn)模型 kimi-k3 憑借 1486 分的 ELO 排名來到第 9 位,首次躋身綜合榜 Top 10,和第 8 名的 gemini-3-pro、第 10 名的 gpt-5.6-sol-xhigh 分數(shù)完全一致,屬于第一梯隊的邊緣位置。
國產(chǎn)模型在綜合榜分布于中上游位置,梯隊表現(xiàn)穩(wěn)定:
月之暗面 kimi-k3 排名第 9 位,ELO 1486 分,較上周上升 1 位,首次進入 Top 10;
阿里 qwen3.7-max-preview 排名第 18 位,ELO 1475 分,排名持平;
智譜 glm-5.1 排名第 27 位,ELO 1471 分,較上周下降 2 位;
智譜 glm-5.2 (max) 排名第 30 位,ELO 1468 分,排名持平。
| 排名 | 模型 | 廠商 | 分數(shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 — | ???? claude-fable-5 | Anthropic | 1507 ±7 | 8819 | $10 / $50 | 1M |
| 2 — | ???? claude-opus-4-6-thinking | Anthropic | 1504 ±4 | 61003 | $5 / $25 | 1M |
| 3 — | ???? claude-opus-4-7-thinking | Anthropic | 1503 ±4 | 48292 | $5 / $25 | 1M |
| 4 — | ???? claude-opus-4-6 | Anthropic | 1498 ±4 | 64747 | $5 / $25 | 1M |
| 5 — | ???? claude-opus-4-7 | Anthropic | 1494 ±4 | 49467 | $5 / $25 | 1M |
| 6 — | ???? muse-spark-1.1 | Meta | 1493 ±8 | 5729 | $1.25 / $4.25 | N/A |
| 7 — | ???? muse-spark | Meta | 1487 ±6 | 13572 | N/A | N/A |
| 8 ↑1 | ???? gemini-3-pro | 谷歌 | 1486 ±4 | 41290 | $2 / $12 | 1.05M |
| 9 ↑1 | ???? kimi-k3 | 月之暗面 | 1486 ±11 | 3024 | $3 / $15 | 1.05M |
| 10 ↓2 | ???? gpt-5.6-sol-xhigh | OpenAI | 1486 ±9 | 4095 | N/A | N/A |
| — 以下為 Top 10 外的國產(chǎn)模型 — | ||||||
| 18 ↓1 | ???? qwen3.7-max-preview | 阿里 | 1475 ±10 | 3717 | $1.48 / $4.43 | 1M |
| 27 ↓2 | ???? glm-5.1 | 智譜 | 1471 ±5 | 28606 | $1.4 / $4.4 | 202.8K |
| 30 — | ???? glm-5.2 (max) | 智譜 | 1468 ±6 | 15642 | $1.4 / $4.4 | 1M |
代碼榜
代碼榜榜首位置發(fā)生變動,claude-opus-4-7-thinking 從第 2 位升至第 1 位,ELO 分數(shù)為 1553 分,把此前排名第一的 claude-fable-5 擠到第 2 位,后者分數(shù)降至 1551 分。兩者僅有 2 分的差距,完全在置信區(qū)間范圍內(nèi),屬于并列第一梯隊。Anthropic 的多款思考模型幾乎包攬了榜單前 7 的所有位置,整體統(tǒng)治力依然強勁。
而國產(chǎn)模型 kimi-k3 首次進入代碼榜 Top 10,排名第 10 位,ELO 1529 分,和第 9 名的模型分數(shù)僅差 1 分,表現(xiàn)相當接近第一梯隊。
國產(chǎn)模型在代碼榜覆蓋多段位梯隊,表現(xiàn)均衡:
月之暗面 kimi-k3 排名第 10 位,ELO 1529 分,首次進入代碼榜 Top 10;
阿里 qwen3.7-max-preview 排名第 12 位,ELO 1527 分;
智譜 glm-5.1 排名第 17 位,ELO 1521 分,較上周上升 1 位;
小米 mimo-v2.5-pro 排名第 24 位,ELO 1518 分,較上周下降 1 位;
月之暗面 kimi-k2.6 排名第 26 位,ELO 1515 分,較上周下降 1 位;
百度 ernie-5.1 排名第 27 位,ELO 1514 分,較上周下降 1 位;
| 排名 | 模型 | 廠商 | 分數(shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 ↑1 | ???? claude-opus-4-7-thinking | Anthropic | 1553 ±7 | 13772 | $5 / $25 | 1M |
| 2 ↓1 | ???? claude-fable-5 | Anthropic | 1551 ±12 | 2459 | $10 / $50 | 1M |
| 3 — | ???? claude-opus-4-6-thinking | Anthropic | 1550 ±6 | 15751 | $5 / $25 | 1M |
| 4 ↑1 | ???? claude-opus-4-6 | Anthropic | 1549 ±6 | 17906 | $5 / $25 | 1M |
| 5 ↓1 | ???? claude-opus-4-7 | Anthropic | 1548 ±7 | 14088 | $5 / $25 | 1M |
| 6 — | ???? claude-opus-4-8-thinking | Anthropic | 1535 ±8 | 8002 | $5 / $25 | 1M |
| 7 — | ???? claude-opus-4-8 | Anthropic | 1533 ±8 | 8172 | $5 / $25 | 1M |
| 8 — | ???? muse-spark-1.1 | Meta | 1532 ±15 | 1718 | $1.25 / $4.25 | N/A |
| 9 — | ???? claude-opus-4-5-20251101-thinking-32k | Anthropic | 1530 ±7 | 7614 | $5 / $25 | 200K |
| 10 | ???? kimi-k3 | 月之暗面 | 1529 ±22 | 798 | $3 / $15 | 1.05M |
| — 以下為 Top 10 外的國產(chǎn)模型 — | ||||||
| 12 ↑1 | ???? qwen3.7-max-preview | 阿里 | 1527 ±18 | 1123 | $1.48 / $4.43 | 1M |
| 17 ↑1 | ???? glm-5.1 | 智譜 | 1521 ±8 | 8056 | $1.4 / $4.4 | 202.8K |
| 24 ↓1 | ???? mimo-v2.5-pro | 小米 | 1518 ±7 | 10969 | $0.44 / $0.87 | 1.05M |
| 26 ↓1 | ???? kimi-k2.6 | 月之暗面 | 1515 ±7 | 10359 | $0.95 / $4 | 262.1K |
| 27 ↓1 | ???? ernie-5.1 | 百度 | 1514 ±7 | 10403 | N/A | N/A |
前端開發(fā)榜
前端開發(fā)榜呈現(xiàn)出前所未有的格局,國產(chǎn)模型 kimi-k3 直接以 1679 分的高 ELO 穩(wěn)居第一名,大幅領(lǐng)先第二名 claude-fable-5 的 1631 分,分差達到 48 分,優(yōu)勢十分明顯。
第四名同樣由國產(chǎn)模型 glm-5.2 (max) 拿下,ELO 1587 分,超過了多款 Claude、OpenAI 的旗艦模型。這意味著國產(chǎn)大模型在前端開發(fā)這一細分場景的能力已經(jīng)走在了全球最前列。
國產(chǎn)模型在前端開發(fā)榜占據(jù)頭部和中上游多個位置,覆蓋完整梯隊:
月之暗面 kimi-k3 排名第 1 位,ELO 1679 分,排名穩(wěn)居第一;
智譜 glm-5.2 (max) 排名第 4 位,ELO 1587 分,排名保持在前五;
字節(jié)跳動 seed-2.1-pro-preview 排名第 14 位,ELO 1534 分,首次入駐榜單前半?yún)^(qū);
智譜 glm-5.1 排名第 15 位,ELO 1526 分,表現(xiàn)穩(wěn)定;
阿里 qwen3.7-max-20260517 排名第 17 位,ELO 1516 分;
月之暗面 kimi-k2.6 排名第 18 位,ELO 1515 分;
| 排名 | 模型 | 廠商 | 分數(shù) (±CI) | 票數(shù) | 價格 ($/M) 輸入 / 輸出 | 上下文 |
|---|---|---|---|---|---|---|
| 1 — | ???? kimi-k3 | 月之暗面 | 1679 ±17 | 1757 | $3 / $15 | 1.05M |
| 2 — | ???? claude-fable-5 | Anthropic | 1631 ±13 | 2505 | $10 / $50 | 1M |
| 3 — | ???? gpt-5.6-sol-xhigh (codex-harness) | OpenAI | 1618 ±13 | 2542 | $5 / $30 | 1.05M |
| 4 — | ???? glm-5.2 (max) | 智譜 | 1587 ±10 | 4722 | $1.4 / $4.4 | 1M |
| 5 — | ???? claude-opus-4-8-thinking | Anthropic | 1562 ±9 | 7309 | $5 / $25 | 1M |
| 6 — | ???? grok-4.5 | SpaceXAI | 1558 ±13 | 2214 | $2 / $6 | 500K |
| 7 — | ???? claude-opus-4-7-thinking | Anthropic | 1558 ±7 | 10534 | $5 / $25 | 1M |
| 8 — | ???? claude-opus-4-7 | Anthropic | 1555 ±7 | 9976 | $5 / $25 | 1M |
| 9 — | ???? claude-opus-4-6-thinking | Anthropic | 1542 ±6 | 12919 | $5 / $25 | 1M |
| 10 — | ???? claude-sonnet-5-high | Anthropic | 1542 ±12 | 2959 | $2 / $10 | 1M |
| — 以下為 Top 10 外的國產(chǎn)模型 — | ||||||
| 14 — | ???? seed-2.1-pro-preview | 字節(jié)跳動 | 1534 ±10 | 3909 | N/A | N/A |
| 15 — | ???? glm-5.1 | 智譜 | 1526 ±9 | 5870 | $1.4 / $4.4 | 202.8K |
| 17 — | ???? qwen3.7-max-20260517 | 阿里 | 1516 ±8 | 6455 | $1.48 / $4.43 | 1M |
| 18 — | ???? kimi-k2.6 | 月之暗面 | 1515 ±7 | 9321 | $0.95 / $4 | 262.1K |
智能體榜
智能體榜本周全部是全新入榜模型,排名第一的是 Claude Fable 5 (High),凈提升度 13.94%,同時擁有 30.65% 的最高好評 / 差評比,工具幻覺率僅 1.33% 屬于較低水平。第二名 GPT 5.6 Sol (xHigh) 的可控性數(shù)值最高,達到 17.26%。頭部三款模型的凈提升度差距都明顯大于各自的置信區(qū)間,屬于表現(xiàn)分層的清晰格局。
國產(chǎn)模型 GLM 5.2 (Max) 殺入榜單 Top 10 位列第 9,凈提升度為 6.24%,它的 Bash 恢復速度僅 4.45,遠好于頭部平均水平,命令出錯后能快速恢復,表現(xiàn)突出。
國產(chǎn)模型在智能體榜覆蓋靠前和中間多個位置,工具相關(guān)能力表現(xiàn)亮眼:
智譜 glm-5.2 (max) 排名第 9 位,凈提升度 6.24%,任務確認成功率 8.72%;
智譜 glm-5.1 排名第 16 位,凈提升度 1.19%;
阿里 qwen3.7 Plus 排名第 18 位,凈提升度 0.61%,工具幻覺率僅 0.19%;
月之暗面 kimi-k2.7-code 排名第 20 位,凈提升度 0.76%;
阿里 qwen3.7 Max 排名第 21 位,凈提升度 0.81%;
深度求索 deepseek-v4-pro 排名第 22 位,凈提升度 1.11%;
| 排名 | 模型 | 廠商 | 凈提升度 (±CI) | 任務確認成功率 | 好評 / 差評比 | 可控性 | 會話數(shù) |
|---|---|---|---|---|---|---|---|
| 1 — | ???? Claude Fable 5 (High) | Anthropic | 13.94% ±1.56% | 17.27% | 30.65% | 12.07% | 16059 |
| 2 — | ???? GPT 5.6 Sol (xHigh) | OpenAI | 10.94% ±3.76% | 10.93% | 17.64% | 17.26% | 7881 |
| 3 — | ???? Claude Opus 4.8 (Thinking) | Anthropic | 9.28% ±1.35% | 7.82% | 17.96% | 10.15% | 33392 |
| 4 — | ???? GPT 5.5 (xHigh) | OpenAI | 8.26% ±0.87% | 6.88% | 12.61% | 6.7% | 36289 |
| 5 — | ???? Claude Sonnet 5 (High) | Anthropic | 8.0% ±1.71% | 10.33% | 13.9% | 4.92% | 23640 |
| 6 — | ???? Claude Opus 4.7 (Thinking) | Anthropic | 7.73% ±1.22% | 5.22% | 11.36% | 9.17% | 34357 |
| 7 — | ???? Claude Opus 4.7 | Anthropic | 7.63% ±1.22% | 5.28% | 13.38% | 7.56% | 34950 |
| 8 — | ???? GPT 5.5 (High) | OpenAI | 7.16% ±0.75% | 6.42% | 7.61% | 8.72% | 61455 |
| 9 — | ???? GLM 5.2 (Max) | 智譜 | 6.24% ±1.1% | 8.72% | 12.59% | 4.1% | 31993 |
| 10 — | ???? GPT 5.5 | OpenAI | 6.05% ±0.72% | 4.33% | 5.53% | 7.99% | 62335 |
| — 以下為 Top 10 外的國產(chǎn)模型 — | |||||||
| 16 — | ???? GLM 5.1 | 智譜 | 1.19% ±0.82% | 0.78% | 0.53% | 0.62% | 51362 |
| 18 — | ???? Qwen3.7 Plus | 阿里 | 0.61% ±1.38% | 1.1% | 4.04% | 2.73% | 10048 |
| 20 — | ???? Kimi K2.7 Code | 月之暗面 | 0.76% ±2.01% | 4.51% | 1.38% | 10.78% | 7468 |
AI 生圖 & AI 視頻榜
AI 生圖榜本周整體格局穩(wěn)定,OpenAI 的 gpt-image-2 (medium) 依然以 1385 分的 ELO 穩(wěn)居第一,字節(jié)跳動 seedream-5.0-pro 作為最高排名的國產(chǎn)模型位列第 11 位,ELO 1231 分,緊隨多款海外頭部生圖模型之后。
而在 AI 視頻榜,谷歌 gemini-omni-flash 位列榜首;字節(jié)跳動的 dreamina-seedance-2.0-720p 穩(wěn)居第二名,ELO 分數(shù) 1482 分,表現(xiàn)遠超多數(shù)海外視頻生成模型;同時阿里 happyhorse-1.0 也拿下第 4 位,國產(chǎn)力量在 AI 視頻生成第一梯隊已經(jīng)占據(jù)了重要席位。
本周 Arena 榜單的最大亮點就是國產(chǎn)模型的多點突破,尤其是 kimi-k3 首次沖進綜合榜 Top 10,并且直接登頂前端開發(fā)榜,證明國產(chǎn)大模型不僅在通用能力上追平第一梯隊,在特定工程類任務場景已經(jīng)形成了領(lǐng)先優(yōu)勢。同時字節(jié)、阿里、智譜等廠商的多款模型也在代碼、生圖、視頻、智能體多個榜單的前半?yún)^(qū)站穩(wěn)腳跟。
下周預計將有更多用戶評測數(shù)據(jù)進一步積累,部分新入榜模型的排名和分數(shù)還可能出現(xiàn)小幅變動,值得關(guān)注后續(xù)國產(chǎn)模型能否在更多細分榜單拿下榜首位置。
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。