初探 OpenAI GPT-4.1 性能：AI 編程能力大增，但谷歌 Gemini 依然稱王

2025/4/16 8:23:52 來源：IT之家作者：故淵責(zé)編：故淵

評(píng)論：

IT之家 4 月 16 日消息，科技媒體 bleepingcomputer 昨日（4 月 15 日）發(fā)布博文，報(bào)道稱 OpenAI 最新發(fā)布的 GPT-4.1 系列模型，其性能相比 GPT-4o 雖然實(shí)現(xiàn)重大飛躍，但多項(xiàng)跑分未能超越谷歌的 Gemini 系列。

IT之家昨日?qǐng)?bào)道，OpenAI 公司發(fā)布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano，官方公布的跑分?jǐn)?shù)據(jù)來看，這些模型在編程方面的能力，遠(yuǎn)超 GPT-4o 及 GPT-4o mini。

例如在 SWE-bench Verified 跑分中，GPT-4o 的得分為 21.4%，GPT-4.5 的得分為 26.6%，而 GPT-4.1 的得分為 54.6%。

初探 OpenAI GPT-4.1 性能：AI 編程能力大增，但谷歌 Gemini 依然稱王

盡管性能有較大提升，不過根據(jù)多位專家測(cè)試，相比較谷歌的 Gemini 系列，GPT-4.1 對(duì)比中卻顯露劣勢(shì)。

根據(jù) Stagehand（一款生產(chǎn)級(jí)瀏覽器自動(dòng)化框架）發(fā)布的基準(zhǔn)數(shù)據(jù)，Gemini 2.0 Flash 的錯(cuò)誤率僅為 6.67%，精確匹配率高達(dá) 90%，且價(jià)格低廉、速度更快。相比之下，GPT-4.1 的錯(cuò)誤率高達(dá) 16.67%，成本更是 Gemini 2.0 Flash 的 10 倍以上。

初探 OpenAI GPT-4.1 性能：AI 編程能力大增，但谷歌 Gemini 依然稱王

此外，哈佛大學(xué) RNA 科學(xué)家 Pierre Bongrand 提供的數(shù)據(jù)也指出，GPT-4.1 的性價(jià)比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等競(jìng)品。

初探 OpenAI GPT-4.1 性能：AI 編程能力大增，但谷歌 Gemini 依然稱王

在編碼專項(xiàng)測(cè)試中，GPT-4.1 同樣未能占據(jù)上風(fēng)。Aider Polyglot 的測(cè)試結(jié)果顯示，GPT-4.1 的編碼得分僅為 52%，而 Gemini 2.5 則以 73% 的成績(jī)遙遙領(lǐng)先。

初探 OpenAI GPT-4.1 性能：AI 編程能力大增，但谷歌 Gemini 依然稱王

值得注意的是，GPT-4.1 被歸類為非推理模型（non-reasoning model），但其編碼能力仍屬行業(yè)頂尖。

廣告聲明：文內(nèi)含有的對(duì)外跳轉(zhuǎn)鏈接（包括不限于超鏈接、二維碼、口令等形式），用于傳遞更多信息，節(jié)省甄選時(shí)間，結(jié)果僅供參考，IT之家所有文章均包含本聲明。

下載IT之家APP，簽到賺金幣兌豪禮

在线观看日韩三级视频,国产久久精品在线播放,精品人妻伦一二三区久久简爱,久久亚洲精品一区二区,日韩人妻一区二区av,欧美黑人又粗又大高潮喷水,国产91精品在线播放,国产欧美日韩一区二区三视频,亚洲一区二区伦理在线

初探 OpenAI GPT-4.1 性能：AI 編程能力大增，但谷歌 Gemini 依然稱王

相關(guān)文章