IT之家 4 月 30 日消息,DeepSeek 在 GitHub 平臺(tái)正式發(fā)布了其多模態(tài)大模型,并同步公開了配套技術(shù)報(bào)告。該報(bào)告提出了一種基于“視覺原語”的創(chuàng)新推理框架,旨在突破當(dāng)前多模態(tài)大語言模型(MLLMs)在空間參照任務(wù)中的核心瓶頸。

技術(shù)報(bào)告指出,盡管多模態(tài)大語言模型近年來取得長(zhǎng)足進(jìn)步,但主流的鏈?zhǔn)剿季S(CoT)推理范式仍主要局限于語言學(xué)領(lǐng)域?,F(xiàn)有研究多聚焦于通過高分辨率圖像裁剪等技術(shù)手段彌合“感知鴻溝”,即提升模型對(duì)視覺細(xì)節(jié)的識(shí)別能力。然而,DeepSeek 團(tuán)隊(duì)認(rèn)為,這一思路忽視了一個(gè)更為根本的限制:參照鴻溝。
自然語言固有的模糊性使其難以對(duì)復(fù)雜的空間布局提供精確、明確的指引。當(dāng)模型需要執(zhí)行涉及嚴(yán)謹(jǐn)空間參照的任務(wù)時(shí),這種語言表達(dá)的局限性往往導(dǎo)致推理鏈條斷裂,出現(xiàn)邏輯崩潰。
針對(duì)上述問題,DeepSeek 提出了“基于視覺原語的思考”(Thinking with Visual Primitives)框架。該框架將點(diǎn)、邊界框等空間標(biāo)記從單純的視覺輸入元素,提升為推理過程中的“基本思維單元”。通過將這些視覺原語直接嵌入模型的思考鏈路,DeepSeek 使模型在推理過程中具備了“指代”能力 —— 即能夠?qū)⒊橄蟮恼J(rèn)知軌跡錨定到圖像的具體物理坐標(biāo)上,從而實(shí)現(xiàn)對(duì)空間關(guān)系的精確推演。
技術(shù)報(bào)告披露,該框架采用了高度優(yōu)化的模型架構(gòu),具備極高的視覺標(biāo)記效率。盡管模型規(guī)模緊湊且圖像標(biāo)記預(yù)算顯著較低,DeepSeek 的多模態(tài)模型在具有挑戰(zhàn)性的計(jì)數(shù)和空間推理基準(zhǔn)測(cè)試上,能夠與 GPT-5.4、Claude-Sonnet-4.6 和 Gemini-3-Flash 等前沿模型匹配。這為開發(fā)更高效、更具可擴(kuò)展性的 System-2 類多模態(tài)智能指明了方向。

IT之家注意到,DeepSeek 此前已經(jīng)上線了“識(shí)圖模式”,該模式和“快速模式”“專家模式”并列,并非簡(jiǎn)單的 OCR 文字,而是終于具備了多模態(tài)識(shí)別能力。
廣告聲明:文內(nèi)含有的對(duì)外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時(shí)間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。