IT之家 7 月 7 日消息,螞蟻集團(tuán)旗下具身智能公司靈波科技今天發(fā)布空間感知模型 LingBot-Depth 2.0。該模型基于 1.5 億規(guī)模數(shù)據(jù)進(jìn)行訓(xùn)練,號(hào)稱在邊緣清晰度、細(xì)小物體識(shí)別、遠(yuǎn)距離深度估計(jì)以及復(fù)雜場(chǎng)景魯棒性等方面實(shí)現(xiàn)全面升級(jí)。
靈波科技表示,相比于 LingBot-Depth 1.0,LingBot-Depth 2.0 的訓(xùn)練數(shù)據(jù)從 300 萬(wàn)擴(kuò)充至 1.5 億規(guī)模:在深度補(bǔ)全基準(zhǔn)的 16 項(xiàng)測(cè)評(píng)中獲得 12 項(xiàng)第一;在最難的室內(nèi)大面積深度缺失場(chǎng)景中,深度誤差較上一代減半(RMSE 從 0.132 降至 0.062);在玻璃、鏡面、透明物體等傳統(tǒng)深度相機(jī)最容易失靈的場(chǎng)景中表現(xiàn)較為突出。
官方此次還同步推出了 LingBot-Depth 2.0 的視覺(jué)基座模型“LingBot-Vision”,旨在應(yīng)對(duì)機(jī)器人視覺(jué)在空間感知、精細(xì)識(shí)別和復(fù)雜環(huán)境適應(yīng)等方面的核心挑戰(zhàn)。其預(yù)訓(xùn)練語(yǔ)料僅為 1.6 億張圖像,比 DINOv3 小一個(gè)數(shù)量級(jí),深度估計(jì)精度卻與優(yōu)于 DINOv3;并且,LingBot-Vision 對(duì)物體邊界的判定足夠穩(wěn)定,能在視頻中連續(xù)追蹤物體邊界。


目前,LingBot-Depth 2.0 已通過(guò)奧比中光深度視覺(jué)實(shí)驗(yàn)室專業(yè)認(rèn)證。實(shí)際場(chǎng)景測(cè)試顯示,基于奧比中光 Gemini 330 系列雙目 3D 相機(jī)提供的芯片級(jí) 3D 原始數(shù)據(jù),LingBot-Depth 2.0 在邊緣清晰度、物體輪廓完整性、細(xì)小物體識(shí)別、遠(yuǎn)距離深度估計(jì)及復(fù)雜光照、材質(zhì)場(chǎng)景下的魯棒性等方面均有明顯提升。

廣告聲明:文內(nèi)含有的對(duì)外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時(shí)間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。