IT之家 1 月 31 日消息,快手今日宣布推出新一代視頻生成模型可靈 3.0 系列,目前處于超前內(nèi)測階段。該系列包含圖片 3.0、視頻 3.0 和視頻 3.0 Omni,在原有模型基礎上進行了技術(shù)升級。
其中,圖片 3.0 模型主要升級包括四項功能:
新增組圖生成能力,支持通過單張或多張輸入圖像批量生成邏輯連貫的系列畫面;
輸出分辨率提升至 2K 與 4K 級別,適配影視預演圖、場景設定等專業(yè)需求;
增強畫面細節(jié)一致性,優(yōu)化紋理、光影的呈現(xiàn)效果以降低“AI 感”;
強化對構(gòu)圖、視角等元素的控制精度,提升影視類創(chuàng)作場景的適用性。
據(jù)介紹,此次升級采用視覺思維鏈(vCoT)技術(shù)輔助生成前的場景解構(gòu)推理,并通過 Deep-Stack 視覺信息流機制增強細粒度感知能力。模型訓練過程中引入強化學習框架,結(jié)合真實感與電影質(zhì)感雙重評估標準優(yōu)化輸出效果。

另外,新的視頻模型采用統(tǒng)一的多模態(tài)訓練框架,支持文本、圖像、視頻片段等多種輸入形式,單次視頻生成時長最高可達 15 秒,并支持 3-15 秒靈活時長設置。功能改進主要包括:
新增智能分鏡系統(tǒng),可根據(jù)文本指令自動調(diào)度景別與機位;
增強主體一致性控制,允許通過多圖或視頻錨定特定視覺元素;
升級音畫同步能力,支持中、英、日、韓、西五種語言及方言的精準口型匹配,并實現(xiàn)多人場景下的角色定向發(fā)聲;
提升文字生成清晰度,確保招牌、字幕等文字信息可辨識。
視頻 3.0 Omni 版本額外支持創(chuàng)建視頻主體特征庫,可提取 3-8 秒視頻中的角色形象與音色進行還原應用。技術(shù)文檔顯示,此次升級涉及多模態(tài)指令解析架構(gòu)優(yōu)化、音頻采樣區(qū)間調(diào)整及特征解耦重組方案。
廣告聲明:文內(nèi)含有的對外跳轉(zhuǎn)鏈接(包括不限于超鏈接、二維碼、口令等形式),用于傳遞更多信息,節(jié)省甄選時間,結(jié)果僅供參考,IT之家所有文章均包含本聲明。