亚洲第一天堂无码专区_一区二区欧美久久_精品剧情v国产在线观看在线_久久久精品综合

首頁 > 綜合 > 正文

把 4K 生圖門檻打下來!商湯開源 SenseNova U1.5 Lite 當(dāng)前關(guān)注

2026-08-21 14:23:05來源:硅星人  

作者|樊雅婷微信|FFF111f__

以前的 AI 生圖,連六根手指、文字亂碼、透視錯亂這類基本關(guān)都過不了,更不用說商用了。


(相關(guān)資料圖)

如今模型能力大幅躍升,用戶的要求也隨之水漲船高。文字渲染、復(fù)雜版式、多圖參考、局部編輯、原生4K——這些過去需要多個工具協(xié)作才能完成的任務(wù),現(xiàn)在正被壓縮進(jìn)同一套模型之中。

但「能力出現(xiàn)」和「能力可用」之間,依然橫亙著不小的距離。一張商業(yè)海報可能同時包含人物、產(chǎn)品、商標(biāo)文字、指定數(shù)量、前后空間關(guān)系、品牌色號以及若干禁改項,任何一個要素被模型遺漏,整張圖就要推倒重來。而每一次推倒重來,都意味著新的token消耗。

甲方的無數(shù)條修改意見,就這樣在反復(fù)生成中被放大為高昂的算力成本。

正因如此,當(dāng)生圖模型真正進(jìn)入創(chuàng)作流程之后,用戶的訴求已經(jīng)非常明確:更快的時間,更好的交付,更低的成本。

8月3日,商湯開源 SenseNova U1.5 Lite Preview,初步展示了原生統(tǒng)一多模態(tài)模型在圖像生成與編輯上的能力邊界。今天,正式版 SenseNova U1.5 Lite繼續(xù)向前邁出一步,目標(biāo)是讓這些能力真正融入視覺創(chuàng)作與交付流程。

這一次升級,商湯沒有繼續(xù)在模型規(guī)模上做文章。

由 SenseNova U1.5 Lite生成的圖書封面

通過精調(diào)訓(xùn)練數(shù)據(jù)、重調(diào)后訓(xùn)練流程、優(yōu)化任務(wù)設(shè)計,最終打磨出的 SenseNova U1.5 Lite,是一款輕量級、原生統(tǒng)一多模態(tài)開源模型。它的目標(biāo)也非常具體,就是解決用戶最真實的訴求,做到更穩(wěn)、更準(zhǔn)、更好。

1

先把分?jǐn)?shù)擺上來

開源生圖從來不缺嘗試者。難的是在保持模型開放、輕量和可部署的同時,把畫質(zhì)、文字、布局與編輯放進(jìn)同一個模型,而且每一項都不能成為明顯短板。

SenseNova U1.5 Lite 與主流開源、閉源圖片模型橫向Benchmark

在完整橫向評測中,SenseNova U1.5 Lite 在所有維度都位于開源生圖模型的領(lǐng)先位置,并且展現(xiàn)了比較均衡的系統(tǒng)能力,在復(fù)雜指令、視覺質(zhì)量和創(chuàng)意生成等維度都表現(xiàn)出較強(qiáng)競爭力。

正式版的提升沒有集中在某一項孤立技能上。生成質(zhì)量、指令執(zhí)行和編輯能力都在進(jìn)步。

U1.5 Lite 還能在確保更高性能同時,實現(xiàn)更少的生成延遲。下圖顯示了測評中,SenseNova U1.5 Lite在 OneIG(EN、ZH)、LongText(EN、ZH)、BizGenEval(Easy、Hard)、CVTG、IGenBench 與 Qwen-Image-Bench 上的生成延遲與平均性能對比。

對于需要批量生成海報、電商圖和營銷素材的團(tuán)隊,這樣帶來的意義就很直接。同樣的時間和預(yù)算,可以支持更多次嘗試,也能把生成能力放進(jìn)更高頻的工作流。

不過,Benchmark 終究是一張坐標(biāo)圖。

把這些分?jǐn)?shù)塞進(jìn)一份真實的設(shè)計需求,事情才開始變得有意思。

1

一些實測

一條長Prompt,能不能變成一張完整海報

以前的 AI 生圖,提示詞太長,模型執(zhí)行指令時候就會變成金魚,出現(xiàn)遺忘現(xiàn)象。

所以,第一個測試,是一條長得有些不講道理的Prompt。

可以看到效果不錯,從真的理解到真的執(zhí)行。

4K不只是把畫布放大

高分辨率生成最容易被誤解成像素數(shù)量的簡單增加。

真正困難的,是畫布變大之后,模型還能不能穩(wěn)住整張圖的全局結(jié)構(gòu)。標(biāo)題、正文、圖標(biāo)和人物之間的關(guān)系不能散,局部的文字邊緣、材質(zhì)紋理和光影過渡也不能糊成一片。

U1.5 Lite 正式版原生支持 2K 和 4K 生成。在廣告級的畫幅下,細(xì)節(jié)經(jīng)不經(jīng)得起推敲,一張圖說了不算,放大到 100% 才算。

所以我決定拿時尚封面雜志來試。

可以看見成片保留要求的同時保留了紙張褶皺、皮膚紋理的真實感。

改一個地方,其他地方不動

第三組測試從一張已經(jīng)完成的海報開始。

我給的提示詞是

再來一個更細(xì)節(jié)的。我給的 prompt 是

可以看到,這兩次海報的局部編輯,除了我的要求,其他地方什么都沒改變。

算是高質(zhì)量的修改交付。

這也對應(yīng)U1.5 Lite正式版后訓(xùn)練中的一個重要目標(biāo):Editing Preservation。

好的編輯需要同時完成兩個動作。一邊準(zhǔn)確執(zhí)行修改,一邊保護(hù)原圖。該動的地方要動,不該動的地方盡量別動。

當(dāng)這種保持能力逐漸穩(wěn)定,圖片模型才能從一次性生成器變成可反復(fù)溝通的創(chuàng)作工具。用戶不再需要每次都推倒重來,可以在同一張作品上繼續(xù)修改。

下面我們嘗試下保持參考圖的風(fēng)格和布局,進(jìn)行編輯:

參考圖

成圖

接下來,我計劃再給模型多看幾張圖,難度還會繼續(xù)增加。

多張參考圖融合出成片

多圖參考真正難的地方,是模型能不能分清每張圖的職責(zé)。

可能它需要保留第一張圖里的人物身份,借用第二張圖的色彩和材質(zhì),再沿用第三張圖的版式關(guān)系。參考圖之間不能互相污染,風(fēng)格遷移也不能吞掉主體。

U1.5 Lite支持單圖、多圖參考,以及 Bounding Box、Visual Marker 等控制方式。用戶可以指定對象和區(qū)域,完成元素插入、替換、局部精修和參考風(fēng)格遷移。

我把我喜歡的動漫角色都放進(jìn)一張海報里。

上傳這五張圖片之后,我給的 prompt 是:

可以看到最后的成圖信息清晰,符合要求。時間 / 地點 / 菜單三個部分以小卡片的形式獨立列出,還設(shè)計了 So yummy、Come & Enjoy 等符合人物形象的小對白,用氣泡呈現(xiàn)增加了活潑感。

模仿、借鑒,再創(chuàng)作

當(dāng)你的靈感來自于他人的作品,這個時候就可以讓模型參考之后進(jìn)行再創(chuàng)作。就像我覺得下面這張圖很好看,我想自己模仿這張圖設(shè)計一張其他主題的海報。所以我就

最后的效果呈現(xiàn),實力無需多言。

圖一圖二圖三成圖

當(dāng)模型能夠區(qū)分參考誰的主體、借用誰的風(fēng)格、沿用誰的布局,多圖參考才真正離開玩法展示,進(jìn)入創(chuàng)作流程。

1

一個模型,怎樣同時做好幾件事

SenseNova U1.5 Lite 延續(xù)了 NEO-unify 的原生統(tǒng)一多模態(tài)路線。

在同一個模型架構(gòu)之下,視覺理解、圖像生成與圖像編輯被共同訓(xùn)練。模型首先理解原始圖像和用戶指令,識別其中的主體、文字與空間關(guān)系,再完成像素級的最終生成。整個過程中,用戶無需在理解模型、生成模型和編輯工具之間反復(fù)切換。

統(tǒng)一帶來的價值,還進(jìn)一步體現(xiàn)在能力的遷移上。

模型在視覺理解任務(wù)中習(xí)得了結(jié)構(gòu)、位置、文字排布與信息層級,這些認(rèn)知成果可以順滑地遷移到生成和編輯任務(wù)中。面對一條較長的自然語言指令,模型需要解析的已經(jīng)不是孤立的關(guān)鍵詞,而是這些要求之間的內(nèi)在關(guān)系:誰在左邊,誰不能被遮擋,哪段文字屬于哪個區(qū)域,修改時又有哪些內(nèi)容必須被保留。這正是 U1.5 Lite 能夠處理層級化視覺需求,卻不需要依賴固定 JSON 模板的原因之一。

但統(tǒng)一訓(xùn)練解決了能力共享的問題之后,新的矛盾也隨之浮現(xiàn)。

OCR 關(guān)心文字是否準(zhǔn)確可讀,美學(xué)關(guān)心構(gòu)圖、色彩和整體質(zhì)感,編輯則還要兼顧主體身份與結(jié)構(gòu)保持。如果簡單地把所有訓(xùn)練目標(biāo)混在一起,往往會出現(xiàn)一項能力變強(qiáng)、另一項反而被削弱的窘境。

正式版的應(yīng)對策略,是讓各項專項能力先分別變強(qiáng)。

商湯訓(xùn)練了 OCR、美學(xué)和編輯等多個 Expert:OCR Expert 強(qiáng)化中英文文字識別與排版質(zhì)量,美學(xué) Expert 改善構(gòu)圖、色彩、材質(zhì)、光影和真實感,編輯 Expert 則負(fù)責(zé)確保主體身份、空間結(jié)構(gòu)以及非編輯區(qū)域的一致保持。隨后,通過 MOPD 將這些 Expert 的能力重新蒸餾回 U1.5 Lite 中。

最終部署的,仍然只有一個模型——沒有額外的 Router,用戶也無需關(guān)心該調(diào)用哪一個 Expert,生成和編輯繼續(xù)通過統(tǒng)一接口完成。

在此基礎(chǔ)上,正式版又引入了更精細(xì)的任務(wù)導(dǎo)向 RL。它優(yōu)化的三個目標(biāo),都能與前面的測試維度一一對應(yīng):Instruction Compliance 關(guān)注復(fù)雜指令是否被執(zhí)行完整,Visual Preference 關(guān)注構(gòu)圖、真實感和整體完成度,Editing Preservation 關(guān)注指定區(qū)域是否改對、其他區(qū)域能否保持不變。

最后交付的,仍然是 U1.5 Lite,一個輕量級、易部署的統(tǒng)一模型。

1

多模態(tài)是一件慢回報的事

把鏡頭拉遠(yuǎn),多模態(tài)模型正在進(jìn)入一個更現(xiàn)實的階段。

能力仍在增長,行業(yè)卻已經(jīng)開始算賬。投入多少,成本幾何,回報又在哪。參數(shù)規(guī)模能快速制造話題,但真實視覺任務(wù)里的穩(wěn)定性,靠的是數(shù)據(jù)、評測和一次次后訓(xùn)練,慢慢磨出來。

長指令會不會漏、文字能不能寫對、4K下結(jié)構(gòu)能否保持、局部編輯會不會破壞整張圖,這些看似微小的問題恰恰決定了模型能不能真正進(jìn)入海報、信息圖、電商素材和品牌視覺的日常生產(chǎn)。

商湯選擇繼續(xù)沿著原生統(tǒng)一的路線投入。

從 U1 到 U1.5 Preview,再到正式版,SenseNova 沒有簡單疊加一份更長的能力清單。它在嘗試回答一個更實際的問題:一個輕量級、統(tǒng)一、開源的多模態(tài)模型,能不能更完整地承擔(dān)真實視覺創(chuàng)作任務(wù)?

U1.5 Lite 給出的答案是讓能力更強(qiáng),也讓能力更穩(wěn)。

把視野再拉開一點,視覺創(chuàng)作只是多模態(tài)進(jìn)入現(xiàn)實世界的一站。一個模型需要先理解畫面中的對象、文字和空間關(guān)系,才能進(jìn)一步生成、編輯,最終與更復(fù)雜的真實環(huán)境發(fā)生連接。

這條路不會很快。

但對今天的用戶來說,判斷它有沒有向前走并不難。只需要把它放在最真實的需求里,一試便知。

會生成只是起點,穩(wěn)定地完成任務(wù),才是開源視覺模型真正進(jìn)入生產(chǎn)的開始。

GitHub:

https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:

https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova Studio在線體驗:

https://unify.light-ai.top/

點個“愛心”,再走 吧

標(biāo)簽: 商湯 生成器 全模態(tài) lite sensenova

相關(guān)閱讀

精彩推薦

相關(guān)詞

推薦閱讀

主站蜘蛛池模板: 国产精品69久久久| 亚洲精品在线视频观看| 久久99国产精品99久久| 国产精品久久久久久av福利| 亚洲国产精品毛片| 久久国产精品久久| 日韩视频在线免费播放| 精品国产成人av在线免| 欧美日韩亚洲在线| 91精品国产91久久久久| 国产精品一 二 三| 久久777国产线看观看精品| 日韩人妻一区二区三区蜜桃视频| 91精品久久久久久久久久久久久久| 久久精品女人的天堂av| 欧美日韩国产va另类| 亚洲精品欧美日韩专区| 91精品综合视频| 91精品国产91久久久久麻豆 主演| 国产熟人av一二三区| 久久久97精品| 久久精品美女| 久久久免费在线观看| 日本不卡在线观看| 亚洲a成v人在线观看| 国产精品裸体一区二区三区| 精品激情国产视频| 久久99国产综合精品女同| 久久精品国产69国产精品亚洲| 蜜桃av噜噜一区二区三区| 欧美精品七区| 久久中文字幕在线视频V| 欧美日韩一区在线观看视频| 欧洲午夜精品久久久| 日本精品一区二区三区不卡无字幕| 91精品国产91久久久久青草| 国产精品91久久| 99国产在线视频| 国产精品第一页在线| 国产精品国语对白| 国产精品久久91|