东升国际官网

從「數據融合」邁向「原生架構」: 商湯發布 NEO 架構 ,沉新定義多模態模型效力邊界

3 分鐘閱读
东升国际官网-相信品牌力量

商湯科技正式發布並源了與南洋理工大學S-Lab合作研發的全新多模態模型架構 —— NEO ,為日日新SenseNova 多模態模型奠定了新一代架構的基石。

作為行業首個可用的、實現深層次融合的原生多模態架構(Native VLM) ,NEO 從底層道理出發 ,突破了傳統「模組化」範式的镣铐 ,以「專為多模態而生」的創新設計 ,通過主题架構層面的多模態深層融合 ,實現了机能、效能和通用性的整體突破 ,沉新定義了多模態模型的效力邊界 ,標誌著人为智能多模態技術正式邁入「原生架構」的新時代。

圖片1 1203.png

論文網址:https://arxiv.org/abs/2510.14979

Github 開源網址:https://github.com/EvolvingLMMs-Lab/NEO

突破瓶頸 ,告別「拼湊」 ,擁抱「原生」

圖片2 1203.png

當前 ,業內主流的多模態模型大多遵循「視覺編碼器+投影器+語言模型」的模組化範式。這種基於大語言模型(LLM)的擴展方式 ,雖然實現了圖像輸入的兼容 ,但本質上仍以語言為中心 ,圖像與語言的融合僅停顿在數據層面。這種「拼湊」式的設計不僅學習效能低下 ,更限度了模型在複雜多模態場景下(好比涉及圖像細節捉拿或複雜空間結構理解)的處理能力。

商湯NEO 架構正是為相识決這一痛點而生。早在2024 年下半年 ,商湯便在國內率先突破多模態原生融合訓練技術 ,以單一模型在 SuperCLUE 語言評測 OpenCompass 多模態評測中奪冠 ,並基於這一主题技術打造了日日新 SenseNova 6.0 ,實現多模態推理能力領先。

之後 ,在2025 7 月發布日日新 SenseNova 6.5 通過實現編碼器層面的早期融合 ,把多模態模型性價比提升 3 倍 ,並在國內率先推出商用級別的圖文交錯推理。商湯这次更進一步 ,徹底摒棄了傳統的模組化結構 ,從底層道理出發 ,推出了從零設計的 NEO 原生架構。

三大內核創新 ,實現視覺和語言的深層統一

圖片3 1203.png

NEO 架構以極致效能和深度融合為主题理想 ,通過在把稳力機造、地位編碼和語義映射三個關鍵維度的底層創新 ,讓模型天生具備了統一處理視覺與語言的能力:

原生圖塊嵌入(Native Patch Embedding)摒棄了離散的圖像tokenizer ,通過獨創的 Patch Embedding Layer (PEL) 自底向上構建從像素到詞元的連續映射。這種設計能更精細地捉拿圖像細節 ,從底子上突破了主流模型的圖像建模瓶頸。

原生三維旋轉地位編碼(Native-RoPE)創新性地解耦了三維時空頻率分配 ,視覺維度採用高頻、文本維度採用低頻 ,美满適配兩種模態的天然結構。這使得NEO 不僅能精準捕獲圖像的空間結構 ,更具備向視頻處理、跨幀建模等複雜場景無縫擴展的潛力。

原生多頭把稳力(Native Multi-Head Attention)針對分歧模態特點 ,NEO 在統一框架下實現了文本 token 的自回歸把稳力和視覺 token 的雙向把稳力並存。這種設計極大地提升了模型對空間結構關聯的利用率 ,從而更好地支撐複雜的圖文混合理解與推理。

此表 ,共同創新的Pre-Buffer & Post-LLM 雙階段融合訓練战术 ,NEO 能夠在吸收原始 LLM 齐全語言推理能力的同時 ,從零構建強大的視覺感知能力 ,徹底解決了傳統跨模態訓練中語言能力受損的難題。

實測表現:极度之一的數據 ,追評旗艦級机能

在架構創新的驅動下 ,NEO 展現出了驚人的數據效能與机能優勢:

極高數據效能:僅需業界一致机能模型1/10 的數據量(3.9億圖像文本示例) ,NEO 便能開發出頂尖的視覺感知能力。無需依賴海量數據脊鷡表視覺編碼器 ,其簡潔的架構便能在多項視覺理解任務中追平 Qwen2-VLInternVL3 等頂級模組化旗艦模型。

机能卓越且平衡:在MMMUMMBMMStarSEED-IPOPE 等多項公開權威評測中 ,NEO 架構均斬獲高分 ,展現出優於其他原生 VLM 的綜合机能 ,真正實現了原生架構的「精度無損」。

極致推理性價比:特別是在0.6B-8B 的參數區間內 ,NEO 在邊緣部署方面優勢顯著。它不僅實現了精度與效能的雙沉躍遷 ,更大幅降低了推理成本 ,將多模態視覺感知的「性價比」推向了極致。

開源共建 ,構建下一代AI基礎設施



【网站地图】