东升国际官网

商湯的思虑,為何我們如此堅定多模態通用智能?

36 分鐘閱读
东升国际官网-相信品牌力量

8月12日,商湯科技聯合創始人、执行董事、首席科學家林達華特別撰寫的萬字深度長文《迈向多模態通用智能:商湯的思虑》正式發布。文章分解了商湯科技為何將“多模態通用智能”視為技術战术的主题引擎,并系統阐释了發展多模態智能的底層逻輯、技術路徑、實践索求與未來方向。同時他还分享了在商湯組织及战术層面的诸多思虑。以下為文章全文:

迈向多模態通用智能:商湯的思虑

作者:林達華

AI 是一場長跑。從大語言模型(LLM)的興起到真正意義的通用人为智能(AGI),还有好多開放性的問題有待解决。我們認為,多模態是從 LLM 到 AGI 的必經之路。圍绕多模態,從智能演進、學習範式、數據和模型架構都面臨诸多挑战,也有很大的創新空間 ;在組织和战术層面也有好多值得思虑的問題。在本文中,我先整體回顧一下商湯的多模態之路,然後就其中的關鍵問題谈一下我們的思虑。

重要涉及:?

  1. 商湯多模態之路概览

  2. 為什么多模態是通向 AGI 的必經之路 ?

  3. 商湯沿著什么路徑去構建多模態智能 ?

  4. 為什么選擇做原生多模態 ?

  5. 多模態推理的挑战在哪里 ?

  6. 商湯的训练數據是若何生產出來的 ?

  7. 模型設計有哪些思虑?模型尺寸和架構未來若何演進?

  8. 從多模態到具身智能,會面臨哪些挑战 ?

  9. 商湯若何建設一支有高效且富有創新力的钻研力量 ?

  10. 商湯若何平衡技術突破和商業落地的關係 ?

1、商湯多模態之路概览

商湯是從計算機視覺技術出發,在人为智能變革海潮中發展起來的企業。在發展之初,商湯基於深度學習在視覺領域的運用,在人臉識別、畫質處理、智能驾驶等多個應用方向突破了工業红線,推動了 AI 技術在行業的落地應用。

早在 2019 年,商湯就基於自身的技術判斷,開始在視覺模型上進行尺度定律的索求,在業內率先推出百億参數的視覺大模型,在視覺識別上突破了多項机能纪錄。這一前瞻性的技術觀察,也是推動商湯較早就進行大規模 AI 算力投入的沉要原因。

2022 年底,OpenAI 推出 ChatGPT,掀起了全球范圍的大模型海潮,AI 進入了 2.0 時代。對於商湯來說,這是一次沉要的机缘。我們当時開始思虑,当視覺模型和語言模型在尺度定律上相會,會给我們帶來什么?

在 2023 年 3 月,商湯和上海人为智能實驗室合作研發,推出了我國首個多模態通用大模型“書生 2.5” 并開源。這個 30 億参數的大模型刷新了蕴含 ImageNet 和 COCO 在內的多個視覺任務的纪錄,并且初步展示了通用圖文問答能力。在 6 個月之後,OpenAI 才正式推出了支持圖像输入的 GPT-4V。

在此之後,商湯维持著語言模型和圖文模型的雙轨迭代,但是逐步看到了這種分立模式的局限 —— 語言和視覺模態的融合較浅,難以形成高水平的跨模態理解能力。於是在 2024 年 5 月開始,我們投入了几千 P 的算力,進行了大量比較實驗,突破了原生融合训练的技術路徑。在 2024 年底,以單一模型奪得 SuperCLUE 語言综合評測和 OpenCompass 多模態综合評測的榜首。從 2025 年 4 月發布的日日新 6.0 開始,原來分立的兩條模型線匯聚到了一個融合模型系列。

其後,商湯的大模型技術沿著多模態這一主轴走向纵深,推出了日日新 6.5 多模態模型,在國內率先實現圖文交错思維,并且在多模態融合強化學習上获得新的進展。與此同時,商湯的開悟世界模型和悟能具身智能平台,讓多模態 AI 從數字空間走入真實的物理世界。

在商湯多模態之路的背後,是商湯钻研團隊就好多關鍵技術問題的思虑、判斷和反思。

2、為什么多模態是通向 AGI 的必經之路?

重要觀點

●?智能的主题是與表界進行自主交互的能力,多模態是通向通用人为智能(AGI)的必經之路。

●?語言是描述世界的工具,但不是世界自身。單靠語言模型并不能構建真正意義的 AGI。

●?大模型海潮源於 LLM,原因在於海量語料的積累,但是這不是通用智能的終局。

●?在應用場景中實現齐全的價值,離不開對分歧模態資訊的有效處理、對多種模態資訊的融合分析和判斷。

多模態是通向通用人为智能(AGI)的必經之路。?這是商湯選擇以多模態為技術主轴背後的主题技術判斷。

為什么多模態在智能之路上如此沉要?要回覆這個問題,我們先回到智能的本質。

人为智能的主标题標是通過計算來構建智能。智能(Intelligence)是一個复杂的多維度概想。固然智能尚没有統一的定義,但其主题就是與表界(蕴含世界或者其他人)進行自主交互的能力。這是一種综合能力,能够被综合為多種能力維度,蕴含感知、推理、决策、學習等。

語言(Language)的本質是一種符號化的互换工具 —— 人們通過語言傳遞資訊。從這個意義上說,語言只是人類智能演進過程中的一種產物,但不是智能的本原 ;語言是描述世界的工具,但不是世界自身。單靠語言模型并不能構建真正意義的 AGI。

為什么這一波大模型海潮首先源自於語言模型的突破?原因在於海量語料的積累。?在人類數千年的汗青中積累了海量的語料,這些語料在資訊時代被廣泛地數字化,從而成為最容易規 ;@取的數據形態。通過巨大算力對這些語料進行压缩,大語言模型被打造出來。這是朝著 AGI 迈出的沉要一步,但不是終局。隨著現存的文本語料被急剧耗盡,人为智能下一阶段的突破必然要超过語言,回到智能的本原 —— 和世界的交互。

世界的資訊以多元形態存在 —— 除了書中的文本,还有視覺的影像、听覺的音頻、電磁波的脉動等。人为智能若要具備通用性,必须能像人類通過感官接管資訊那樣,將這些原始模態轉化為可計算的內部表征。這種表征不是孤立的,模態之間存在深刻的內在關聯,這是理解世界的基礎,也是智能體和世界交互的根基出發點。因而,多模態資訊感知與處理的能力是 AGI 的主题要求,也是從語言模型迈向 AGI 的必由之路。

從理论走入現實,技術的價值在於應用。只有当技術深刻每一個應用場景,為用戶解决實際的問題、帶來更好的體驗,技術就有了源源不竭的性命力。

在過去十年中,商湯服務了城市治理、工業造作、手机、汽車、互聯網、教育、醫療、金融、遥感等多個行業,涵蓋了生涯、娱樂到工作和生產的方方面面。在眾多應用場景中,圖像、圖表、視頻等模態數據是記錄和傳遞資訊的沉要載體和媒介。在閱读報告的時候,必要看懂圖表 ;在醫療場景中,诊斷往往必要結合病历和醫療影像的資訊 ;在教學場景中,多媒體的結合是常見的伎俩 ;在城市治理和工業場景中,視頻更是不成或缺的資訊載體。

在這些場景中,提供齐全的價值離不開對分歧模態資訊的有效處理、對多種模態資訊的融合分析和判斷。只是在過去的 AI 1.0 時代和今天,構建場景能力的方式發生了變遷。在過去,每個 AI 模型智能提供一個環節的能力,最終由一個复杂的業務系統串聯起來 ;在今天,多模態的智能體能够自主而靈活地運用各種能力,提供端到端的整體價值。因而,從商業應用的角度,多模態也是我們的必然選擇。

3、商湯沿著什么路徑去構建多模態智能?

重要觀點

●?從底子上說,人为智能的發展是數據驅動的,其每一次躍遷都源自於數據邊界的突破。

●?智能的演進會經历几次破壁:Transformer 實現了長序列建模 ;語言和視覺的會合實現了多模態理解 ;逻輯思維和形象思維的結合實現真正的多模態推理 ;最終,智能體將突破數字空間與物理空間的邊界,實現和真實世界的交互。

智能的演進是一個渐進的過程。它有好多個阶段,在每個阶段都有分歧的特點。

人類智能進化到今天的高度,經历了一個极度漫長的汗青時期,在“物競天擇”的生计競爭中逐步傳承下來。人類在最早期就把握了和大天然交互的能力,學會了運用火和工具,而語言、文化和科學是在社會生涯中逐步發展出來的。而人为智能的發展则經历了一條很不一樣,甚至是反向的路徑。其底子在於人为智能內在本質的差距:從底子上說,人为智能的發展是數據驅動的,其能力邊界是被數據所定義的。人为智能的每一次躍遷,都源自於數據邊界的突破。

第一次破壁:Transformer 實現了長語言序列建模

語言模型作為一個學術領域已經存在多年。早期的語言模型是通過 N-gram 或者循環神經網絡(RNN)等方式對天然語言中的語句進行建模。由於這些模型的建模距離很短(從几個到十几個 token 不等),因而它們只能捉拿到語言中的浅層模式(好比語法等),而難以對更高層次的知識和逻輯進行建模。

Transformer 為長達几千 tokens 甚至更長的語言序列建模提供了有力的工具。Transformer 模型所能看到的不再是短語級別的語言片段,而是長篇的段落、文章甚至是書籍。這是數據邊界的一次沉要的拓展,讓高阶的語言建模成為可能,大語言模型由此而誕生。

第二次破壁:語言和視覺的會合,形成多模態理解能力

在大模型出來之前,計算機視覺和天然語言處理是兩個區別很大,互换很少的學科領域 ;它們各自處在較低的建模水平。計算機視覺通過给圖像或其部门區域赋予標签,從而形成初級的語義理解 ;而天然語言處理则更多關注於語法和部门語義的解析。在這個層面上,兩個領域的關聯度是比較弱的。

大語言模型的出現,讓高阶語言建模成為現實,同時也為高阶的圖像理解提供了可能。?一幅圖像所能關聯的語義不再受限於几個類別標签,而是一個齐全的故事。

多模態大模型正是在這樣的技術契机中發展起來的。当我們把圖像、視頻等模態數據和更齐全的語言描述關聯在一路,在训练中以监督或者非监督的方式讓模型去建模其內在聯繫,模型就具備了對這些模態數據進行高阶理解的能力。這是構建多模態智能基礎性的一步。

第三次破壁:突破逻輯思維和形象思維的邊界,實現多模態推理

從 OpenAI o1/o3 到 DeepSeek R1 等的一系列進展中,我們看到語言模型通過思維链训练以及在此基礎上的強化學習,能够在數學、編程等領域形成很強的推理能力,甚至能够達到奥賽金牌的水平。人類語言自身就蕴含了很強的逻輯性,所以以語言方式表達思維過程(思維链)是一種天然且有效的步骤。但是,基於語言的逻輯思維并不是齐全的思虑能力。

在人類的思虑中,形象思維表演著同樣沉要的角色。所谓“一圖勝千言”,当我們去設計一栋建築、構思一款產品的交互界面、或者尝試理解一個复杂網絡的結構和關鍵節點,一幅圖往往比大段文字更能引發我們的有效思虑。因而,全面的思維能力離不開逻輯思維和形象思維的有机結合 —— 好多時候,帶有視覺形象的直覺對於形成有效的思維方向會起到關鍵作用。

主流的多模態模型通過視覺編碼器與語言模型的前後結合,實現了對多模態混合输入的支持。但是,後續的思虑推理過程还是重要依赖纯語言的推理。我們內部钻研中觀察到,這些模型過於依赖語言先驗,對於圖形和空間結構的推理能力还很幽微。好比,好多主流的多模態模型看見一個佑装有六個手指头的手掌”這種反先驗的照片時,还會說出“五個手指”的回覆。出現這種情况的一個沉要原因是,在這些模型的工作机造中,圖像僅僅是為視為可被描述的输入,而不是思虑過程中的沉要元素。突破這一局限的關鍵在於允许讓思虑過程被圖形化表達,形成直觀表象,從而引發新的思虑。

第四次破壁:突破與物理空間的邊界,實現多模態與真實世界中的交互

具備齐全的多模態知識和思維能力的模型是通向 AGI 的一個沉要里程碑,但是还不是終點,因為它还不能在物理空間中行動,對物理世界產生影響。最終到達 AGI 的彼岸,必要從數字空間走向物理空間。這必要對三維時空的理解、對物理規律的把握、以及對自身行動的火速节造 —— 這不僅是一個“大腦”,而是“大腦-幼腦-感官-手脚”火速高效的協同。從技術角度來看,這是一個軟硬件協同的開放课題,必要多個方面的突破能力逐步達成目標。

實現這一阶段突破的關鍵挑战仍旧是數據。分歧於天然語言或者圖像視頻,它們在互聯網上有海量存量 ;物理世界交互的數據天然是极度稀缺的。通過真机采集或者“遥操作”采集所得到的數據,無论是體量和多樣性都比較有限,難以满足構建通用智能的必要。但是,若是這個問題得到有效解决,我們就能给人为智能開辟一片新的世界,并且回到智能的本原 —— 與世界的自主交互。

從技術角度,世界模型是解决這一主题問題的一種沉要的可能途徑。世界模型能够成立在基於海量數據训练的多模態模型的基礎之上,獲得對這個世界的先驗認知,然後通過交互過程持續建改,實現和真實世界更好的對齐。一個有足够真實度的世界模型能够作為一種“模擬器”,用於對空間智能體的训练,從而在很大水平上缓解上述的數據挑战。当然,世界模型自身也是一個極具挑战性的课題,必要整個領域共同的致力來推動它的進展。

商湯沿著智能的阶段演進的認知展開技術研發的佈局,一步步推動對智能邊界的索求。我們早在 2023 岁首就推出了我國最早的多模態模型,走出了多模態智能索求的沉要一步。在 2024 年突破了原生多模態融合训练技術,在國內最早把語言模型和圖文多模態模型融合為一個模型。最近,我們在多模態推理上获得沉要進展,實現了圖文交错的思維链,在此基礎上训练的日日新 6.5 具備了真正的多模態思虑能力,综合推理机能顯著提升。與此同時,我們展開了開悟世界模型的索求,买通數字空間和物理空間連接的通路。

4、為什么選擇做原生多模態?

重要觀點

●?多模態模型训练有兩種方式:適應训练和原生训练。

●?適應训练難以深刻把握語言和視覺之間的內在關聯,只是讓模型僵化地遵循後训练的范例模式。

●?商湯通過大量對比實驗發現,原生融合训练的模型能够更好建?缒B的關聯,實現模態深度融合,以一個融合模型在纯文本和圖文的評測上奪冠。

●?視覺和語言模態的融合應該在预训练的中段開始進行。

●?多模態训练數據中,天然的圖文交错數據,固然量大但是圖文的關聯弱 ;提升机能重要是通過規 ;瘶嬙斓膱D文對數據。

主流的多模態模型的整體架構是類似的,由視覺編碼器(Visual encoder)、输入投影器(Projector)和骨干網絡(Backbone)連接而成。視覺編碼器把输入的圖像編碼為一個 token 序列,然後經由输入投影器對齐到骨干網絡的输入空間,而語言 token 一路由骨干網絡進行計算處理。這里的每個?槎紟в懈髯员匾谎盗返臋喑。

多模態模型的兩種训练方式

多模態模型的训练有兩種典型的方式:

1.?適應训练:给定一個已經训练好的大語言模型和經過预训练的視覺編碼器,在後训练阶段,通過對視覺編碼器和投影器的微調,實現視覺和語言表征的對齐。這是國內多模態大模型常用的方式,它的好處是可能以較低的成本急剧獲得多模態能力。

2.?原生训练:在预训练阶段就融合多種模態的數據進行训练,因而,模型從“原生”開始就具備了多模態能力,而不是“後补”的。以 Google 和 OpenAI 為代表的顶尖机構從选取這種方式。

商湯自己的路徑選擇

商湯在早期的多模態模型训练時也是选取了前者,但是我們很快就觀察到這種方式存在比較大的局限性。這種只經過適應训练的多模態模型,并没有深刻把握語言和視覺模態之間的內在關聯,更多只是在僵化地遵循後训练中那些范例的模式,從圖像中提取資訊送给語言?檫M行後續分析和输出。并且,由於模型基座自身對多模態理解是有限的,选取強化學習也很難激發出很強的多模態能力。

我們開始思虑,是否應該走上原生多模態的路路。這不是一個容易的决定,因為原生训练所需的資源是顯著超過適應训练的。除此之表,我們还面臨著兩個沉要問題:

1.?有了原生多模態模型後,还是否必要保留一個單獨的語言模型?

2.?語言和其它模態的融合應該在什么時候進行?预训练还是後训练?

這些問題的答案將决定商湯的長期技術路徑。在 2024 年 5 月,也就是日日新 5.0 發布之後,我們成立了一個高優先級的內部專項,投入了几千 P 算力,通過大量對比實驗尝試回覆上面的問題。几個月後,我們從大量實驗結果中得到了關於上述問題的明确結论:

1.?在合適數據配比的條件下,融合训练的模型比單纯的語言模型和專注圖文問答的模型,在各自的任務上都表現得越发杰出 ;并且,融合模型在處理帶文本的圖片、截圖、專業圖表等場景下顯著超过当時的圖文問答模型。

2.?語言和視覺模態的融合應該在预训练中段開始進行。我們觀察到,只在後训练好比 SFT 阶段進行融合训练,融合度是比較低的,模型對於跨模態關聯的把握是面向具體任務,泛化性比較弱 ;但是,過早進行融合训练也没有明顯的增益 —— 模型早期無论是視覺編碼器还是語言模型自身的根基能力还没有成立起來,因而也很難對跨模態關聯進行有效建模。

基於上述觀察,我們确定了融合模型的技術路徑:在预训练中段開始進行多模態融合训练,最終形成一個統一的原生多模態模型,不再生產單獨的語言模型。

為了落實這一路徑,我們內部还進行研發組织的沉構,保险各個條線的數據和研發進展都匯聚到這個融合模型上。我們在 2024 年第三季度实现了融合训练的數據配方和训练超参的驗證,在第四时度实现了初版千億参數級別的融合多模態模型训练。

這個模型在國內兩個權威的第三方評測平台 OpenCompass(司南)和 SuperCLUE 上面都位居國內模型之首,其中在語言任務上和当時剛發布的 DeepSeek V3 是并列的,在內部業務評測中也有惊喜的表現。我們相信這個模型代表了当時國內多模態模型最好的水平,也堅定了我們對於融合模型這一路徑的信心。

從日日新 6.0 開始,也蕴含在今年世界人为智能大會(WAIC)上面發布的日日新 6.5,都只有多模態模型,而没有單獨的語言模型。這和國內其它大模型厂商語言模型(LLM)和圖文模型(VLM)分立的佈局有很大的區別。

原生训练的數據挑战

原生多模態模型的训练能否成功,關鍵在於數據構成。

我們的原生多模態训练數據,從模態組成的角度蕴含類型:天然語言、代碼、圖文交错文档、圖文對、以及視頻和圖像序列數據。分歧類型的數據用於分歧的主张:好比語言數據能够幫助模型把握語言能力并且獲得世界知識 ;代碼數據重要面向編程能力,這不僅能够用於代碼副手,對於構建智能體也是极度沉要的。

對於多模態理解,關鍵在於建模分歧模態數據和語言的關聯。圍绕這一目標,有兩種數據形態:圖文交错,好比配圖的文章和新聞,还有就是學術界傳統常見的圖文對數據。這兩種數據有很不一樣的特點。圖文交错數據在互聯網、文件書籍中廣泛存在,天然就有海量的储量 ;而天然存在的圖文對相較之下是极度少的,很大水平必要人为標注或者合成。

在我們研發多模態模型的早期,就大量选取圖文交错數據來形成數據規模,然而發現,大部门天然的圖文交错數據的圖文關聯是很弱的,對於整體机能的影響正面但有限 ;而圖文對固然少,但是圖文關聯度強,對於跨模態建模是很有幫助的。從 2024 年開始,我們就投入很大力量钻研大規模構造多元化的圖文對數據的分歧步骤,蕴含從文本出發,選擇或者合成相關的圖像,或者從圖像出發,產生更多的問題。這些步骤的索求很有功效:目前,圖文對數據在跨模態數據中的占比已經超過 70%,對於我們多模態模型机能提升起到關鍵作用。

5、多模態推理的挑战在哪里?

重要觀點

●?大模型推理的主题途徑是“思維链”。由於人为構造成本高、難以規 ;,思維链重要通過算法自動構造。

●?強化學習也是以思維链為載體训练模型的推理能力,它和 SFT 的底子差別在於從“強行仿照”轉變為“自發索求”,讓模型在 “天生-驗證-學習” 的算法閉環中持續改進自身思維。

●?推理模型的重要難點是在算法之表,重要有三沉挑战:源問題的多樣性、自動化驗證的有效性、思維链索求的效能。

●?人的思虑過程其實是真正意義的跨模態的,是逻輯思維和形象思維的結合。從技術角度,形象思維能给逻輯思維帶來互补的思維路徑,拓宽思路。

●?逻輯思維和形象思維的結合,重要是通過圖文交错思維链實現的。

●?圖文交错思維链的技術本質是一個“內省式”的智能體 —— 調用工具批改自己的思維過程。

●?圖文交错思維链必要通過強化學習放大其作用,具體技術上實現要關注三個問題:動作空間的定義、混合獎励信號的設計、以及 Agentic RL 系統的優化。

隨著模型能力的提升,多模態模型在被應用在更复杂的場景中,好比文档分析、醫療诊斷、城市治理和科學發現。在這些場景中,我們必要模型匯聚多種形態的資訊,進行多步的推理能力得到有意義的結论,這就要求模型具備多模態推理的能力。

推理模型的主题挑战

大模型進行推理的主题途徑就是"思維链"(Chain-of-Thought)。為什么必要思維链呢?因為,复杂問題的答案好多時候不是那么顯然的,很難通過 next token 的概率散布直接输出,因而必要一個逐步推演的路徑導出結论。

思維链數據的構造是這里面的主题挑战。思維链數據是极度稀缺的,大部门要依赖人为編寫或者算法構造。人为編寫的成本极度高,并且很難規 ;。算法構造重要是“批量天生 + 驗證篩選”的模式,就是從给定的源問題出發,讓模型或者智能體天生多條思維链,之後基於自動化驗證篩選出好的思維链用於训练。

大模型早期,思維链重要是通過监督學習(SFT)训练到模型的,這種範式對於预先構造的思維链有很強的依赖,并且模型的泛化性也比較脆弱。強化學習的引入提供了新的範式:我們不再必要预先構造思維链,只必要提供問題和驗證器 ;學習算法會讓模型自行索求分歧的思維路徑,分別計算它們的獎励(Reward),選擇好的路徑對模型進行更新。相比於监督微調(SFT),強化學習的底子差別在於從”強行仿照“轉變為”自發索求“,讓模型在 “天生-驗證-學習” 的算法閉環中持續改進自身的思維。強化學習這種以內生為主的算法特點,使得它所形成的思維链更貼近模型基座的原生模式,也有更好的泛化性。

必要指出的是,無论是思維链的预先構造还是強化學習,我們都面臨著學習算法之表的三沉技術挑战:

1.?源問題的多樣性:若何獲得足够多樣化且拥有挑战性的源問題 ;

2.?自動化驗證的有效性:若何對天生的思維链進行有效的自動化驗證 ;

3.?思維链搜尋的效能:若何提升天生好的思維链的概率和效能。

事實上,在推理模型的训练實践中,強化學習的選型,好比 PPO 还是 GRPO,對於最終机能的影響并没有那么顯著。這几個技術問題才是推理模型训练的主题挑战。這几個問題的應對直接影響模型的推理能力,這是模型研發組织必要沉點關注的。

多模態推理和文本推理的异同

到了 2025 年,重要的多模態模型已經具備了肯定的推理能力。值妥贴心的是,主流多模態模型的推理思維链还是纯文本的。實質上,它們做的是通過多模態理解的能力把输入的圖像轉換為文本描述,然後利用語言推理模型進行後續的推理。這只是多模態理解與纯文本推理的嫁接,并没有在推理過程中發挥其它模態的作用。這和人類思虑有很大差別:人的思虑過程其實是真正意義的跨模態的,是逻輯思維和形象思維的結合。

形象思維是以直覺形象支持的思維過程。所谓“一圖勝千言”,在好多時候,直觀形象相比逻輯思維能够幫助我們更快地抓住事物的關鍵和本質,從而引發新的思虑。這也是人們通過几何圖形、資訊圖表、工業圖纸等形象方式表達复杂資訊的原因。

從技術角度,為什么形象思維能帶來推理能力的提升?我們能够從這樣的角度進行思虑:某種意義上,大模型其實是一個重大的思維網絡,所谓思維链,能够理解為在這個網絡中缓步所經過的路徑。相較於逻輯思維,形象思維有一些很不一樣的特點,好比跳躍性、整體性、直覺性等。有了形象思維,相当於在這個思維網絡中增长了一批新的連接和捷徑,從而形成更強的直覺思維和發散思維。這對於整體思虑能力的提升是有意義的。

若何實現逻輯思維和形象思維的結合?我們認為:能够借鉴思維链的做法,但是要在思維链中参与圖形化的元素,把部门思虑過程轉化為圖形化表達,從而引發新的思虑路徑。這種思維链是以圖文交错的形態存在的,在必要的处所插入圖形化的資訊表達。我們在日日新 6.5 的研發中尝試引入了圖文交错思維链,已經在實驗中觀察到它們對於多模態推理能力的正面作用。

圖文交错思維的技術挑战

到了實操層面,圖形化表達若何實現呢?這里有兩種思路,一種是內生的混合模態思維链,就是思維链形成的過程中會自發產生視覺元素 ;另一種是在思虑過程中根據必要調用工具進行圖像編輯,好比放大部门區域或者增长辅助元素(辅助線、標注點等)。

在這兩種實現路徑的選擇上,我們思考兩個問題:目標和效能。首先,必要明确的是,我們在這里的目標,是以視覺身分引導思維,但是并不必要钻营電影級的高清畫質 ;并且為了保證思虑時間在一個可接受的范圍,每一個中間圖像的天生不能有太高的延時。而当前的圖像天生技術,無论是指令遵循的靠得住性或者生功效能尚不能很好地满足要求。

基於這樣的觀察,我們選擇了兩步走的路徑第一步,先通過調用工具進行圖像編輯的方式,構建圖文交错思維链,這種方式能够高效且精準地實現構圖目標。這個步骤的本質其實是構建一個“對內”(introspective)的智能體。 通常意義的智能體是調用工具和表部世界進行交互 ;這里的智能體也是調用工具,但是它不是為了和表界交互,而是和自身的思維過程交互。智能體不僅能對表,也能對內,這是我們对待智能體的新的維度。第一步的進展,能够讓我們對於圖文交错思維的工作道理以及數據構建步骤论成立越发深刻的理解。我們內部在推進第二步的索求,就是基於多模態理解天生統一的机造實現內生的圖文混合思虑。我們相信這將為多模態推理打開新的空間。

從具體的技術構建來看,相比於纯文本思維链,圖文交错思維链的構造越发挑战。構造者不僅要把思虑過程寫下來,还得造作出作為思虑節點的圖片,因而,很難以纯人为的步骤進行大規模構造。

我們克服這個困難的途徑是:人为構造種子 + 強化學習進行規 ;嵘。具體而言,钻研員根據對思維過程的理解先構造出一批種子數據,通過监督微調(SFT)训练到模型傍边,使模型初步具備圖文交错思虑的能力,之後通過多轮強化學習顯著提升模型的多模態推理能力。我們發現,強化學習的成效极度顯著。在一個內部多模思維的評測中,SFT 冷啟動只帶來了有限提升(52.5 → 54.2),但是經過多轮強化學習後,提升到了 76.3。

要走通這個技術路徑,我們必要解决三個技術問題:

1.?動作空間(action space)的定義。?我們首先必要定義這個“內省式”智能體能對思維链中的圖像做哪些操作。這些操作必要在 SFT 阶段讓模型都經历過,這樣能力在後續的強化學習中激發它用這些操作進行更多的圖文交错思維索求。我們当前的動作空間还是蕴含终部门放大、加掩膜(mask)、加辅助線、加標注點等。固然這個空間还比較有限,但是這些操作都极度實用,能解决好多問題,并且動作空間是能够在後續钻研中不斷拓展的。

2.?混合獎励信號(reward)的設計。?我們在训练的時候融合了多種任務,蕴含傳統的視覺感知、OCR、圖文問答、數學、代碼、表格分析、GUI 操作,以及更拥有開放性的寫作、高阶任務等。我們為分歧的任務設計了分歧的 Reward,對於有客觀標準的任務,我們选取了基於規则的驗證器(Verifier),對於開放任務训练了 Reward model。分歧的任務在训练過程中是混合的,并且隨著训练的推進,我們會加大困難任務的比例,以促進模型能力的循序提升。

3.?Agentic RL 系統的優化。這里的強化學習實質上是在训练一個 Agent,因而必要 Agentic RL 能力的支持。為了提升训练效能,我們做了好多系統和算法的聯合優化。這里和纯文本條件下的 RL 有一個沉要的區別,就是必要在學習的過程中必要给沙盒傳入好多圖像。因為模型自身的計算是在 GPU 上進行,而沙盒中進行的圖像操作是在 CPU 上進行,并且圖像的字節數比文本要多,是會帶來不成忽略的通讯成本的,因而必要進行系統性的優化。

經過多轮強化學習後,整體的推理机能大幅提升。其中,斅讽、代碼、GUI 操作、圖表分析、高阶任務等維度的提升尤為顯著。這個觀察顯示了,在多模態思維的設定下,強化學習對於激發思虑的有效性依然有明顯作用。

這種以思維链為載體,強化學習為重要途徑的新範式對於在特定領域的推理提升,成效是极度顯著的。但在真實應用中,這種路線也面臨一些挑战,蕴含:更高的幻覺率、思虑過程過於發散和冗長、以及適用性受限(好多真實任務不容易對結果的正确性進行明确驗證)。這些困難的解决仍旧是開放的問題,好比更有效的過程监督結合、更優的獎励設計、以及更可泛化的獎励模型等等都是目前技術領域在積極索求的路徑。

6、商湯的训练數據是若何生產出來的?

重要觀點

●?训练數據發展有三個趋勢:規模成倍增長、數據加工水平加深、專業高阶數據價值凸顯。

●?商湯的數據生產體系關注三個主标题標:多樣性、質量、生產效能。

●?要進一步提升大模型智能,專業高阶數據极度沉要,但是獲取難度高,以產品服務的方式獲取是一條值得索求的路徑。

●?隨著強化學習逐步成熟,思維链的天生和篩選會更多在強化學習的過程中進行,训练者只必要提供題目和驗證器。這將從底子上缓解思維链構建難的問題。但是可泛化的驗證器構造會有較大的技術挑战。

對於大模型來說,训练數據的意義是底子性的。數據定義了模型的能力邊界,而模型架構影響學習效能以及机能高度。

训练數據發展的三個趋勢

纵觀過去兩年大模型的發展,训练數據有三個方面的沉要趋勢:

1.?预训练數據的規模成倍增長:從 GPT-3 的 500B tokens 到最近 Qwen-3 的 36T tokens,三年間增長近百倍 ;

2.?數據加工的水平越來越深:從最初的简單洗濯和去沉,發展到利用多智能體進行數據洗濯和過滤,到今天,用大模型對數據大規模沉寫成為了被廣泛选取的步骤。數據加工所必要的計算成本已經達到和预训练统一量級。我們相信未來對训练數據進行離線處理所需的算力还將急剧增長。

3.?專業高阶數據的價值日趋凸顯:隨著模型智能水平的提升,互聯網或者書籍上獲得的常規數據已經很難再推動智能的進一步升級,圍绕專業問題和高難度問題的思維密集型數據是突破的關鍵。

商湯的數據生產體系

商湯從最早的時候開始就深刻認識到數據的沉要意義,持續深耕多模態训练數據的建設,形成了一套复杂的多模態數據生產體系,蕴含采集、洗濯、質检、合成和模型驗證等環節。我們對训练數據的建設圍绕三個主标题標:多樣性(Diversity)、質量(Quality)和生產效能(Efficiency)。

●?多樣性(Diversity)?:训练數據必要覆蓋分歧的學科、領域和專業層次,也必要有分歧的來源和風格。對於多模態模型的训练來說,分歧模態數據的平衡配比也是很沉要的。

●?質量(Quality)?:對於大模型训练而言,數據的質量是性命線。日日新大模型系列從 1.0 發展到 6.0,每一次能力升級,數據質量的提升都起到沉要作用 ;当我們發現模型的表現有問題時,追根溯源,往往發現是源自數據質量的瑕疵。經過近兩年的發展,業界對數據質量要求的內涵也在不斷豐富,現在我們不僅要求數據是干净的,并且對於其中的資訊密度、思維密度也提出了要求。

為了保證數據的質量水平,我們重要是通過模型检驗數據,標準很简單,每一批數據投入真正的生產训练之前,我們都會在我們最新版的模型和業內最好的開源模型進行續训,若是机能有增益,就說明這一批數據是有正面價值的。

●?生產效能(Efficiency)?:大模型训练必要海量的高質量數據,并且模型迭代節奏很快。這就必要我們的數據生產系統的效能要跟得上训练的節奏,不能拖後腿。數據生產的流程管線日趋复杂,当越來越多的處理逻輯被集成到生產過程,不成预防帶來效能上的职守,因而必要持續進行優化。当前,我們的數據生產系統满載處理的時候能够每天生產 5T tokens,足以充分保险迭代需要。

高阶專業數據的獲取

正如前文所述,隨著大模型智能水平的提升,專業高阶數據(好比數學解題的思維链、醫療诊斷背後的判斷過程、一份代碼背後的構架思虑)日趋沉要。這些數據是引導模型從“知其然”(表層模式)到“知其所以然”(深層逻輯)進化的關鍵。

高阶數據天然极度稀缺,在早期重要依附請大學生或者專業人士進行標注,不僅費用高昂,并且效能很低。據報路,OpenAI 在以 100 美元時薪甚至更高的價格來聘請領域專家進行高阶數據標注。商湯的交互模型有很強的擬人和推動劇情的能力,其背後也離不開好多編劇編寫的高水平對話數據。

面對挑战,商湯也在積極索求越发高效的路徑:

●?以人为編寫的數據作為種子,通過自動化管線進行增廣。經過長時間致力,商湯的钻研團隊已經搭建了面向分歧類型的專業高阶數據的規 ;铣晒芫€,通過多智能體協作進行思維链的合成和驗證。好比,在合成多模態思維链的時候,我們的管線會先產生某個主題,然後追求相關概想的圖像進行沉組合成新的圖像,然後遵循某種思維路徑合成思維链路,最終由智能體進行正确性和質量的驗證。

●?依照预設路徑的步骤合成的思維链重要的問題是多樣性不及。為相识决這一問題,一方面能够扩大種子數據的多樣性 ;另一方面,在高難度題主张牵引下,通過“路徑搜尋”,也就是天生多種路徑并進行驗證篩選,來找到越发复杂的思維链。

●?在產品服務中天然獲取數據也是被業界積極尝試的途徑。這背後的设法就是通過向專業用戶提供好用的工具,在幫助他們工作的同時也能捉拿其從問題出發獲得結果的過程。這個途徑更貼近場景、也更容易規 ;@取,但是很必要產品服務層面的巧思。

從技術發展的總體趋勢看來,隨著強化學習逐步成熟,思維链的天生和篩選會更多在強化學習的過程中進行,训练者只必要提供題目和驗證器。這將從底子上缓解思維链構建難的問題。我們在钻研圖文交错思維的時候,就是选取了這一思路:只是人为構建少數的種子,重要的训练過程是通過強化學習实现(参見上一節)。但必要把稳的是,驗證器的構造,尤其是面向開放場景的可泛化驗證器,在技術上也有好多挑战,是我們必要再後續工作中沉點關注的。

7、模型設計有哪些思虑?模型尺寸和架構未來若何演進?

重要觀點

●?模型架構設計的主题是效能。

●?日日新 6.5 的架構優化的沉點是通過輕量化的視覺編碼器,實現視覺資訊和語言資訊應該在更早期就進行融合。

●?模型尺寸的選取趋於務實,更優的机能-成本曲線比單纯钻营大尺寸越发沉要。

●?大模型的應用落地在加快,多智能體是突破工業红線的沉要範式。

●?主流模型架構效能还极度低(相比於人腦),未來模型架構演進的主题仍將是效能提升,好比通過進一步的稀少化以及职能分化(e.g. 知識和推理解耦) ;同時多模態理解天生統一、快慢思虑的融合都是值得索求的方向。

模型架構設計的主题是效能。一個好的模型架構,可能以更低的代價實現從數據到模型能力的轉化。

大模型最初选取的是浓密 Transformer 架構(GPT-3、Llama),它的計算复杂度隨参數量線性增長,隨著高低文長度呈平方增長。因而,隨著参數量增長,高低文變長,它的計算成本就成為一個焦點問題。圍绕這個問題有好多索求,重要蕴含:

1.?模型架構的稀少化:在维持總参數量的條件下,削减每次計算的激活参數,從而降低計算代價 ;旌喜螖担∕oE)就是這個方向的典型,已經被業界廣泛选取。另表,對模型参數進行剪枝和低比特量化也是降低計算成本的有效处徑。

2.?高效确把稳力机造:把稳力机造的效能不僅影響算力成本,还直接影響模型的響應延時和用戶體驗,一向收到行業的高度關注。Sparse attention、Linear attention、Paged attention 等分歧机造被提出來,從分歧角度降低把稳力机造的复杂度。PD 分離等系統架構上的優化也是讓 KV Cache 被更高效運用的架構範式。

日日新 6.5 背後的多模態架構優化

對於多模態模型,架構設計的复杂度多了一個維度,就是視覺編碼器(Visual Encoder)。固然視覺編碼器的参數量占比不高(在日日新 6.0 里,視覺編碼器参數量只有 MLLM 主干参數的 1%),但是因為它對旒個圖像都要處理多個 patch,因而在端到端的計算延時上占比達到 30% 。真實應用中,好多時候要處理大分辨率的圖像(好比設計圖、文档表單等),因而占比更高。所以,在多模態架構設計中,視覺編碼?榈膬灮浅烈囊轭}。

在模型設計中,我們沉新思虑了視覺編碼器和 MLLM 主干的职能定位。我們認為,“眼睛”和“大腦”的設計是有本質區別的,前者重要是捉拿視覺信號,這是一種連續信號,并且是受分辨率影響的 ;後者重要是在語言和語義層面進行計算,而語言的暗示方式是離散的(以 token 為單元)。這就决定了,視覺感知和語言模型應該有不一樣的模型結構和學習方式。

視覺編碼器應該聚焦在感知职能上,對視覺信號越发敏感,專注於視覺編碼。涉及到語義相關的處理,應該及早和 LLM 主干進行融合。所以,在日日新 6.5 里面,我們推動視覺編碼器輕量化的設計,把視覺編碼器的體積從 6B 减到 1B,從而實現更火速的感知 ;同時把 MLLM 主干變深(層數更多)變窄,以適應深度推理的必要。經過這樣的改動,模型能够更快捷地處理高分辨率大圖以及長視頻 ;再加上對训练數據的進一步優化,模型在同樣机能表現下的效能提升超過 3 倍。我們在架構優化上的致力使得机能成本曲線得以顯著優化,實現了比 Gemini 2.5 系列更優的效費比。

模型尺寸未來是否會進一步增長

在大模型時代早期,尺度定律在很大水平上驅動著模型能力的競爭和發展,模型規模曾突破萬億。Google 早在 2021 年就發表了萬億参數的 Switch Transformer,這也是較早尝試把 MoE 和 Transformer 結合的工作。但是,業界很早就觀察到模型参數量并不是模型能力的唯一身分。DeepMind 在 2022 年的一篇论文中就基於詳盡的實驗分析指出:模型参數量和训练數據量應該同步增長("for compute-optimal training, the model size and the number of training tokens should be scaled equally")。

我們能够看到,從 2023 年至今,開源模型的参數量重要都設在 1B ~ 100B 的量級,并且逐步形成了一種分層格局:百 B 級別的模型重要是机能天花板的競爭 ;7B ~ 30B 級別的模型被普遍用於垂直業務 ;1B ~ 3B 的模型重要瞄準端側應用,或者用於業務工作流的轉接環節(文档解析、Prompt 改寫、意圖分類等)。今年以來,隨著 MoE 的逐步遍及,主力模型的總参數量被提升到几百 B,但是激活参數根基維持在 20B ~ 30B 的水平。至於企業里面用於服務 C 端產品的閉源模型,據我們相识,出於服務成本和效能的思考,也没有比上述的尺寸更大。

模型尺寸在過去兩年维吃旖穩,有兩個關鍵的原因:1)隨著大模型走向商業化,價格競爭强烈,各個企業選擇模型尺寸時趋於務實,而不是盲目钻营参數量的超过 ;2)隨著數據質量和训练水平提升,中幼模型的机能進步顯著,在好多沉要指標上已經能够比肩 GPT-4。我們認為,這樣的趋勢是切合經济規律和技術規律的,未來模型的發展重要还是圍绕著效能提升這一主标题標,以加快實用化的進程。

多智能體:突破红線的沉要範式

與此同時,有兩個沉要趋勢极度值得關注:

1.?模型調用量正以指數式成長。IDC 報告指,從 2024 年 6 月到 12 月半年間,中國大模型服務的日均調用 token 數提升超過 10 倍,2025 年还在加快。在商湯內部,我們也觀察到多個業務的模型調用量呈現跨數量級的增長。

2.?模型的數量也在急剧增長。HuggingFace 平台上的模型數量已經靠近 200 萬個(2025 年 7 月),而這個數字在一年半之前(2023 年底)才在 1 萬左近。

大模型從“大”到“多”,背後反映的是大模型在經济生涯中加快渗入,其應用邊界在急剧拓宽,人們在日常生涯工作中對大模型的依赖也明顯加深。

對於 AI 的商業化來說,我們在經历一個汗青性的黄金時期,是值得我們以最大的致力去把握的。為此,關鍵的不是钻营模型規模,而是在一個個的場景中打穿工業红線,讓技術達到可規 ;逃玫乃。

要實現突破特定方向的红線,要兩種可能的路徑:1)打造“超人”:持續提升單個模型或智能體的規模和水平 ;2)打造“團隊”:讓多個智能體協作達成目標。後者就是業內現在經常会商的多智能體。我們比較這兩種路徑。一個超級模型在好多方向突破红線,超过人類,這是存在可能性的。但是這里有兩個問題,這樣的模型研發周期极度長,資源投入巨大 ;并且,在現有的技術水平下,這個模型會變得特別昂贵 —— GPT 4.5 和 Grok 4 的價單其實已經初步反映了這個問題。相比而言,多智能體的路徑更為務實,并且在多個專業領域顯示出巨大的潜力。好比,最近 Google DeepMind 獲得數學國際奥賽金牌的 Deep Think 就是一個多智能體架構的系統。在商湯,幼浣熊背後也是一個多智能體架構,它在面對复杂業務場景的時候,顯示出比單一大模型更強的表現。

模型架構的未來演進:提效與融合

模型架構未來演進的主标题標之一依然是效能的持續提升。?目前大模型的計算能效相比與人腦还有著多個數量級的差距。在這樣的架構效能下,去钻营超級智能的代碼將是無比高昂的。從钻营 AGI 的長期目標而言,先追求更高效的路徑(好比靠近人腦的效能),然後放大,可能是更梦想的战术。

要實現模型效能的進一步提升,佑装稀少化”和“职能分化”兩個沉要方向。?稀少化就是削减每次計算的激活占比,僅使用必须的神經元,以降低計算能耗。职能分化是指:根據分歧职能的 Scale 規律進行相應的設計,并把它們有机組合在一路。好比,好多分析指出,模型的知識容量和總参數相關度比較高,而推理机能更取决與激活参數,那么知識储備和推理能力就應該適当解耦,沿著更合理的方式進行配比 ;就像芯片一樣给於分歧的职能單元以分歧的空間,或者類似人的大腦那樣形成分歧职能的皮層。

除此之表,“融合”也是突破模型現有能力邊界的沉要途徑。在過去的工作中,我們已經看到了語言和視覺的融合所帶來的多模態能力的整體提升。瞻望未來,以下兩個方向的融合也是值得我們關注的:

多模態的理解天生統一。目前,主流的多模態理解模型和多模態天生模型是兩個有顯著差距的方向,前者选取 MLLM 的自回归架構,重要用於圖文問答 ;後者以扩散模型為主题架構,重要用於圖像視頻天生。它們的研發目標也是分歧的,前者重要聚焦在語義逻輯,但是空間理解能力幽微,後者重要钻营高品質的生功成效,但是可控性和結構的真實性一向面臨挑战。多模態理解天生統一的索求,重要是但愿通過把兩者在架構和训练目標上進行弥合,從而實現優勢互补:更強的空間理解 + 更可控的精準天生。我們認為,這是一個值得索求的方向,但是不應該停顿在简單的架構缝合,而是要著力於對其內在机理的理解,從而實現真正意義的能力躍升。

常規模型和慢思虑的統一。帶有慢思虑過程的推理模型相比於通常模型在推理机能上有代差級別的顯著進步,在近几個月成為領域競爭的焦點。但是它們在應用中也露出出一些沉要問題,好比冗長且發散的思維链、更高的幻覺率、以及靠得住性和可控性的挑战等。我們認為,目前常規模型和推理模型分立的情况是 AI 進入推理阶段早期的一個暂時状態。一個拥有較高智能水平的智能體(好比“人”)應該能根據情况必要,好比問題的挑战性以及是否有充足的思虑時間,來自主選擇分歧的思虑長度。并且,一個优良的學習範式應該能讓分歧條件下的思虑能力都得到平衡的提升。

商湯在日日新 6.5 版本尝試把常規模型和推理模型融為一體,觀察到了積極的成效,兩種模式的協同训练,一方面给常規模式下的推理能力帶來提升,另一方面也在肯定水平上缓解了推理模式的幻覺。因而我們能够用一個模型支持兩種模式(必要前置設定模式)。我們目前在這兩者統一的索求上还處在相對早期,未來还將推進思虑模式的深層融合,使得模型能够做得動態自適應切換。

8、從多模態到具身智能,會面臨哪些挑战?

重要觀點

●?具身智能当前首先必要解决的是交互學習的效能問題。

●?世界模型是解决交互學習效能的關鍵技術途徑,其主题是對真實物理規律和空間結構的有效把握,因而,通常的視頻天生模型还不是真正意義的世界模型。

●?世界模型的構建必要海量數據支持。多模態模型為世界模型提供好的基礎。

当 AI 從數字空間走到物理空間,和真實世界進行交互,我們面臨的挑战是:物理世界的交互很難進行文字記錄,因而必要從實際交互過程學習。

跟其它學習阶段一樣,學習效能是主题挑战。选取真机交互的效能很低(無论是直接交互还是遥操作),当前只能满足特定場景的必要,很難像大語言模型那樣依附海量互聯網數據形成通用能力。而通過視頻模擬學習,精密度以脊鶬域天堑(domain gap)離可用还有比較远的距離。因而,在這個阶段,首要解决的是交互學習的效能問題。

一個很直接的设法,就是通過一個虚擬系統模擬現實世界的交互,讓智能體在這個系統里面的每個動作都能獲得合適的靠近真實的反馈。這個虚擬系統的主题就是“世界模型”,它基於對空間結構和物理規律的把握會對虚擬的具身智能體的動作做出靠近真實的反應。由於世界模型的交互效能远高於真實環境,以此有望顯著提升交互學習的效能。

世界模型的技術關鍵是對於空間結構和物理規律的精準把握以及多樣化場景的覆蓋。通常的視頻天生模型只是捉拿了世界的視覺側面,并没有對真實物理規律和空間結構的有效把握,因而还不能視為真正意義的世界模型。

世界模型的構建是必要海量數據支持的。商湯的開悟世界模型是在我們的多模態模型能力基礎上構建起來 —— 這個多模態模型自身就压缩了關於這個世界的海量數據。通過智能汽車業務獲得的大量真實場景數據進行加強,世界模型就因而具備了很強的模擬和天生能力,能够根據指定路徑天生分歧視角的視頻。這個模型在我們的智能驾驶系統训练中提供了很有效的交互反馈,從而幫助我們的智能驾驶系統更高效地训练。

注:關於世界模型和具身智能,由於篇幅關係,這里只做简要的论述。後面我們也思考在合適時間進行更詳细的分享。

9、商湯若何建設一支有高效且富有創新力的钻研力量??

重要觀點

●?創新人才都是技術變革的主题驅動力量。

●?面對强烈競爭,钻研團隊必要具備更高的組织度,以實現更高的迭代效能 ;同時,也必要有充分的技術索求空間,以维持創新的活力。

●?商湯是基於技術規律出發設計钻研組织,關注兩個關鍵身分:方向和效能。

●?商湯對钻研團隊進行了多方面沉構:資源統一調度、專項創新、系統提效、獨立評測。

在人为智能發展的每一個汗青阶段,創新人才都是技術變革的主题驅動力量。在大模型時代,這一點也没有改變。?在最近一段時間,人为智能钻研人才的高價薪酬引起了廣泛關注。這背後代表了領域里面在形成的共識—— 在研發路徑高度同質化确当下,年輕钻研者的創新心灵是破局的關鍵。

在商湯科技過去十年的發展中,生长了一支富有創新心灵且有強大战斗力的钻研團隊。他們在商湯穿越技術周期的每一次變革中表演著沉要角色,凭借其前瞻的視野和不懈的索求,和產品業務團隊共同定義我們前行的路路,讓公司持續维持競爭力。

在 AI 2.0 時代,钻研組织也面臨新的挑战 —— 大模型的训练高度依赖數據和算力的荟萃,并且表部競爭加劇,這要求我們的钻研團隊必要具備更高的組织度,以實現更高的迭代效能 ;同時,也必要有充分的技術索求空間,以维持創新的活力。若何應對這樣的挑战是每個公司钻研組织必须回覆的命題。

我們構建钻研組织的整體思路是:從技術規律出發設計組织結構。這里面有兩個關鍵成分:一是方向,保證技術迭代的方向和公司战术是一致的,這里評測的導向是關鍵抓手 ;二是效能,讓迭代的效能足够高,保證在我們專注的方向中走在業界前列。

在 AI 2.0 時代,商湯對钻研組织進行了几個方面的沉構:

1.?原來分散在各個事業部的研發團隊進行整合,算力和數據等技術資源也在集團層面整體配置,保险了钻研力量能够根據技術迭代的必要進行統一且靈活的配置。在几次關鍵的攻堅任務中,這種統一架構起到了關鍵作用,使得資源得以有效集中 ;在過去一年训练範式變遷的趋勢下,我們也通過這種机造及時加大了對強化學習的投入。

2.?商湯早期的大模型钻研團隊架構也是遵循業界主流的预训练、微調、多模態分工模式,各自會训练分歧的模型。隨著我們突破了原生融合训练的技術路徑,我們根據新範式調整了钻研體系,只保留了一個集成训练團隊來集中训练日日新多模態模型,其它團隊各自承担分歧迪隝域,贯通预训练、微調和強化學習來進行端到端研發,進行數據迭代 ;專項數據經過驗證後匯集到集成训练。這樣的組织模式,一方面保證了日日新大模型集成了集團各個钻研團隊的致力成就,同時也讓各個領域團隊能够有個贯通前後阶段的視野,實現整體的提升。

3.?商湯的大模型數據團隊在過去兩年,也經历了兩次沉要的變化。自 2023 年始,我們圍绕大模型的數據供给需要,組建了新的數據團隊,它建設了商湯的數據生產基礎設施,為商湯模型的训练提供了大量的高質量語料。到了 2024 年中,隨著合成數據的比沉加大,數據生產的算法化水平不斷提升,我們再次沉構了數據生產體系,讓算法團隊承担數據合成的主責,而數據基礎設施團隊重要是維护和升級基礎設施,保险數據規 ;a的效能。

4.?新建了獨立於模型研發團隊的評測團隊。它一方面维持對技術前沿的關注,另一方面和產品業務團隊缜密共同,把應用中面臨的重要問題融入評測體系。評測團隊的主题 KPI 是保證評測結果和用戶體感是一致的,它的報告會獨立遞送给治理層,以保證治理層對於商湯的技術進展有個客觀公允的認知。在這個獨立評測體系的牵引下,模型研發團隊高度關注模型的真實表現,而不僅是榜單成績,這對於商湯的模型维持商業競爭力极度沉要。

5.?维持足够高的迭代效能是在大模型强烈競爭中致勝的關鍵。迭代的效能由兩個身分共同作用:算力效能和人員效能。為了保證高的迭代效能,商湯組建專責團隊,一方面和大裝置缜密協同,在為模型训练推理提供高效的計算支持的同時,也牵引大裝置的火速迭代,讓它真正成為“最懂大模型的基礎設施” ;另一方面,關注全链條的迭代效能,以算法化和工程化方式及時沉澱和推廣最佳實践,推動整體迭代效能的持續提升。在這些團隊的致力下,模型研發的基建不斷美满,模型训练的自動化水平在不斷提升。

總體而言,商湯的钻研團隊在 AI 技術急剧演進的時代海潮下,組织體系也在與時俱進,不斷沉塑自我,始終以最佳的隊形應對强烈的競爭 ;在持續提升研發效能的同時,维持著堅持原創的初心。

10、商湯若何平衡技術突破和商業落地的關係?

重要觀點

●?通向 AGI 的路路是一場長跑,技術梦想也必要商業價值的护航能力行穩致远。

●?商湯没有把技術和商業視為爭奪資源的兩側,而是把它們視為互為因果的兩個環節,關注它們的正向循環。

●?在研發投入上最主题的問題是最好“科技树”上的選擇題。

●?研發和商業的正向循環,不只是一句口號,而是贯彻於組织、項目和查核等各個層面的理想。

●?長期主義帶來的复利,將讓我們在自己的路路上脱颖而出,形成堅實的競爭優勢。

這一波大模型海潮沉塑了全世界對於人为智能的認知。新技術、新產品令人应接不暇,“未來已來”是好多人最直觀的感触。繁華和喧哗的背後,我們始終维持著一個沉要的判斷:

通向 AGI 的過程是一場長跑

通向通用人为智能(AGI)的過程是一場長跑,不是一挥而就的冲刺。?当静下心來去審視人为智能這兩年多以來的進展,我們會看到有好多根基挑战尚未能得到解决:

●?大模型在獲得奥賽金牌的同時,在好多業務場景中的表現依然不够靠得住 ;

●?大模型工作机理尚未被充分認識,我們还不足靠得住的步骤论保證模型的行為遵循人類的等待 ;

●?大模型對於三維空間以及物理規律的把握还處在較早期的阶段 ;

●?由於專業數據的壁垒,大模型向高價值行業落地还面臨沉要挑战 ;

●?大模型的工作还是以現有知識和能力的深度沉組為主,若何讓它創造新的知識目前还是開放問題 ;

●?大模型的計算效能和人腦相比还存在巨大差距(人腦的均匀功率只有 20 瓦,却能火速處理复杂的多模態信號)。

這些問題的解决还必要較長的時間。AlphaGo 是人为智能汗青上一次里程碑式的進步,大模型也是,但是,以目前所获得的進展而言,宣稱“AGI 的到來” 似乎还為時尚早。

商湯始終堅定地走在追寻 AGI 的路路上,但是技術梦想也必要商業價值的护航能力行穩致远。

技術突破和商業落地的正向循環

在實際工作中,若何能力實現技術突破和商業落地的平衡?這是這個領域每個公司都會面臨的主题問題。在商湯,我們没有把技術和商業視為爭奪資源的兩側,而是把它們視為互為因果的兩個環節。相比於資源的分配,我們更關注這兩者若何實現有效的正向循環。

基於這樣的認知,我們确立了“基礎設施 - 模型 - 應用”三位一體的總體战术。一方面,我們在大裝置基礎設施支持下,致力於打造業界領先的通用多模態大模型,融匯跨模態跨領域的數據,通過持續的技術創新,在感知、理解、推理、交互等能力維度上不斷突破 ;另一方面,我們在應用上聚焦生產力和交互,在真實場景牵引下,構建端到端的產品技術競爭力。

到了具體研發决策的層面,我們确實面對好多開放性的挑战,技術上能够投入的事項极度多,但是資源和時間都是有限的。因而,我們在研發投入上最主题的問題是“科技树”上的選擇題。具體而言,我們在選擇投入做什么研發的時候,會思考三個根基問題:1)它是否顺應技術發展的總體趋勢(是否走向融合而不是更深的定造) ;2)它是否能够增強商湯所聚焦方向的競爭力 ;3)它是否是在我們經過致力能够達成的。對於這些問題的回覆是技術和商業判斷凝聚的結果。在商湯,每個研發周期前都會有產研會商的钻研會议,共同确定下一阶段的投入方向以及目標。我們亲昵觀察表部的進展,但是我們有我們自己的定位和節奏,不會受表界過多的滋扰。

在商湯,研發和商業的正向循環,不只是一句口號,而是贯彻於組织、項目和查核等各個層面的理想。?值得強調的是,業務對於钻研的引導,并不是要讓钻研人員去圍绕特定需要做定造,而是從中抽象出關鍵的课題,融入每一個阶段的研發規划,從而為產品構築長期競爭力。

在三位一體战术和技術與業務正向循環的驅動下,我們過去一年获得了好多進展。一方面,我們的基礎技術體系形成炼強的創新勢头,在業內率先获得一系列創新成就:好比原生融合训练,圖文交错思維链、多模態融合強化學習、無限時長的視頻交互記忆、以及開悟世界模型 ;另一方面,在技術創新的支持下,商業化局面在迅速打開,生產力 AI 的机能持續维持領先,裝机量在從百萬量級走向千萬量級 ;交互 AI 廣泛落地各種新型智能硬件和机械人,在沉塑用戶和世界交互的形態。商湯在天生式 AI 板块業績的持續高速成長充分顯示了這些成就所帶來的商業回報。

面對大厂的競爭,商湯在資源投入的總量上是有一個限度的。但是,我們對於未來的路徑有自主的思虑和認知,在战术上高度聚焦,長期堅持,在技術路徑和產品業務上激励創新,火速迭代,逐步成立起技術-商業的閉環。

這種長期主義帶來的复利,將讓我們在自己的路路上脱颖而出,形成堅實的競爭優勢。

【网站地图】