在6月中旬獲得500億融資后僅十幾天,6月27日,DeepSeek團隊聯合北京大學發布論文《DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation》。
這不是一次模型版本的迭代,而是在原有DeepSeek-V4-Pro和DeepSeek-V4-Flash基礎上增加了一個推測解碼模塊,重點在于工程落地層面的優化。
隨DSpark一同開源的DeepSpec,是一個用于訓練和評估推測解碼草稿模型的全棧代碼庫,包含數據準備工具、草稿模型實現、訓練代碼和評估腳本,支持MIT許可。目前DeepSpec已內置DSpark、DFlash和Eagle3三種實現。
(相關資料圖)
值得注意的是,DeepSeek創始人梁文鋒位列論文作者名單。在完成首輪融資的當下,創始人依然親自參與技術論文撰寫,這在AI行業并不多見。
實測數據驗證:同等吞吐下,V4-Flash提速60%-85%,V4-Pro 提升 57%-78%
不同于僅停留在實驗室的算法優化,DSpark 已完成真實用戶流量落地驗證。該框架全面部署于 DeepSeek-V4-Flash、V4-Pro 線上服務,替代此前 MTP-1 生產基線。在同等系統總吞吐規模下,V4-Flash 單用戶生成速度提升 60%-85%,V4-Pro 提升 57%-78%。
除了DeepSeek自家的大模型,DSpark也已經部署到了阿里旗下的Qwen3-4B、8B、14B,以及Gemma4-12B。三大評測領域分別是:數學推理、代碼生成、日常對話。
DSpark兼容 Qwen、Gemma 等國內外主流基座,同時配套 DeepSpec 倉庫、模型權重全部開源。這意味著,對于缺乏底層算法團隊的中小企業、ToB 服務商,無需投入巨額研發即可復用成熟推理優化方案,大幅降低大模型私有化部署、線上服務的落地門檻,智能體、工業代碼、金融輿情等場景規模化落地速度有望加快。
論文數據顯示,DSpark 在全部目標模型、全部評測領域下,穩定超越自回歸基線 Eagle3 與并行基線 DFlash。以 Qwen3-4B/8B/14B 為例,宏平均接受長度相對 Eagle3 提升 30.9%、26.7%、30.0%;相對 DFlash 提升 16.3%、18.4%、18.3%。這一優勢具備跨模型的泛化能力,在Gemma4-12B目標模型上同樣取得了一致的性能增益。
除整體提升外,論文實驗數據還揭示了顯著的領域差異效應::結構化任務(如數學推理、代碼生成)的可接受長度天然更高(例如Qwen3-4B在數學任務上平均為5.57,代碼任務為5.12),而開放式對話場景則明顯偏低(僅3.49)。
論文也指出當前方案存在局限:對于本身可預測性極低、接受率偏低的復雜查詢,這部分前置草稿算力無法回收。未來的優化方向可在草稿模型內部引入難度感知的早退出機制,使此類請求能夠跳過完整塊生成流程。
不拼參數拼速度:DSpark的兩項技術突破
大語言模型采用自回歸方式生成文本——每生成一個新token都需要一次完整前向傳播,推理延遲隨輸出長度線性增長。推測解碼(Speculative Decoding)是行業公認的解決路徑:用一個輕量級草稿模型快速生成候選token,再由大模型批量驗證。
但現有方案各有短板。
自回歸草稿模型(如Eagle3)逐token串行生成,依賴關系建模能力強、接受率高,但草稿耗時隨候選塊長線性增長,只能使用短塊、淺層網絡。
為打破串行瓶頸,并行草稿模型成為更優方案:所有草稿位置僅需單次前向傳播即可生成,草稿耗時幾乎不受塊長影響。但想要充分發揮長并行草稿塊的潛力,仍存在兩大核心瓶頸:
生成質量瓶頸:并行草稿模型獨立預測每個位置,無法建模塊內 token 依賴,會出現多模態沖突問題,序列后半段 token 接受率快速衰減;
系統效率瓶頸:最優驗證長度難以確定。并行生成雖能產出長草稿塊,但不加區分地驗證全部 token 會降低系統吞吐,高并發場景下問題尤為突出。
DSpark針對這兩大瓶頸提出兩項互補機制。
半自回歸生成架構:保留并行主干的高吞吐優勢,同時加入輕量級串行模塊,逐token注入前綴依賴信息。該模塊提供兩種實現——僅依賴前一個token的馬爾可夫頭,以及通過循環狀態累積完整前綴信息的RNN頭。實驗表明,兩層Transformer深度的DSpark即可在所有測試領域超過五層DFlash的接受長度。
置信度調度驗證機制:引入置信度頭評估每個token在給定前綴下的“存活概率”。硬件感知前綴調度器根據實時引擎吞吐量動態決定最優驗證長度,優先將算力分配給預期回報最高的token。論文發現原始置信頭存在置信度過高問題,團隊設計了“時序溫度縮放”后驗校準方案予以修正。
DeepSeek 在完成大額融資后并未單純追求參數擴容,而是關注落地效率,擊中產業真實痛點。在生成式AI從實驗室走向商業化的周期里,“更快、更省算力”正在取代單純的模型跑分,成為廠商競爭力的關鍵指標。
關于我們| 聯系方式| 版權聲明| 供稿服務| 友情鏈接
咕嚕網 m.stlrota.com 版權所有,未經書面授權禁止使用
Copyright©2008-2023 By All Rights Reserved 皖ICP備2022009963號-10
聯系我們: 39 60 29 14 2@qq.com