了「一行均值」,騰訊 FlashPrefill V2 把長上下文 Prefill 推理重寫了一遍)
提速 47 倍只動(dòng)了「一行均值」騰訊 FlashPrefill V2 把長上下文 Prefill 推理重寫了一遍Hugging Face 每日論文2026-08-22 精選 · 反差流論文FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving作者Qihang Fan、Huaibo Huang、Zhiying Wu、Bingning Wang、Ran HeTencentarXiv2608.19758cs.CL2026-08-20一、荒謬的事實(shí)在第一句話一臺(tái) NVIDIA H20 跑 128K 上下文、FP8 精度FlashPrefill V2 比 FlashAttention-2 快了47.26 倍。把精度換回 BF16還有27.19 倍哪怕對(duì)照的是已經(jīng)對(duì)齊 FA3/4 流水線的高密度基線FP8 下仍然有30.49 倍。這三個(gè)數(shù)字放在一起讀會(huì)讓人覺得「H20 終于不是 AI 算力的尾巴了」。但事實(shí)正好相反——硬件沒換、顯存沒多、KV 沒動(dòng)被改的只是「注意力算法怎么算」那一段。騰訊把這個(gè)系列從算法原型推到生產(chǎn)環(huán)境的關(guān)鍵寫在一篇不到一頁紙的 abstract 里主題詞只有三個(gè)mean correction、sparse operator、SGLang。把長上下文推理加速到三四十倍這個(gè)事過去一年沒人能做到——稀疏是做過、動(dòng)態(tài)閾值是做過、稀疏算子寫入 FA 風(fēng)格的 Paged KV 也是做過但同時(shí)把精度不掉、算子對(duì)齊 FA3/4、又能跑進(jìn) vLLM/SGLang 在線服務(wù)的連續(xù) batching這件事之前沒人串成一根鏈。FlashPrefill V2 的貢獻(xiàn)就在于把這三件事打包了。二、要解決的真問題Prefill 不是 Decode復(fù)雜度是 O(N2)「長上下文」這件事對(duì)很多人來說只是 token 多一點(diǎn)但它在系統(tǒng)側(cè)意味著完全不同的瓶頸。一次 LLM 推理被切成兩段Prefill一次把整段 prompt 讀完、算 KV cache和Decode逐 token 生成輸出。Decode 部分早已被 KV cache 和投機(jī)解碼做成熟了瓶頸一直在 Prefill。為什么因?yàn)?Prefill 階段要做完整的注意力矩陣序列長度 N要算 N×N 個(gè)注意力權(quán)重。對(duì)于 128K 上下文來說就是 1.68 億次浮點(diǎn)運(yùn)算而當(dāng) batch 內(nèi)多個(gè)長 prompt 并發(fā)時(shí)復(fù)雜度又乘 batch 量級(jí)GPU 算力很快被打空延遲陡升。行業(yè)里所有長上下文優(yōu)化的核心目標(biāo)都是同一個(gè)怎么讓 Prefill 階段的注意力矩陣變稀疏但稀疏后模型輸出的質(zhì)量不要掉。三、上一代 FlashPrefill 做到了什么、又卡在哪騰訊去年提出的 FlashPrefill原版是這條路的起點(diǎn)。它有兩條核心機(jī)制瞬時(shí)模式發(fā)現(xiàn)用「左下角」掩碼的稀疏模式快速探測哪些 query-key 對(duì)是顯著相關(guān)的基于最大值動(dòng)態(tài)閾值用一個(gè)全局 max 值動(dòng)態(tài)決定保留哪些塊讓稀疏率隨數(shù)據(jù)自適應(yīng)。但 abstract 里他們自己寫得很坦白「仍是一個(gè)遠(yuǎn)離生產(chǎn)部署的算法原型」。三個(gè)生產(chǎn)部署的硬傷痛點(diǎn)原版缺什么極端稀疏時(shí)精度掉缺一個(gè)全局的「均值校正」算子對(duì)齊不上 FA3/4顯存訪問、流水線調(diào)度沒重做服務(wù)端集成空白paged KV cache / 連續(xù) batching 沒接入FlashPrefill V2 是把上面三個(gè)空格逐一補(bǔ)完的版本。四、V2 三件套mean correction 算子重寫 服務(wù)集成4.1 一行均值項(xiàng)把極端稀疏的誤差壓回去稀疏注意力最反直覺的一點(diǎn)當(dāng)稀疏率很高時(shí)比如 95% 以上的塊被砍掉「最大注意力」往往集中在少數(shù) token 上其余的近似誤差被這些最大值掩蓋了——但誤差本身還在累積。V2 的解決思路非常克制在動(dòng)態(tài)閾值后加一個(gè)均值校正項(xiàng)mean correction term把被砍掉那部分的期望值補(bǔ)回來。這「一行」不是真的只有一行而是計(jì)算上只多一個(gè) block 級(jí)的均值讀取但效果是讓稀疏率可以推到更激進(jìn)。具體收益abstract 里 V2 在 128K FP8 下做到了 47.26× 加速同時(shí)精度損失在大多數(shù)下游任務(wù)上幾乎可以忽略——這是「稀疏 校正」組合拳第一次跑到這種密度。4.2 算子重寫對(duì)齊 FA3/4 的全部工程優(yōu)化僅有數(shù)學(xué)公式?jīng)]意義。V2 把稀疏算子重寫成三類并行結(jié)構(gòu)PackGQA 顯存訪問把 KV cache 按 Grouped Query Attention 打包連續(xù)內(nèi)存訪問避開顯存瓶頸Warp 特化把 warpGPU 內(nèi)最小調(diào)度單位分成 compute warp 與 data warp 兩類前者算 GEMM、后者搬運(yùn)數(shù)據(jù)流水線并行乒乓流水線pingpong pipelining雙緩沖讓計(jì)算和數(shù)據(jù)搬運(yùn)幾乎零等待。這一套對(duì)得上 FA3/4 的工程骨架所以同一個(gè)模型只要把 attention backend 切到 V2不需要改任何上層代碼額外顯存占用和計(jì)算開銷都很小FP8 也得到原生支持。4.3 服務(wù)框架直接接入 SGLang加速只在實(shí)驗(yàn)室跑通不夠必須能進(jìn)推理服務(wù)。V2 顯式支持Paged KV cacheKV 不再按連續(xù)顯存布局而是分頁存放碎片率顯著下降連續(xù) batchingcontinuous batching服務(wù)里新請(qǐng)求隨時(shí)插進(jìn)舊 batchPrefill 與 Decode 不再交替阻塞。這意味著 V2 不只是一個(gè) kernel而是一個(gè)后端模塊——現(xiàn)在已經(jīng)被接入 SGLang 作為可選項(xiàng)對(duì) vLLM 的接入也是路線圖里的下一步。五、關(guān)鍵數(shù)據(jù)47.26× / 27.19× / 30.49× 三個(gè)數(shù)字怎么讀abstract 給出的基準(zhǔn)全部在NVIDIA H20 GPU上跑128K 上下文長度三組核心數(shù)字如下表。精度對(duì)照基線加速比FP8FlashAttention-247.26×BF16FlashAttention-227.19×FP8FA3/4 對(duì)齊的稠密基線30.49×這三個(gè)數(shù)字放在一起解讀很重要47.26× vs FA2是「技術(shù)演進(jìn)紅利」——FA2 已經(jīng)是四年前的 kernelFA3/4 引入了大量 warp 調(diào)度優(yōu)化所以哪怕其他廠商的「長上下文優(yōu)化」號(hào)稱 30×、40×很多是拿 V2 跟 FA2 比30.49× vs FA3/4 對(duì)齊稠密基線是「真的工程產(chǎn)出」——同樣的算子流水線、同樣 paged KV、同樣 batchV2 的稀疏校正能再壓 30 倍27.19× BF16 vs 47.26× FP8是「精度換速度」的常規(guī)梯度BF16 比 FP8 多一倍比特加速比從 ~47 降到 ~27說明 FP8 的稀疏下均值校正發(fā)揮得更干凈。六、這個(gè)工作對(duì)工業(yè)界的真正意義對(duì)一個(gè)普通開發(fā)者來說「47× 加速」意味著什么對(duì)長上下文應(yīng)用128K 文檔摘要、整本 PDF 問答、長代碼庫 review原先要等幾十秒的首 token現(xiàn)在接近實(shí)時(shí)可用。對(duì)推理服務(wù)提供方同等 QPS 下 GPU 數(shù)量可減少到 1/30或同等 GPU 數(shù)量下并發(fā)能力提升 30 倍——單位 token 推理成本大幅下降。對(duì)模型訓(xùn)練側(cè)長上下文訓(xùn)練的 Prefill 也可用相同 kernel訓(xùn)練效率提升同樣成立。局限也很明顯基準(zhǔn)僅在 H20 上A100/H100 上的對(duì)照表需要等待論文后續(xù) benchmark 放出均值校正項(xiàng)在極端稀疏95%下的穩(wěn)定性還需要在更多長上下文任務(wù)書摘、長代碼、長視頻腳本上驗(yàn)證質(zhì)量評(píng)測細(xì)節(jié)abstract 未給出需要看正文具體任務(wù)perplexity、long-bench 等。七、和近一年同類工作的對(duì)比把近 12 個(gè)月的長上下文推理加速工作擺到一起工作時(shí)間核心機(jī)制部署形態(tài)StreamingLLM2024-01Attention Sink算法MInference2024-07三種動(dòng)態(tài)稀疏模式CUDA kernelFlashAttention-32024-12異步流水線kernelFlashPrefillV12025動(dòng)態(tài)閾值稀疏算法原型FlashAttention-42026-03warp 特化kernelFlashPrefill V22026-08均值校正 稀疏算子 SGLang生產(chǎn)模塊V2 的關(guān)鍵差別在于不止一個(gè) kernel它把稀疏算法、對(duì)齊 FA3/4 的工程、和服務(wù)框架集成一次做完。這一套之前沒人同時(shí)交付過。八、給做長上下文應(yīng)用的人三條結(jié)論優(yōu)先升級(jí)到 V2 兼容的 SGLang 后端如果你的服務(wù)長 prompt 多、Prefill 占比大升級(jí)后單 GPU 可承載的 QPS 大概率翻倍以上極端稀疏 均值校正是新的「甜點(diǎn)組合」比起單純追求稀疏率「稀疏 誤差校正」是 2026 下半年長上下文推理的標(biāo)配關(guān)注 FP8 塊稀疏的組合從 47.26× 的數(shù)字看FP8 數(shù)值范圍對(duì)稀疏更友好BF16 上拿 27× 已經(jīng)接近上限。arXiv2608.19758cs.CL2026-08-20HF 鏈接https://huggingface.co/papers/2608.19758