
Strata 是一個(gè)高性能推理引擎目標(biāo)是在單張消費(fèi)級(jí)顯卡≥12GB VRAM ≥32GB 系統(tǒng)內(nèi)存 SSD 的家用 PC 上運(yùn)行 1250 億參數(shù)的 MoE 模型Qwen3.8-Flash-Next達(dá)到 60–95 tokens/s 的生成速度一句話總結(jié)GPU 做每個(gè) token 都要做的密集部分 熱門專家CPU 與 GPU 并行算冷門專家專家全駐留 RAMSSD 只放 n-gram 表再用 MTP prompt lookup 投機(jī)解碼一次產(chǎn)出多個(gè) token——通過把整個(gè) PC 變成推理流水線把 125B 模型塞進(jìn)了 12GB 顯卡。核心思想三級(jí)分層卸載模型是 MoE 架構(gòu)48 層、共 24,576 個(gè)專家但每個(gè) token 只激活約 10 個(gè)專家——所以不需要把所有專家都放進(jìn)顯存Strata 把工作分?jǐn)偟饺齻€(gè)硬件層級(jí)GPUVRAM存放每個(gè) token 都需要的部分——attention 與 DeltaNet mixer、門控殘差權(quán)重、路由器router、共享專家、輸出頭、MTP 草稿層、KV cache長(zhǎng)上下文時(shí)部分從 RAM 流式讀取以及一個(gè)自適應(yīng)專家緩存剩余顯存全部用來(lái)裝最常用專家每多 1GB 顯存約多放 ~700 個(gè)專家 3系統(tǒng) RAMpin 住全部 24,576 個(gè)專家。當(dāng)路由選中了不在 GPU 緩存中的專家時(shí)CPU 用 AVX-512/AVX2 內(nèi)核就地計(jì)算與 GPU 并行互不等待。低內(nèi)存模式下可只保留 GPU 放不下的那部分專家SSD存放 28.8GB 的 n-gram 查找表每 token 只讀幾行走 OS 頁(yè)緩存同一套引擎既編譯為 NVIDIA CUDA 也可編譯為 AMD HIP專家放置與取回路徑ExpertCache維護(hù)(layer, expert)→ VRAM 槽位的駐留表并按每層配額分配槽位防止靠前的層壟斷顯存緩存未命中時(shí)走ExpertSource/FileExpertSourceRAM 駐留專家由PinnedArena管理可用大頁(yè)、可部分注冊(cè)給 CUDA 做 DMA非駐留的從 SSD 按區(qū)間加載resident_stage_swaps負(fù)責(zé) GPU 緩存與 RAM 之間的專家換入換出執(zhí)行流程重疊執(zhí)行與 CUDA Graphsession_token()串行調(diào)度 48 層的前向傳播由于殘差鏈嚴(yán)格串行CPU 專家計(jì)算通過解耦的 host 線程與 GPU 的非 MoE 塊attention 等重疊用 doorbell 異步協(xié)議隱藏 CPU 延遲SessionState預(yù)先分配 KV cache、GDN 循環(huán)狀態(tài)、激活緩沖和 PLE 狀態(tài)session_bytes/session_inittoken 路徑上零分配SessionGraphs為每層捕獲 CUDA graph消除 kernel launch 開銷每層 kernel 很小launch 開銷是主要瓶頸投機(jī)解碼先猜后驗(yàn)?zāi)P妥詭У腗TP 層每次最多起草 3 個(gè) token一次 48 層前向即可驗(yàn)證全部草稿平均每次接受 2.4–3.2 個(gè) token加速 1.6–1.8×Prompt lookup當(dāng)回復(fù)與上下文重復(fù)代碼編輯、引用文本時(shí)SuffixDrafter從前文中起草最多 5 個(gè) tokenDraftPolicy只在實(shí)測(cè)接受率和成本劃算時(shí)啟用代碼編輯快 6–11%其他場(chǎng)景不變關(guān)鍵性質(zhì)草稿只是猜測(cè)大模型驗(yàn)證決定每個(gè)詞輸出質(zhì)量完全不變。長(zhǎng)上下文預(yù)填充以最多 8,192 token 的大塊做 prefill吞吐超 1,000 tok/s下一層專家在 attention 運(yùn)行的同時(shí)經(jīng) PCIe 流式傳輸?shù)?GPU會(huì)話有緩存conversation cache后續(xù)消息只讀新增部分秒級(jí)開始