资讯详情

Strata 的工作原理

📅 2026/10/7 15:09:19 | 华诺云谱 👁 阅读
Strata 的工作原理
Strata 是一个高性能推理引擎目标是在单张消费级显卡≥12GB VRAM ≥32GB 系统内存 SSD 的家用 PC 上运行 1250 亿参数的 MoE 模型Qwen3.8-Flash-Next达到 60–95 tokens/s 的生成速度一句话总结GPU 做每个 token 都要做的密集部分 热门专家CPU 与 GPU 并行算冷门专家专家全驻留 RAMSSD 只放 n-gram 表再用 MTP prompt lookup 投机解码一次产出多个 token——通过把整个 PC 变成推理流水线把 125B 模型塞进了 12GB 显卡。核心思想三级分层卸载模型是 MoE 架构48 层、共 24,576 个专家但每个 token 只激活约 10 个专家——所以不需要把所有专家都放进显存Strata 把工作分摊到三个硬件层级GPUVRAM存放每个 token 都需要的部分——attention 与 DeltaNet mixer、门控残差权重、路由器router、共享专家、输出头、MTP 草稿层、KV cache长上下文时部分从 RAM 流式读取以及一个自适应专家缓存剩余显存全部用来装最常用专家每多 1GB 显存约多放 ~700 个专家 3系统 RAMpin 住全部 24,576 个专家。当路由选中了不在 GPU 缓存中的专家时CPU 用 AVX-512/AVX2 内核就地计算与 GPU 并行互不等待。低内存模式下可只保留 GPU 放不下的那部分专家SSD存放 28.8GB 的 n-gram 查找表每 token 只读几行走 OS 页缓存同一套引擎既编译为 NVIDIA CUDA 也可编译为 AMD HIP专家放置与取回路径ExpertCache维护(layer, expert)→ VRAM 槽位的驻留表并按每层配额分配槽位防止靠前的层垄断显存缓存未命中时走ExpertSource/FileExpertSourceRAM 驻留专家由PinnedArena管理可用大页、可部分注册给 CUDA 做 DMA非驻留的从 SSD 按区间加载resident_stage_swaps负责 GPU 缓存与 RAM 之间的专家换入换出执行流程重叠执行与 CUDA Graphsession_token()串行调度 48 层的前向传播由于残差链严格串行CPU 专家计算通过解耦的 host 线程与 GPU 的非 MoE 块attention 等重叠用 doorbell 异步协议隐藏 CPU 延迟SessionState预先分配 KV cache、GDN 循环状态、激活缓冲和 PLE 状态session_bytes/session_inittoken 路径上零分配SessionGraphs为每层捕获 CUDA graph消除 kernel launch 开销每层 kernel 很小launch 开销是主要瓶颈投机解码先猜后验模型自带的MTP 层每次最多起草 3 个 token一次 48 层前向即可验证全部草稿平均每次接受 2.4–3.2 个 token加速 1.6–1.8×Prompt lookup当回复与上下文重复代码编辑、引用文本时SuffixDrafter从前文中起草最多 5 个 tokenDraftPolicy只在实测接受率和成本划算时启用代码编辑快 6–11%其他场景不变关键性质草稿只是猜测大模型验证决定每个词输出质量完全不变。长上下文预填充以最多 8,192 token 的大块做 prefill吞吐超 1,000 tok/s下一层专家在 attention 运行的同时经 PCIe 流式传输到 GPU会话有缓存conversation cache后续消息只读新增部分秒级开始
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑