35B 单挑万亿:Intern-S2-Preview 与 Intern-S1-Pro 的差距还剩多少
35B 单挑万亿Intern-S2-Preview 与 Intern-S1-Pro 的差距还剩多少【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B2026 年 WAIC 上上海人工智能实验室以397B 参数追平万亿模型的表述发布了科学智能体新基座 Intern-S2围绕它的社区讨论很快被一个更尖锐的问题占据一个激活参数只有 35B 的模型凭什么敢去对标万亿级的 Intern-S1-Pro更值得追问的是——在数学、材料、物理这些硬核科学任务上35B 与万亿的差距究竟是被抹平了还是仅仅被藏了起来本文不打算停留在宣传口径上而是结合社区公开评测与仓库源码架构配置、权重索引、分词器、部署指南把这笔账算清楚。先厘清一个数字35B、397B 与万亿分别指什么围绕 Intern-S2 的讨论中35B和397B两个数字经常混用其实它们指代的是同一款模型的两套口径。打开仓库根目录的 config.json 可以看到架构类型为Qwen3_5MoeForConditionalGeneration即 MoE混合专家架构文本主干共 60 层hidden_size为 4096每层拥有512 个专家num_experts: 512但每次推理只激活其中10 个num_experts_per_tok: 10另有 1 个共享专家词表 251392原生最大上下文 262144256K。按照 512 专家 × 每专家约 1260 万参数1024 的中间维度 × 4096 的隐维度 × 3 个投影矩阵估算总参数落在 397B 量级而每次 token 只经过 10 个专家 共享专家 注意力实际激活参数约 35B。这正是社区文章反复强调350 亿参数的由来——它描述的不是模型体积而是单次推理的真实算力开销。仓库中的 model.safetensors.index.json 也从权重侧印证了规模全量权重约 806GBbfloat16被切分为 188 个分片。与之对比的 Intern-S1-Pro 则是社区口径中的万亿级模型。所以这场对决的准确表述是总参数 397B、激活参数 35B 的 Intern-S2-Preview去追赶总参数近万亿的 Intern-S1-Pro。参数差出两个数量级比的却是同一份科学任务榜单——这本身就是 MoE 时代稀疏激活叙事最有戏剧性的注脚。两代模型架构差异总览同源配方更极致的分工从架构配置看Intern-S2-Preview 不是另起炉灶而是在 Intern-S1 的技术路线上做了三处关键升级每一处都能在仓库配置里找到实锤。第一处注意力机制的分层混合。config.json 的layer_types字段揭示了 60 层网络的真实排布以 4 层为一组前 3 层是linear_attention线性注意力第 4 层是full_attention全注意力如此循环。全注意力层负责全局信息的精确检索线性注意力层负责长序列的高效压缩两者以 3:1 的比例交错配合full_attention_interval: 4的设定让模型在 256K 长上下文下依然可控算力。第二处MTP 多 token 预测头。mtp_num_hidden_layers: 1表明模型内置了单层 MTPMulti-Token Prediction模块权重索引中也确实存在mtp.*的完整参数组。MTP 让模型在解码阶段一次预测多个 token再由部署框架做推测解码校验。deployment_guide.md 中 LMDeploy 的启动参数--speculative-algorithm qwen3_5_mtp --speculative-num-draft-tokens 4以及 SGLang 的NEXTN配置都是为这个预测头服务的。第三处科学模态的原生分词。这是与 Intern-S1 最显著的能力分野。tokenizer_config.json 中可以看到三类专用子词表SMILES分子结构式offset 248102、PROT蛋白质序列offset 249126、XNA核酸序列offset 250150配合 tokenization_interns1.py 中的自动检测逻辑SMILES_AUTO_DETECT/PROT_AUTO_DETECT/XNA_AUTO_DETECT模型无需提示即可识别并正确编码分子式、蛋白序列和 DNA/RNA 串。此外还有TS_CONTEXT/TS_GEN时间序列标记与tool_call工具调用标记构成完整的科学智能体 token 生态。两代模型的差异可以总结为下表维度Intern-S2-PreviewIntern-S1-Pro社区口径总参数量397BMoE约万亿级激活参数约 35B显著更大专家配置512 专家 / 激活 10大规模 MoE注意力线性注意力 全注意力 3:1 混合以全注意力为主原生上下文256KYaRN 可扩至 512K长上下文科学模态SMILES / PROT / XNA / 时间序列原生分词依赖文本表示MTP 预测头内置1 层视版本而定其中科学模态原生分词是 35B 敢于叫板万亿最硬的底气它把分子式、蛋白质序列这类科学任务的语法直接焊进了词表而不是让模型在通用 token 上重新摸索。数学、材料、物理三域逐项对比领先在哪里社区公开评测与实测文章提供了三域对比的清晰证据且与仓库能力设计一一对应。数学用更少的 token 拿更高的分。社区评测普遍反映Intern-S2-Preview 在复杂数学基准上展现出突出的推理效率——即同样一道题它以更短的思维链和更少的输出 token 完成解答。这要归功于训练阶段对 CoT 的压缩式 RL 强化社区情报所称MTP 与 CoT 压缩的高效 RL 推理。在 README.md 的思考/非思考模式切换示例中模型通过enable_thinking参数动态开关推理链也印证了其在想得深与说得短之间的工程化平衡。材料首次在开源通用模型里生成晶体结构。这是三域对比中差距被拉开得最明显的一项。社区情报显示Intern-S2-Preview 在 MolecularIQ 评测中拿到 57.26 分超过 Gemini-3.1-Pro在晶体结构生成任务上结构通过率超过 40%显著优于 GPT-5.5并且是首个在开源通用大模型中实现材料晶体结构生成、支持高精度坐标回归的模型。SMILES 分词器与工具调用协议在这里直接兑现了价值——模型不仅能读懂分子式还能以坐标形式生成新材料这正是材料科学智能体的核心场景。物理原生时间序列建模把物理感知内置化。物理任务的对比重点不在参数而在模态。README.md 的 Time Series Demo 展示了两个典型用例从地震波形信号中判定事件并定位 P 波/S 波起振时刻基于历史电力负荷与气象数据预测未来 48 个时点的负荷曲线。|ts|标记、encode_time_series_base64编码接口以及enable_forecasting请求参数构成了从数据编码到数值预测的完整链路。社区实测进一步确认这类任务上35B 模型的表现已能与万亿级模型互有胜负尤其在信号理解 数值输出这类对模态对齐要求极高的场景。上图来自 README.md 的官方性能对比评估工具为 OpenCompass / VLMEvalKit / AgentCompass下划线代表开源模型最佳加粗代表全体模型最佳。可以看到科学类基准材料、生物、科学编程是 S2 拉开身位的重点区域这正是任务 Scaling的直接收益模型在超过 20 个科学领域的 RL 任务上联合训练把有限参数的每一点容量都花在了刀刃上。35B 逼近万亿的边界在哪什么任务仍吃力领先是局部的差距也是局部的。把三域的胜利拆开看能清晰看到 35B 模型的能力边界与成本边界。推理效率红利是真实的。社区在 8×H200 SGLang 环境下的实测显示开启 MTP 后输出长度 16000 token 时吞吐提升可达 97.52%延迟降低约 61%且 Accept Length推测接受长度随输出增长而提高。这意味着同样的算力预算下35B 激活模型能服务的科学 Agent 会话数是万亿级模型难以企及的——效率本身就是科学场景下的一种能力尤其是面对长文档、长时序、多轮工具调用这类高频长输出任务。但 35B 的知识容量是硬上限。激活参数少意味着模型在单次前向中能携带的记忆少。社区评测与官方表述都保留了一致的分寸Intern-S2-397B 的定位是在显著提升科学推理与智能体能力的同时保持通用能力——注意是保持而非全面超越。这意味着开放域长尾知识类任务仍会是万亿模型的优势场。稀有化合物常识、跨语种低资源语料、需要背下来而非推出来的事实性问答靠的是参数里的存量而这恰恰是 35B 激活的短板多模态长上下文的高强度推理仍昂贵。虽然原生 256K 上下文是亮点但 deployment_guide.md 明确要求 8×H100/H200 节点起步全量权重 806GB、512k 长上下文需配合 YaRN RoPE 配置factor: 4.0——部署门槛不低个人研究者复现成本仍然可观智能体任务的稳定性依赖外围工程。官方在 README.md 中特意提示不建议在智能体任务中关闭思考模式且工具调用需匹配--tool-call-parser interns2-preview等框架参数——这说明 Agent 场景下模型的强项必须依赖推理框架与提示协议的配合才能兑现脱离工程环境裸跑35B 与万亿的差距会被重新放大。结论参数差距没有被抹平但赛道被重新定义了把账算完问题的答案比宣传口径更冷静35B 没有追平万亿它只是把竞争从谁的参数多搬到了谁的 token 用得聪明。在数学推理效率、材料结构生成、物理时序建模这些科学任务上任务 Scaling RL 原生科学模态的组合让 397B 总参数35B 激活的模型打出了远超参数比例的战斗力而在开放域知识密度、事实性长尾问答这类靠容量吃饭的任务上万亿级模型的身位依然稳固。对研究者而言这场对比最大的启示不是小模型打败大模型而是 MoE 稀疏激活 科学任务定向 Scaling 提供了一条可复制的路径把参数花在模态上SMILES/PROT/XNA/时序、把效率押在架构上线性注意力 MTP、把能力锁定在任务上多域 RL 联合训练。35B 与万亿的差距还剩多少答案写在 config.json 的每一行配置里也写在 deployment_guide.md 的每一段启动参数里——它已经不再是差 28 倍参数这么简单而是差一个科学的赛道定义。【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考