☰
两天两篇深度拆解抢跑 CSDN:Yandex 新模型的技术密码被谁先拆开了
2026/10/10 14:03:37 网站建设 项目流程

两天两篇深度拆解抢跑 CSDN:Yandex 新模型的技术密码被谁先拆开了

【免费下载链接】AliceAI-Foundation-80B-A3B-Base项目地址: https://ai.gitcode.com/hf_mirrors/yandex/AliceAI-Foundation-80B-A3B-Base

当 Yandex 把 AliceAI-Foundation-80B-A3B-Base 的权重与 49 个 safetensors 分片一起丢进开源生态时,大多数人的第一反应是"又一个 80B MoE"。但真正让中文技术社区兴奋起来的,不是参数总量,而是藏在config.json与modeling_alice_ai.py里的三组数字:512 个专家、每 token 只激活 3B 参数、262144 的上下文窗口。更值得注意的是,在官方文档还没来得及被广泛翻译之前,CSDN 上已经在两天内密集出现了两篇万字级深度拆解,加上此前的超参数手册、投机解码实战与路由机制分析,几乎把这张"技术密码图"拆了个底朝天。

本文不打算复述那几篇文章,而是沿着社区拆解留下的线索,回到仓库源码里逐一验证:KDA 混合注意力到底改了 Transformer 的哪一部分?512 专家凭什么只激活 3B?中文社区又为什么对这一套组合拳如此饥渴?

一场提前到场的拆解接力

先盘点社区情报里的事实。在 9 月底的两天里,CSDN 上先后出现了两篇署名"语言模型"的深度长文:一篇聚焦 KDA 混合注意力、512 专家 MoE 架构与 Transformers/vLLM 双路径部署,另一篇则把重心放在架构全景、基准评测与 FSDP2 LoRA 微调实战上。两篇文章 ID 相邻、发布时间几乎同步,显然是一次有准备的系列输出。

但这并不是中文社区第一次盯上这个模型。更早之前,同一个模型已经催生过三篇高收藏量的"手册式"内容:

  • 一篇逐键拆解config.json中 50 余个超参数,覆盖混合主干结构、MoE 路由、长上下文与初始化策略,收获 902 次阅读、25 次收藏;
  • 一篇专门讲内置 MTP(多 Token 预测)模块的 vLLM 投机解码实战,给出 1.2–1.8 倍的实测加速区间,阅读 933 次、收藏 20 次;
  • 一篇深入 Sigmoid TopK 路由与专家偏差校正机制,分析了这套"免辅助损失"的负载均衡方案。

把这些文章放到一起看,社区关注的焦点高度收敛:KDA 线性注意力、512 专家 MoE、MTP 投机解码、262K 长上下文。而这四点,恰好是仓库源码里最能体现架构决策差异性的地方。

KDA 与 Gated Attention:每 4 层只留 1 层全注意力

先看最容易被忽略、却最能说明架构取向的文件——config.json。其中layer_types是一个长度为 48 的数组,模式非常规整:每 4 层一组,前 3 层是linear_attention,第 4 层是full_attention,重复 12 组。也就是说,48 层 Transformer 里只有 12 层是全注意力,其余 36 层全部由线性注意力承担。README 将其概括为12 × (3 × (KDA → MoE) → 1 × (Gated Attention → MoE))。

全注意力层在源码中对应 modeling_alice_ai.py 的AliceAIAttention(第 151 行起),它有一个非常"Yandex 风格"的设计:q_proj的输出维度是2 * num_heads * head_dim,前向时把投影结果从中间劈开,一半做 query,一半做输出门控,门控值经 sigmoid 与注意力输出逐元素相乘。加上 QK 两侧的 RMSNorm 与partial_rotary_factor = 0.25的稀疏 RoPE,这层"Gated Attention"在保持标准注意力精度的同时,把每层 4 分之一的开销留给了关键位置编码信息。

而占比四分之三的 KDA 层,才是真正的创新点。AliceAIKDA(第 275 行起)是一个完整的线性注意力实现:query/key/value 各自先经过 kernel_size=4 的因果卷积(_causal_conv,配合缓存按 state 增量更新),再进入 delta 规则的状态更新循环——state = state * exp(gate) + delta,其中gate由a_log_bias与dt_bias计算,delta则由预测残差乘上经过 sigmoid 的beta得到。在 GPU 上它会优先调用flash-linear-attention提供的chunk_kda/fused_recurrent_kda内核,也就是说,KDA 不是论文里的概念,而是有工程内核、能直接跑 262K 上下文的可部署实现。

值得注意的细节在配置校验里:kda_allow_negative_eigenvalues = false,意味着beta被限制在(0, 1)区间,保证状态更新的收缩性;同时linear_conv_kernel_dim被校验为至少 2。这些约束在 configuration_alice_ai.py 的_validate_fields中一一落地,也是社区那篇"超参数手册"能写出 50 多个键的原因——这套模型的每个配置项几乎都有配套的校验与语义。

512 专家、Sigmoid 打分、偏差校正:MoE 的免辅助损失方案

另一个被反复拆解的点是num_experts: 512与num_experts_per_tok: 10。80B 总参数、每 token 激活 3B,靠的就是这个 512 选 10(再加 1 个共享专家)的路由结构。

源码中的AliceAISigmoidTopKRouter(第 530 行起)把社区文章的要点完整呈现出来:router 对 512 个专家分别做线性投影后用sigmoid 独立打分(而非 softmax),再取 top-10 索引,最后对选中专家的分数做归一化作为加权权重。社区文章特别点出的"专家偏差校正",在代码里是一个名为e_score_correction_bias的可学习 buffer:它不参与反向传播的辅助损失计算,而是直接加在 sigmoid 分数上再取 topk,从而动态调节各专家的被选频率。

AliceAISparseMoEBlock(第 558 行起)在此基础上叠加了一个共享专家:所有 token 都经过这个小型 MLP,输出再乘上独立的 sigmoid 门控,与路由结果相加。这样"10 个稀疏专家 + 1 个共享专家"的组合,既保证了专家分工,又让通用能力不至于被稀疏路由完全稀释。社区把这一套称为"免辅助损失、高扩展性的工业级路由方案",从代码看,这个判断是站得住的——路由平衡完全靠可学习的 bias 校正,不需要在训练损失里挂额外的负载均衡项。

对中文社区的开发者而言,这套 MoE 还带来了一个实际收益:LoRA 微调时,finetune/finetune_lora.py 只需把q_proj、k_proj、v_proj、o_proj设为目标模块,同时用remove_router_buffers/restore_router_buffers把e_score_correction_bias这类 buffer 在 FSDP2 分片流程中单独搬运,就能在 4 张 80GB GPU 上完成适配——这也是"两天两篇"文章里 FSDP2 微调教程能落地的底层原因。

拆解热的本质:中文社区对新基座的技术饥渴

如果把这场拆解接力放到更大的背景里看,它折射的是中文社区对"可复现的新架构"的长期饥渴。AliceAI-Foundation-80B-A3B-Base 是完全从零训练的模型,Yandex 在 README 里明确交代:训练语料是重新构建的,关键架构与超参数决策经过了多轮"每轮 2 万亿 token"的消融验证。对社区来说,"从零训练 + 开源权重 + 自定义架构"意味着每一个技术判断都可以被反向验证,而不是只能对着推理 API 猜。

验证的结果也确实有信息量。仓库 README 的基准表显示,这款模型在俄语事实知识上显著领先:WikiWebFacts 86.5(对比 Qwen3.5-35B-A3B-Base 的 62.4)、HardMultiQA 67.9(对比 47.2)、CultCat 86.5(对比 59.2);在数学与推理上同样强势,MATH-500 达到 91.1,AIME 2026 pass@32 达到 96.7,与更大的 DeepSeek-V4-Flash-Base(284B-A13B)在多个维度打平甚至反超。README 中的这张对比图直观呈现了这一点:

但"强"不是社区抢着拆解的全部理由。更现实的原因是:这套模型把部署与微调的坑埋得又深又多。KDA 层需要flash-linear-attention>=0.5.0才能上 GPU;Transformers 参考版本精确到 5.16.1;tokenizer 以LlamaTokenizer加载 SentencePiece BPE,且tokenizer_config.json明确要求legacy=false不许覆盖;MTP 头虽然已并入权重(源码里_keys_to_ignore_on_load_unexpected特意忽略mtp.前缀),但要在 vLLM 里真正白嫖加速,还得照 README 的 Docker 命令配上--speculative-config '{"method":"mtp","num_speculative_tokens":1}'。每一个"手册式"知识点背后,都是一个真实的踩坑现场。

这也是那篇 MTP 实战文章能拿到 933 次阅读的原因——MTP 是 DeepSeek-V3/R1 带火的技术,但大多数开源模型只是"提到支持",而这里是真的把 MTP 头训练进了权重、一次前向可以多推 1 个 token,且不需要额外的草稿模型。对中文开发者来说,"零成本投机解码加速"是可立即复现的收益,这比任何架构口号都更有传播力。

所以,与其问"技术密码被谁先拆开了",不如问"为什么大家抢着拆"。答案写在仓库的每一个角落:从零训练的基座、KDA 与 Gated Attention 的混合节奏、512 专家的免辅助损失路由、训练时融合的 MTP 头、以及把这一切约束成可部署系统的配置文件校验——这是一份密度极高的技术资产,而中文社区用两天两篇深度拆解证明了自己对这类"非主流但扎实"的新基座,始终保持着最高浓度的好奇心与行动力。

【免费下载链接】AliceAI-Foundation-80B-A3B-Base项目地址: https://ai.gitcode.com/hf_mirrors/yandex/AliceAI-Foundation-80B-A3B-Base

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询