今日 AI 产业出现一组相互印证的信号:阶跃星辰发布 600B 参数的 Step 5 Preview、xAI 的 Grok 4.6 上线 Amazon Bedrock、阿里巴巴发布 7B 的 Qwen-Image-2.1,同日还有 RBS-Attention 提出 20.65 倍的预填充加速方法、AWS 开源 Strands Harness 智能体框架。长上下文、多模态与推理成本的优化在同一天集中落地,说明模型竞赛的焦点正从"谁能做"转向"谁做得起"。对技术从业者而言,这些进展直接关系到推理服务的选型、成本结构与部署方案。
技术主题 1:长上下文旗舰同日发布,MoE 架构与投机解码成为标配
阶跃星辰发布面向智能体工作的新旗舰 Step 5 Preview,目标负载为软件工程、专业知识工作与金融领域,为总参数约 600B、每词元激活约 27B 的稀疏混合专家(MoE)模型,上下文窗口达 100 万词元,主要卖点是成本——团队称模型以显著更低的任务成本提供可比的智能水平[① MarkTechPost]。官方模型文档列出的规格包括:模型 ID 为 step-5-preview,输入支持文本、图像与视频,输出为文本,推理强度可选低、中、高,并支持流式输出、工具调用、JSON 模式、JSON Schema 与提示缓存[① MarkTechPost]。架构上采用"窄而深"布局,堆叠 92 层 Transformer,研究团队认为更深堆叠为隐式多跳推理提供更长路径,这在智能体搜索、执行代码与读取工具返回的长预填充阶段尤为重要[① MarkTechPost]。
技术栈上,Step 5 Preview 采用 MTP-3 投机解码、FP8 MoE 与 KV 缓存卸载,训练依赖在线策略与长时程强化学习,团队报告长时程强化学习端到端加速超过 3 倍[① MarkTechPost]。xAI 的 Grok 4.6 已在 Amazon Bedrock 中可用,提供 50 万词元的上下文窗口,支持低、中、高与超高四档可配置推理强度,定位长时运行智能体、编码与知识工作[② AWS ML Blog]。两家的共同点是:把"长上下文"与"推理成本可控"绑定设计,而非单纯堆窗口长度。对自建推理服务的团队而言,MoE 激活参数占比、投机解码深度与 KV 缓存策略,正在成为评估长上下文模型可负担性的关键指标。
对这类 MoE 长上下文模型的推理配置,可作如下示意理解:
# 以下为根据公开摘要信息对[MoE长上下文模型推理配置]的理解示意 # 具体实现请查阅StepFun官方技术文档 class MoEInferenceConfig: total_params = "600B" # 总参数规模 active_per_token = "27B" # 每词元激活参数(约4.5%) context_window = "1M" # 100万词元上下文 reasoning_levels = ["low", "medium", "high"] # 推理强度档位 speculative_decoding = "MTP-3" # 3步投机解码加速生成 fp8_moe = True # FP8混合精度训练与推理对齐 kv_cache_offload = True # KV缓存卸载以支撑长上下文⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意,具体实现请以官方文档为准。
技术主题 2:Qwen-Image-2.1:7B 统一图像生成与编辑,混合粒度注意力提速
阿里巴巴 Qwen 团队发布 Qwen-Image-2.1,一个统一的文生图生成与图像编辑模型,视觉生成部分为 7B 参数、32 层单流 DiT 结构,单一检查点即覆盖文生图、多参考编辑、局部编辑与透明 RGBA 输出[① MarkTechPost]。7B 仅指扩散 Transformer,流水线还会加载 8B 的 Qwen3-VL 编码器;从最初的 20B 模型到 7B,Qwen-Image-2.1 把生成与编辑两项能力合并到一个约为原来三分之一大小的模型中,团队称其为系列中最均衡、最具成本效益的模型[① MarkTechPost]。
其速度主要来自注意力掩码设计:文本词元使用词元级因果掩码,图像词元在每张图像内使用块级双向掩码,Qwen 称之为混合粒度注意力;条件前缀位于噪声潜变量之前因而从不关注后者,其键与值在去噪步骤间保持固定,模型只在第一步计算文本与输入图像,并在其余每一步复用该前缀 KV 缓存,节省量随参考图像数量增加而增大,这解释了多图速度主张[① MarkTechPost]。架构方面,GitHub 仓库列出 4 个组件:32 层 7B 单流 Transformer、Qwen3-VL 8B 文本编码器、64 通道 RGBA 自编码器(16 倍空间压缩与原生透明度)、Flow Matching 调度器[① MarkTechPost]。
多参考编辑流程可示意如下:
# 以下为根据公开摘要信息对[Qwen-Image-2.1多参考编辑]流程的理解示意 # 具体实现请查阅Qwen官方技术文档 # 混合粒度注意力:文本词元词元级因果掩码 + 图像词元块级双向掩码 # 条件前缀KV在去噪步骤间固定复用 → 多图场景显著提速 def multi_ref_edit(prompt, ref_images): cond_prefix = encode_text_and_images(prompt, ref_images) # 仅第一步计算 z = sample_noise() for step in denoise_steps: z = transformer_block(z, cond_prefix) # 复用前缀KV缓存 return decode_rgba(z) # 原生透明度输出⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意,具体实现请以官方文档为准。
技术主题 3:RBS-Attention:免训练稀疏预填充,20.65 倍加速背后的双分支设计
长上下文大语言模型推理日益受限于预填充阶段,因为生成开始前稠密自注意力需要处理整个提示。arXiv 新论文提出免训练的稀疏预填充方法 RBS-Attention,针对块质心把相关词元埋在无关词元之中、作者称为"均值稀释"的失效模式[③ arXiv cs.AI]。该方法包含两个互补的选择分支:质心基分支捕捉平均相关性,救援分支利用最大键块半径及其随提示、层与注意力头变化的分布,识别存在被低估风险的块;对两个分支独立设阈并合并掩码,可控制救援块的贡献,同时保留常规的块稀疏 FlashAttention 执行[③ arXiv cs.AI]。
实测数据方面,在 H100 GPU 上,RBS-Attention 在 Qwen3-30B-A3B-Instruct-2507-FP8 模型的 128K 长度下实现 20.65 倍单机预填充注意力加速、11.92 倍 vLLM 预填充注意力加速与 5.97 倍端到端首词元时间加速;在稠密 Qwen3-32B 模型上取得 88.65 的 RULER 总体准确率,而稠密注意力为 89.52[③ arXiv cs.AI]。配套实验测量了实际保留率、在匹配密度下比较选择器,并刻画了块大小、阈值与内存行为。对工程团队而言,这类免训练方法与既有 FlashAttention 执行路径兼容,是低改造成本接入长上下文推理的可行方向。
双分支掩码合并逻辑可示意如下:
# 以下为根据公开摘要信息对[RBS-Attention双分支选择]的理解示意 # 具体实现请查阅arXiv论文 2609.20971 def rbs_prefill_mask(query_blocks, key_blocks, radius): # 质心基分支:捕捉平均相关性(按块质心相似度设阈) centroid_mask = threshold_by_centroid_similarity(query_blocks, key_blocks) # 救援分支:利用最大键块半径识别被低估风险的块 rescue_mask = threshold_by_key_block_radius(key_blocks, radius) # 两分支独立设阈后合并掩码,保留块稀疏FlashAttention执行 return merge_masks(centroid_mask, rescue_mask)⚠️ 以上伪代码为根据公开信息对该技术逻辑的初步理解示意,具体实现请以官方文档为准。
技术主题 4:开源智能体框架与多设备推理:工程侧的降本路径
AWS 的 Strands Agents 团队发布 Strands Harness,一个完整组装、通用型的开源智能体框架,可在本地运行或部署到云厂商,以 Apache 2.0 许可证提供 Python 与 TypeScript 版本,一行代码即可启动[① MarkTechPost]。团队报告称,在 6 个基准上运行相同的 Claude 或 GPT 模型时,其成本比其他框架低 28%、精度基本相当[① MarkTechPost]。其开箱即用的 create_harness() 返回的智能体可以:通过 Amazon Bedrock、Anthropic、OpenAI、Google、Ollama 或 LiteLLM 运行;自带 shell、文件(读、写、编辑)与网页工具;把体积庞大的工具结果卸载到文件并缓存重复使用部分;跨运行保持长期记忆并依据会话 ID 恢复对话;将开放式子任务委派给内置辅助智能体;发现 Agent Skills 时自动加载[① MarkTechPost]。
NVIDIA 侧则推出 TensorRT 多设备推理:单个 TensorRT 网络可在 NCCL 支持的分布式集合通信上跨多张 GPU 执行,同时保留 TensorRT 的推理优化,自 TensorRT 11.0 起全面支持[④ NVIDIA Blog]。生成式 AI 的计算与内存需求日益超出单张 GPU 所能提供的范围,多设备集成让单个模型的推理跨越 GPU 边界,面向多 GPU 服务场景提供了新的部署选项[④ NVIDIA Blog]。对工程团队而言,Strands Harness 解决"智能体框架选型与成本"、TensorRT 多设备解决"单模型跨 GPU 扩展",两条路径分别从软件层与硬件层压缩智能体运行与模型服务的成本。结合二者,一个典型的多 GPU 长上下文服务栈可以同时利用稀疏预填充降低首词元延迟、利用 KV 缓存卸载缓解显存压力、利用跨设备集合通信突破单卡容量——这些优化叠加起来,正是"长上下文进入可负担区间"的工程基础[③ arXiv cs.AI][④ NVIDIA Blog]。
技术主题 5:智能体评估与 DAPO:从工具调用到任务完成的可量化进展
NVIDIA 提出智能体评估视角:当你上线一个 AI 智能体时,关键在于它能否在真实环境中跨几十个顺序工具调用执行一整链工作,并在某一步失败时恢复;仅仅对模型听起来对不对打分,几乎无法说明工作是否真正完成,正是这一差距促使智能体评估从对单个函数调用打分,演进为对整个任务打分[④ NVIDIA Blog]。这一评估框架对智能体工程有直接参考价值——衡量标准应从"模型输出质量"迁移到"端到端任务完成率与失败恢复能力"。
开源侧,DAPO 发布:一个用于大规模大语言模型强化学习的系统,基于 Qwen2.5-32B 基础模型,在 AIME 2024 上取得 50 分,完全开源,包括算法细节、数据集与基础设施[⑤ TLDR AI]。这类可复现的强化学习基础设施,为开发者提供了训练与评估智能体的开源参考实现。
趋势判断
趋势一:长上下文与推理成本绑定设计,成为旗舰模型共同主线。Step 5 Preview 以 600B 总参数、27B 激活、100 万上下文主打成本[① MarkTechPost];Grok 4.6 以 50 万上下文加四档推理强度适配长时运行智能体[② AWS ML Blog];RBS-Attention 则从预填充侧把长上下文成本墙下压 20.65 倍[③ arXiv cs.AI]。三个样本从模型设计、平台接入与算法优化三个层面,共同指向"把长上下文做进可负担成本区间"这一主线。
趋势二:多模态模型走向"更小、更统一、更省"。Qwen-Image-2.1 把生成与编辑合并进 7B 单流 DiT,较 20B 前代压缩约三分之二[① MarkTechPost];混合粒度注意力与条件前缀 KV 复用直接降低多图场景开销[① MarkTechPost]。多模态推理的硬件门槛正在随参数压缩与注意力优化同步下移。
趋势三:智能体工程从"能做"转向"可评估、可降本"。Strands Harness 以 28% 更低 token 成本提供可比精度[① MarkTechPost];NVIDIA 把智能体评估标准从函数调用升级到整个任务完成[④ NVIDIA Blog];DAPO 提供开源强化学习基础设施[⑤ TLDR AI]。智能体开发正进入以可度量、可复现为特征的工程化阶段。对团队而言,这意味着选型标准同步变化:除了模型能力本身,框架的 token 成本、工具链的失败恢复能力、评估基准的覆盖度,都将成为部署决策的核心变量。
结尾
今日的技术主线清晰:长上下文旗舰同日登场、7B 图像模型统一生成与编辑、20.65 倍预填充加速、开源智能体框架与多设备推理同步落地。对开发者而言,短期最值得跟进的是 Qwen-Image-2.1 的 Day 0 生态接入(Diffusers、ComfyUI、vLLM-Omni、SGLang 与 LightX2V)与 Strands Harness 的一行启动体验;中期则需要关注 MoE 激活参数占比、投机解码与 KV 缓存策略对推理成本的影响,以及智能体评估框架从单函数到全任务的迁移。在"长上下文×低成本"的主线下,谁能把能力做进可负担的成本区间,谁就更有可能赢得下一轮部署。
【资讯来源】本文综合整理自以下公开信息源。 ① MarkTechPost, 2026年09月21日 14:37 北京时间 / 09月20日 23:37 美西时间 ,② AWS ML Blog, 2026年09月22日 02:30 北京时间 / 09月21日 11:30 美西时间 ,③ arXiv cs.AI, 2026年09月22日 12:00 北京时间 / 09月21日 21:00 美西时间 ,④ NVIDIA Blog, 2026年09月22日 05:51 北京时间 / 09月21日 14:51 美西时间 ,⑤ TLDR AI, 2026年09月21日 21:56 北京时间 / 2026年09月21日 06:56 美西时间
【免责声明】 本日报为AI行业每日公开信息汇总整理,仅供读者快速了解行业动态,不构成任何投资建议。所有信息均来源于公开渠道,本账号不对其准确性、完整性和时效性作出任何保证。AI行业技术与政策变化迅速,内容发布后可能发生更新,请以官方最新信息为准。据此作出的任何决策,全部风险自担。
© 2026 林伽一 · AI科技日报
#长上下文 #MoE #Qwen-Image-2.1 #RBS-Attention #智能体框架