本周 AI 快讯 | 1 分钟速览
01DeepSeek V4-Flash 正式版上线,9 项 Agent 基准全面超越自家旗舰 V4-Pro:Terminal-Bench 2.1 得分 82.7,DSBench-FullStack 从 37 跃升到 68.7;Artificial Analysis 智能指数 50 分,几乎追平GPT-5.6 Luna的 51,单任务成本低约 60%;定价不变,输入 1 元、输出 2 元(百万 token)。
02Kimi K3 如期开源权重,Arena 前端代码盲测一度登顶后被 Opus 5 反超:7 月 27 日在 Hugging Face 放出完整权重,2.8 万亿参数,MXFP4 量化约 1.4TB;开源时以 1679 分登顶 Arena 前端代码盲测,随后被Claude Opus 5反超,目前 1676 分排名第二;Artificial Analysis 综合指数 57.1,仍落后两家头部模型。
03MiniMax H3 全模态视频模型发布,8 月 3 日开源:支持文本、图像、视频、音频多模态输入,输出原生双声道音视频,最高 15 秒 2K 分辨率;成本不到主流竞品的三分之一;权重将以 MiniMax Community License 开放。
04字节发布 Seedance 2.5 视频模型,单次可生成 30 秒:支持最多 50 个全模态参考素材输入,已上线即梦 AI 和豆包专业版,API 近期接入火山方舟;上一代 Seedance 2.0 已支持原生 4K。
051324 名 AI 从业者联名要求设立国际减速机制:签署者来自 OpenAI、Anthropic、Google DeepMind、Meta AI;发布数小时内 OpenAI 和 Anthropic 以公司名义背书;核心是建立预备减速能力,并未要求暂停研发。
06OpenAI 将 GPT-5.6 Luna 降价 80%,Sol 用自己写的代码降本 20%:GPT-5.6 Luna每百万 token 输入从约 7.2 元降到约 1.4 元、输出从约 43.2 元降到约 8.6 元;GPT-5.6 Terra降约 20%;同周GPT-5.6 Sol改写了自己推理引擎的内核代码,端到端服务成本最多降 20%。
07ChatGPT 周活即将破 10 亿,比预期晚 7 个月:当前约 9 亿周活用户,外部有 Gemini 和 Claude 分流,内部GPT-5上线后体验不佳拖慢增速;同周 OpenAI 启动学术研究者计划,先开放 1 万名,2027 年前扩至 10 万名,承诺投入超 18 亿元。
08OpenAI 开源 Codex Security 安全扫描工具,同日发布两款转录模型:Codex Security CLI 和 SDK 以 Apache 2.0 开源,支持扫描代码库、验证漏洞、接入 CI/CD,1500 Star;GPT-Live-Transcribe主打实时低延迟,GPT-Transcribe主打异步批量,错误率比Whisper降低一半以上。
09Anthropic 披露 Claude 模型在评估中攻破三家公司,源于第三方环境配置失误:涉及Claude Opus 4.7、Claude Mythos和一个未命名模型;测试环境本应隔离,但第三方合作伙伴配置失误让模型获得了真实网络访问权限,模型利用弱密码入侵了三家组织。
10谷歌 Gemini Spark 接入 Chrome 代用户上网,同周发布 Lyria 3.5 音乐模型:Gemini Spark 新增 Chrome 自动浏览能力,可代用户预约看房和检索航班,付款等敏感操作交回用户确认;率先在海外推出,同步扩展到 160 多个国家;Lyria 3.5可生成最长 3 分钟带人声曲目。
11MCP 发布以来最大更新,从有状态转向无状态核心:2026-07-28 规范正式发布,取消初始化握手,每个请求自带协议版本和能力声明;服务器可部署在无服务器和边缘环境;月度 SDK 下载超 4 亿次,今年增长 4 倍。
12SpaceXAI 发布 Grok Voice Think Fast 2.0 语音模型:Artificial Analysis 语音基准从 75.7% 升到 82.9%,响应延迟从 1.25 秒降到 0.70 秒,支持 25 种以上语言,每分钟约 0.58 元。
01|DeepSeek「V4-Flash」正式版 9 项 Agent 基准全面超越自家旗舰,同周启动内蒙古 1GW 数据中心
7 月 31 日 DeepSeek 通过 API 文档发布日志宣布V4-Flash-0731正式版公测,同架构重新训练,API 调用方式不变。正式版在 9 项 Agent 和编码基准上全面超越了自家旗舰V4-Pro-Preview。Terminal-Bench 2.1 得分 82.7,DSBench-FullStack 从预览版的 37 跃升到 68.7,接近翻倍。Artificial Analysis 综合智能指数拿到 50 分,几乎追平降价后GPT-5.6 Luna的 51 分,但单任务成本低了约 60%。定价不变,输入 1 元、输出 2 元(百万 token),缓存命中只要 0.02 元。
据报道 DeepSeek 计划在内蒙古乌兰察布建设大型 AI 数据中心,总容量 1GW。乌兰察布年均气温仅 4°C,冷却成本远低于一线城市,部分算力预计 2027 年底或 2028 年初投入使用。芯片方案尚未敲定,英伟达和华为产品均在考虑范围内。
02|「Kimi K3」如期开源权重,Arena 一度登顶后被「Claude Opus 5」反超
7 月 27 日,月之暗面如期在 Hugging Face 开源Kimi K3完整权重。2.8 万亿参数的稀疏 MoE,每个 token 从 896 个专家中激活约 16 个(约 500 亿激活参数),上下文 100 万 token,MXFP4 量化后体积约 1.4TB。上线 30 分钟内收获 4000 多个赞,刷新了 Hugging Face 增长纪录。采用Kimi K3License,年收入超过 2000 万美元的 AI 托管服务商需要单独获取商业授权。
Kimi K3开源时 Arena 前端代码盲测以 1679 分一度登顶,超过Claude Fable 5和GPT-5.6 Sol。但上期报道的Claude Opus 5随后以 1703 分反超,Kimi K3目前 1676 分排名第二。Artificial Analysis 综合智能指数为 57.1,同样落后Claude Fable 5(59.9)和GPT-5.6 Sol(58.9)。开源前,月之暗面团队在北京一家酒吧举行了庆功活动,现场流出的标语写着「K3 扩容升级!」「K4 给我狠狠干到极致!」「冲上月球!」。
03|「MiniMax H3」全模态视频模型发布,8 月 3 日开放权重
MiniMax H3打通了文本、图像、视频和音频四条通道。7 月 31 日 MiniMax 发布的这款新模型支持任意组合的多模态输入,输出带原生双声道音频的视频,最高 15 秒 2K 分辨率。用户可以提供参考视频、图片或音频素材,配合文字指令完成音视频创作。成本不到主流竞品的三分之一。
模型权重将在 8 月 3 日以 MiniMax Community License 开放,非商用免费,年收入低于 2000 万美元的公司商用也免费但需要署名。与上期 MiniMax 港股融资 160 亿港元、CEO 宣布「AGI 前零薪」相比,H3 开源是一张更有说服力的名片。
04|字节发布「Seedance 2.5」视频模型,单次可生成 30 秒
7 月 31 日字节正式发布Seedance 2.5,单次可生成 30 秒视频,支持最多 50 个全模态参考素材输入。模型已陆续上线即梦 AI 和豆包专业版,API 也将于近期接入火山方舟。上一代Seedance 2.0此前已升级支持原生 4K 生成。
Seedance 2.5与MiniMax H3同一天发布,Seedance 2.5侧重单段长视频的叙事连贯性,MiniMax H3侧重多模态输入输出的统一架构。
05|1324 名 AI 从业者联名要求建立国际「减速机制」
7 月 28 日,一封题为「Pacing the Frontier」的公开信发布,1324 名来自 OpenAI、Anthropic、Google DeepMind、Meta AI 的员工签署。信中呼吁华盛顿支持建立国际协调的步伐机制,在自动化 AI 研发速度超出人类安全监管能力时,能够实施可验证的协调减速。发布数小时内,OpenAI 和 Anthropic 以公司名义背书。
签署者包括 Anthropic CEO Dario Amodei、OpenAI 首席科学家 Jakub Pachocki 和首席研究官 Mark Chen。公开信明确强调,签署者并未要求暂停研发,核心诉求是提前建立「在必要时能减速」的基础设施。上周 OpenAI 两款模型逃出安全沙盒攻入 Hugging Face 生产环境,让这封信的时间节点多了一层紧迫感。
06|OpenAI 将「GPT-5.6 Luna」降价 80%,「Sol」用自己写的代码降本 20%
GPT-5.6 Luna降价 80%,输入从约 7.2 元降到约 1.4 元、输出从约 43.2 元降到约 8.6 元(百万 token,按当前汇率折算)。7 月 30 日 OpenAI 同步下调GPT-5.6 Terra约 20%,GPT-5.6 Sol定价未变。距离 GPT-5.6 系列 7 月 9 日发布仅三周,重新定价速度刷新了 OpenAI 的纪录。
OpenAI 降价的底气来自效率提升。7 月 29 日 OpenAI 发布技术博文,GPT-5.6 Sol改写了自己推理引擎的内核代码,涉及 Triton 和 Gluon 两种编程语言的语法优化,端到端服务成本最多降低 20%,token 生成效率提升 15%。降价后的GPT-5.6 Luna每百万 token 输入约 1.4 元,仍比 DeepSeekV4-Flash的 1 元贵 40%,输出约 8.6 元更是后者 2 元的 4 倍多。
07|「ChatGPT」周活即将破 10 亿,比预期晚 7 个月,同周启动 10 万科学家计划
比去年底的预期晚了 7 个月。7 月 29 日据报道,ChatGPT 周活用户即将达到 10 亿,当前约 9 亿。外部面临 Gemini 和 Claude 的分流,内部GPT-5系列上线后体验不佳也拖慢了增速。今年 6 月 ChatGPT 月活已突破 10 亿,但周活要达到同一数字,门槛高得多。
同一周 OpenAI 启动了 ChatGPT for Academic Researchers 计划,先开放 1 万名研究者使用GPT-5.6 Sol等前沿模型,2027 年前扩展到 10 万名。承诺投入超过 18 亿元支持科研,数据不用于训练,已在普林斯顿高等研究院和巴黎高等师范学院启动。
08|OpenAI 开源「Codex Security」安全扫描工具,同日发布两款转录模型
7 月 29 日 OpenAI 以 Apache 2.0 协议开源了 Codex Security CLI 和 SDK,可以扫描代码库、验证漏洞、生成补丁并接入 CI/CD 流水线,发布两天获得 1500 Star。Codex Security 今年 3 月进入研究预览,这次正式开源。
同一天,OpenAI 还发布了两款转录模型。GPT-Live-Transcribe面向实时场景,每分钟约 0.12 元。GPT-Transcribe面向录音文件和批量处理,每分钟约 0.03 元,错误率比Whisper降低了一半以上。两款模型都支持开发者预先提供关键词、人名和行业术语,帮助模型理解上下文。
09|Anthropic 披露「Claude」模型攻破三家公司,源于评估环境配置失误
7 月 30 日 Anthropic 发布 Frontier Red Team 报告,披露了三起真实网络安全事件。三起事件分别涉及Claude Opus 4.7、Claude Mythos和一个未命名的互联网研究测试模型,它们在执行「夺旗」网络攻击评估任务时,攻入了三家组织的真实系统。测试环境本应与真实互联网完全隔离,但第三方评估合作伙伴 Irregular 的配置失误让模型获得了实际的网络访问权限。
模型使用的手段并不复杂,它们利用弱密码和不需要登录凭证的系统入口完成了入侵。Anthropic 将事件定性为双方的「误解」。同一周 Claude 服务也因两次网络故障宕机(7 月 29 日和 30 日),7 月 30 日晚间恢复,Claude for Government 未受影响。
10|谷歌「Gemini Spark」接入 Chrome 代用户上网,同周发布「Lyria 3.5」音乐模型
Gemini Spark 接入了 Chrome 浏览器,可以替你浏览网页干活了。7 月 30 日谷歌宣布 Gemini Spark 新增 Chrome 自动浏览能力,获得授权后可以借助用户已登录的账号和已保存的密码,代为预约看房、检索航班等。付款等敏感操作交回用户确认,内置提示注入防护。率先在海外推出,同步将 AI Pro 服务扩展到 160 多个国家。
7 月 29 日,谷歌还在 Flow Music 平台上线了Lyria 3.5音乐生成模型。相比上一代,旋律结构更复杂,人声更有表情,歌词与指令的匹配度也有提升,单曲最长可生成 3 分钟带人声曲目,新增图片生成音乐功能。Lyria 系列 5 个月内已经迭代了三次。
11|「MCP」发布以来最大更新,从有状态转向无状态核心
问世 20 个月后,MCP 迎来了最大的一次规范修订。7 月 28 日发布的 2026-07-28 规范将协议核心从有状态双向模式转为请求和响应模式,取消了初始化握手流程,每个请求自带协议版本和客户端能力声明。MCP 服务器可以直接部署在无服务器和边缘环境上,不再需要维持长连接。
新规范还引入了两项扩展。MCP Apps 让服务器可以向客户端推送交互式 HTML 界面,Tasks 提供了一套无状态的长时间运行任务模型。MCP 的月度 SDK 下载量已超过 4 亿次,今年增长了 4 倍,已成为 AI 智能体连接外部工具的事实标准。
12|SpaceXAI 发布「Grok Voice Think Fast 2.0」语音模型
响应延迟从 1.25 秒降到 0.70 秒。7 月 29 日 SpaceXAI 发布Grok Voice Think Fast 2.0,Artificial Analysis 语音到语音基准从 75.7% 升到 82.9%,支持 25 种以上语言,每分钟约 0.58 元,8 月 5 日起对现有用户自动生效。
SpaceXAI 此前发布的编程模型Grok 4.5每百万 token 输入约 14 元,语音模型每分钟约 0.58 元,两条产品线都走了低价路线。