☰
港股“大模型双雄“齐涨:亚马逊云接入GLM-5.3,腾讯加码海外算力
2026/10/11 13:40:39 网站建设 项目流程

港股"大模型双雄"齐涨:亚马逊云接入GLM-5.3,腾讯加码海外算力

【免费下载链接】GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2项目地址: https://ai.gitcode.com/zai-org/GLM-5.3-Flash

2026年10月6日,一条看似常规的"模型上架"消息,同时点燃了港股 AI 板块的两条主线。据《科创板日报》独家报道,亚马逊云科技旗下大模型服务平台 Amazon Bedrock 当日官宣接入智谱 GLM-5.3,且 AWS 将基于模型调用量与智谱进行收入分成——这不是一次简单的"上架",而是国产大模型首次以分成制进入全球最大云生态的付费通道。消息落地后,证券日报、东方财富等多家财经媒体同步报道"智谱股价涨近5%""GLM-5.3海外走红",叠加腾讯加码海外算力的资本开支信号,港股"大模型双雄"应声齐涨,云计算 ETF(汇添富 159273)在节后科技板块深度调整中逆势吸金。

本文不打算停留在"又一个大模型出海了"的叙事层面,而是拆开三层:这条新闻如何传导到港股与云计算板块行情、分成制背后是什么商业逻辑、以及模型仓库里的真实配置凭什么支撑这种"国际化变现"。

一条新闻如何撬动两条主线:GLM-5.3 上架 Amazon Bedrock

先还原新闻本身的事实链。据财联社《科创板日报》记者独家信息,Amazon Bedrock 接入智谱 GLM-5.3 的关键不在"上架",而在分成条款——AWS 基于模型调用量与智谱进行收入分成。报道同时披露了两个此前未被广泛注意的细节:

  • 海外侧:除 AWS 外,智谱近期已与多家海外云厂商落地收入分成模式,这是智谱此前公开透露的"通过海外云平台收入分成增加一条具有规模潜力的商业路径"的正式兑现;
  • 国内侧:智谱已与阿里云百炼平台等头部云厂商签署类似分成协议,华为云已上架 GLM-5.3 并就类似合作达成意向,形成贯通国内外的分成体系。

这意味着智谱的商业模型正在发生结构性变化:从"卖模型授权/卖 API 额度"转向"云厂商负责基础设施与获客、智谱按调用量持续分成"的订阅化收益结构。对云厂商而言,Bedrock 上一份越卖越贵的大模型接入协议,等于把一个拥有全球开发者基础的开源生态(MIT 协议)嫁接到自己的计费体系里;对智谱而言,这是把模型权重转化为长期经常性收入(Recurring Revenue)的通道。

支撑这一转型的财务底色,来自智谱 2026 年半年报:上半年营业总收入 9.54 亿元,同比增长 399.7%;归母亏损 20.71 亿元,同比收窄 12.1%。收入高速增长叠加亏损收窄,加上 9 月宣布完成约 50 亿美元(约合 335.72 亿元人民币)融资——约 20 亿美元股份配售加约 30 亿美元可转债——融资明确投向"下一代 GLM 基础模型及完全自训练(Fully Self Training)体系的研发,以及大规模训练、生产推理、算力资源及相关技术基础设施的部署及升级"。这条资金链与 Bedrock 分成通道形成闭环:算力扩张 → 模型迭代 → 云渠道放量 → 分成回血。

行情传导:为什么"上架"能带动港股与云计算板块

从消息到行情,市场对这一事件的定价逻辑分三层递进。

第一层是直接的个股映射。智谱作为大模型资产,其"海外走红"直接反映在股价上——证券日报、东方财富等多家媒体在事件当日即报道"智谱股价涨近5%"乃至"涨超5%",标题口径高度一致地指向同一事实:GLM-5.3 的海外渠道价值被资本市场重新定价。此前"匿名模型 Ox Alpha 亮相 OpenCode、线索指向智谱"的悬案,在智谱承认 Ox Alpha 是自家 GLM-5.3-Flash 之后获得确认,海外开发者用脚投票的调用量成为股价的先行指标。

第二层是板块联动。消息面同时出现的还有"腾讯加码海外算力"与"OpenAI 正式推出 GPT-6"两条供给端线索。在科技板块节后深度调整的背景下,云计算 ETF(汇添富 159273)逆势吸金,说明资金并没有撤出 AI 叙事,而是在"模型层竞争白热化、算力层持续紧缺"的预期里换手加仓。腾讯加码海外算力与智谱融资投向"大规模训练、生产推理、算力资源"在时间上共振,本质上都是同一轮 AI 资本开支(Capex)周期的注脚:模型越强,越需要跨地域的推理与训练算力,云厂商与模型厂商的绑定就越深——Bedrock 分成协议恰好是这种绑定的制度化形式。

第三层是商业化叙事的重估。过去一年,港股 AI 板块的估值锚始终在"大模型能否赚到钱"上摇摆。分成制的出现把答案从"不确定"推向"有路径":调用量分成意味着模型厂商的收入与用户真实使用量挂钩,而非一次性授权费,这在资本市场眼中是"随云规模线性扩张"的可验证收入模型。当智谱同时打通 AWS、阿里云百炼、华为云三家国内外头部渠道时,"双雄齐涨"的其实是市场对整个中国大模型商业化的重新定价。

源码视角:GLM-5.3 凭什么被 Bedrock"选中"

上架 Bedrock 不只是一个商务谈判结果,模型本身必须具备在海外云上经济地规模化服务的条件。打开仓库里的 config.json,可以完整还原这份"工程底气"。

首先是激活参数与稀疏架构。GLM-5.3-Flash 总参数 320B、激活参数仅 18B(README 描述为 "320B total parameters and just 18B active parameters")。config 中n_routed_experts: 288、num_experts_per_tok: 8、n_shared_experts: 1,采用topk_method: "noaux_tc"的无辅助损失路由,每 token 仅激活 8 个专家。18B 激活意味着在同等算力预算下可以服务更多并发请求——这是云上分成的单位经济性(Unit Economics)基础。

其次是长上下文与注意力架构的取舍。max_position_embeddings: 1048576,即 1M token 上下文;layer_types数组在 45 层中交替布置linear_attention与deepseek_sparse_attention(config.json 中full_attn_layers: [3, 7, 11, ...]共 11 层全注意力,其余为线性注意力层)。混合稀疏+线性注意力大幅压低长上下文服务的 KV 缓存与算力开销,同时保留精准长程能力——这与 Bedrock 上企业级"读仓库、跑 Agent"场景高度契合。模型还引入了mhc: true(Manifold-Constrained Hyper-Connections,流形约束超连接,hc_mult: 4)来进一步提升扩展效率。

第三是原生多模态。GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型:vision_config中图像 patch 14、输入 448×448,video_processor支持时序 patch(temporal_patch_size: 2)与视频输入,词表层面定义了image_token_id: 154854、video_token_id: 154855及对应的起止 token;processor_config.json 中视频 token 上限达 240,000,fps: 2。配合 README 披露的 30T token 多模态预训练语料,模型天然覆盖图片、视频、文件、文本四类输入——这正是多模态原生能力在 Bedrock 上"开箱即用"的前提。

第四是部署与量化的友好性。config 中quantization_config采用activation_scheme: "dynamic"、fmt: "e4m3"(FP8 动态量化),62 个分片总权重约 328 GB(model.safetensors.index.json 中total_size: 328326771576);同时兼容昇腾 NPU 平台。README 列出了 SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth 六条部署路径,几乎覆盖了开源推理框架的主流选项,意味着云厂商可以在不改动自身 Infra 栈的前提下完成接入。

成本端看,智谱官方已公布的三档定价结构(单位:元/百万 Tokens):

模型上下文输入单价输出单价输入模态
GLM-5.31M828文本
GLM-5.3-Flash1M0.82.8图片、视频、文件、文本
GLM-5.3-FlashX1M27图片、视频、文件、文本

Flash 档以旗舰 1/10 的价格提供多模态输入与 1M 上下文,这在 Bedrock 面向价格敏感型企业的场景里是极强的替换理由——README 中"以十分之一价格接近 Claude Opus 4.8 的编码与 Agent 基准"的表述,正是渠道侧的卖点。

从 Ox Alpha 到 Bedrock:开源与商业化的双轮驱动

回看 GLM-5.3-Flash 的走红路径,会发现一条被低估的运营曲线。模型先以"Ox Alpha"的匿名身份在 OpenCode 等平台亮相,靠实打实的基准表现积累海外开发者信任——在 Z.ai Code Bench 编程基准上较 GLM-5.2 提升 50%,在 CyberGym 漏洞发现测试中达到 84.5% 准确率,超越 GLM-5.2 与 Mythos 5 等竞品,并成为彼时最强开放权重编码模型。智谱随后承认 Ox Alpha 即自家 Flash 模型,将匿名口碑转化为品牌资产。

在推理侧,智谱于 9 月 18 日推出 GLM-5.3-FlashX(最高 200 tokens/s),官方披露其推理底座已扩容至10 万张国产芯片。这一基础设施规模与 50 亿美元融资中"大规模训练、生产推理、算力资源部署升级"的用途一一对应。注意 chat_template.jinja 中的细节:模板支持reasoning_effort(low/high/max三档)与clear_thinking参数,说明模型内建了可调节的思考预算控制——这在云 API 场景里意味着调用方可以按任务复杂度弹性调节延迟与成本,进一步强化"按调用量计费"的可用性。

把这条链路串起来看:开源开放权重(仓库 LICENSE 为 MIT)承担"技术可信度"的全球扩散,云渠道分成承担"商业变现"的规模化回收,国产算力底座承担"成本可控"的供给保障。三者构成闭环后,Bedrock 上架就不再是一次性事件,而是一个可复制的增长模型。

结语:分成制的真正意义

GLM-5.3 上架 Amazon Bedrock,表面是产品渠道新闻,实质是中国大模型产业第一次以"分成制"姿态进入全球云生态的核心计费体系。它同时回答了资本市场的三个问题:模型厂商的收入是否可以随云规模线性扩张?答案是 AWS、阿里云百炼、华为云的三线并进;大模型的算力投入是否能转化为商业回报?答案藏在 9.54 亿营收与 399.7% 增速里;国产开源模型是否只配"叫好不叫座"?答案写在 Ox Alpha 的开发者口碑与 10 万张国产芯片的推理底座中。

对关注港股与云计算板块的读者而言,这条新闻的价值不在于一天的涨跌幅,而在于它标记了一个拐点:大模型的竞争,正从"谁能训出更强的模型"转向"谁能把模型变成持续分成的现金流"。而仓库里那份 320B/18B 的配置文件,就是这场转向的工程注脚。

【免费下载链接】GLM-5.3-FlashGLM-5.3-Flash (320B-A18B),是GLM-5系列的首个原生多模态模型。320B总参数,能力超过GLM-5.2项目地址: https://ai.gitcode.com/zai-org/GLM-5.3-Flash

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询