微软员工 28 天烧掉 2.8 万美元 Token,AI 预算怎么管
2026/8/31 21:53:52 网站建设 项目流程

据报道,一份泄露的微软内部表格显示,有员工在 28 天内产生了约 2.8 万美元(约合人民币 18.9 万元)的 Token 成本,而同期全体员工 AI 用量的中位数只有 300 美元左右。微软随即收紧内部 AI 用量管理:上线用量监控、给各部门设预算目标,并把内部默认工作负载切换到更便宜的 GPT-5.6 Sol。这条消息 8 月 30-31 日被多家媒体转载,在打工人圈子里讨论度很高。

事实梳理:公司开始给 AI 用量上"紧箍咒"

把已知信息拆开看:

  • 2.8 万美元怎么来的。据报道,泄露表格显示近几个月部分员工大量调用 AI 来提升内部数据排名,极端个案达到 28 天 2.8 万美元;同一统计周期里,个人用量中位数约 300 美元,差了近一百倍。
    • 微软的应对分三步。一是 Token 用量监控,识别异常高支出账号;二是更严格的预算限制,据报道自 2026 年 7 月起各部门都有自己的 AI Token 预算目标,员工能随时查看个人 AI 支出;三是把内部默认模型切换为更便宜的 GPT-5.6 Sol。
    • 管理口径也变了。更新后的内部 Copilot 指引不再鼓励"多用",而是明确不要一味追求调用次数。
    • 部门差异很大。据报道,泄露数据里不同部门用量差异悬殊,CoreAI 这类 AI 核心部门的中位数明显高于其他部门——用量高低不只是个人习惯问题,也跟岗位性质强相关。

技术本质:Token 计费下,用量失控是必然的

这件事的技术内核并不复杂:大模型按 Token 计费,输入和输出都算钱,长上下文、长输出、反复重试,费用是指数级往上走的。问题在于,大多数人对"一次对话花了多少钱"没有感知——聊天框里打几个字,后台可能已经烧掉了几千个 Token。

为什么之前没人管?因为前两年是"鼓励用 AI"的阶段,公司把 AI 工具当福利发,考核的是使用率,大家自然是能多调就多调,甚至有人开着多个客户端刷任务。等月底账单出来,管理层才意识到:福利发成了无底洞。这跟当年云主机"月底账单吓人"的剧本一模一样——计费模型没变,变的是管理粒度,从粗放补贴切换到预算制。

对普通打工人来说,这件事的信号很直接:公司资源是公司资源,AI 额度也是。你调用的每一笔,都在某个部门的报表上挂着。今天微软查的是 2.8 万美元的极端个案,明天可能就是"你的用量是部门中位数的三倍,请说明理由"。

普通开发者和从业者该怎么应对

在公司场景:

  • 用公司提供的 AI 工具,先弄清楚有没有个人用量视图,别把"内部免费"当成"无限免费";
    • 批量任务、数据排名类玩法谨慎参与,这类场景最容易触发异常检测;
    • 长文档、大上下文任务尽量拆小,既省 Token 也省时间;
    • 如果公司已经上了用量监控,就把个人 AI 支出当成一条要维护的指标,别让它成为月底报表里的异常点。
      个人开发场景:控制 API 成本有几个立竿见影的办法:
  1. 先算后调。发请求前用分词库预估 Token 数,心里有数再动手:
importtiktoken enc=tiktoken.encoding_for_model("gpt-4o")text="把这段提示词发给模型之前,先算算大概要花多少 token"print(len(enc.encode(text)))# 输出 token 数量,乘以单价就是成本
  1. 卡住输出上限。调用时显式设置max_tokens,防止模型"话痨"式输出把账单拉高。
    1. 小任务别用大模型。分类、抽取、格式化这类简单活,用便宜的小模型或者规则代码处理,成本能差一个数量级。
    1. 监控响应里的 usage 字段。各家的 API 返回里都带输入/输出 Token 数,把它落库,月底自然知道钱花在哪了。
    1. 善用缓存和批处理。重复的提示词走缓存,多条短请求合并成一条,都能省下可观的费用。

一点想法

AI 工具从"随便用"到"预算制",本质上是它从新鲜玩具变成了生产资料。对打工人来说,多了解一点 Token 成本的结构,不是给自己添堵,而是避免哪天真被"请喝茶"。另外,微软把默认模型切到更便宜的 GPT-5.6 Sol 这件事本身也值得注意:它说明对相当一部分任务来说,旗舰模型的边际收益并不值那个差价,选模型本身就是一项成本控制技能。你们的公司开始管 AI 用量了吗?评论区聊聊。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询