最近这段时间,国内的大厂们一个个都在捣鼓桌面端agent
这也导致各种各样的桌面agent横行,看得人眼花缭乱
对于普通上班族来说,到底哪款产品更好用?
今天我们挑选了三家在各自领域具有代表性的agent产品进行测评,为大家挑选出一款最适合日常办公的产品
选手出场
第一位选手是来自腾讯的WorkBuddy,鹅厂自主研发产品,定位就是职场AI数字同事,据说内部拥有7万+现成办公skill,内置多款大模型。
根据权威口径,WorkBuddy的日活已经超过1300w,月活达到了2000w,且增速并未出现放缓苗头。说不准你的同事们就在用它。
为了更贴合产品框架,本次测试全程采用腾讯自家的混元3进行,用hy3还有个好处,别着急,后面揭晓。
第二位选手是上个月刚发布了K3大模型,一时风光无两的月之暗面-Kimi,网上都说K3大模型现在是国内第一的水平,前端设计能力更是无人(AI)能敌
在AA榜单上位列第三,也是有史以来参数量最大的开源模型。
数据如此惊艳的Kimi在日常办公场景中的表现究竟怎样?现在就让我们一探究竟。
第三位是大家耳熟能详的豆包,可能有些朋友没想到豆包也能参赛,这不是agent能力大比拼吗,怎么选手是一个chat产品?
其实是因为豆包桌面端上个月默默上线了agent功能。
今天就让我们看看宇宙厂出身,上到八十岁大妈下到幼儿园稚子都熟悉的豆包,实力如何。
本期评估会从三个角度分别进行考察
分别考察:电脑操控能力、信息搜集能力、复杂任务处理能力
可以操控电脑代表着AI有了手脚可以干活。
信息搜集可以让我们迅速得到需要的讯息,而不用自己费劲吧啦一条条找了,agent还能直接写成报告,大大省心。
而办公室中总会遇到一些相对复杂的任务,比如调研某个公司或者行业等等。
三个场景下进行能力的考察,逐级递进,确保覆盖日常办公的常见场景,充分评估agent产品的辅助办公能力。
先用一个表格简单展示一下考察结果
场景1 电脑操控能力
首先我们要考察的是各个agent的电脑操控能力,这是agent产品的基本能力,可以操控电脑,才能够真的帮助我们工作。
为此了本次测试,我特意创建了一个文件夹里面摆放了一些杂乱文件作为三位选手的施展对象
分别向三位选手发送了如下提示词:
请整理“任务1_文件综合处理”文件夹,制作一个可以直接交付的项目资料包。 完成后报告:是否完成;生成了哪些文件;预算计算结果; 是否发现预算风险;最后进行了哪些检查。不一会儿各位选手纷纷返回了结果
第一位完成的是豆包,用时5分钟,第二位是Kimi,用时6分16秒,最后是我们的大牌选手WorkBuddy,用了将近9分钟
按照完成的时间顺序,一一检查各位选手完成的情况如何
浏览了一下对话框和文件夹大致情况,似乎表现得都很棒
就在我想要宣布三位选手第一轮表现都很不错战平的时候
打开每个文件仔细检查的我却发现了一些问题
豆包的word版汇报中赫然出现了文字乱码和字号不统一的情况
我连忙再仔细检查了一遍另外两位选手的输出结果
WorkBuddy和Kimi都没有出现同样的问题,处理得很得体
第一轮下来,豆包解决问题确实是一马当先的快,操控电脑的能力也还OK,就是质量还需要打磨
而WorkBuddy和Kimi则都很好地通过了测试,电脑操控能力没有任何问题
场景2 信息搜集整理能力
接下来测试一下三位选手的信息搜集能力
其实过往的chat产品也能够做到信息的搜集整理,但是agent能够更进一步
它可以将整理好的讯息按照我们的要求呈现出来
刚好前几天刷到了韩国SK海力士大跌的消息,那就让三位选手给我搜集一下SK海力士的最新消息吧。
提示词如下:
检索SK海力士的最新资讯,总结,创建一个word将总结写入其中,附上信息源豆包依旧是最快完成的,只用了3分钟
它没有直接创建word,可以看到对话窗口页面显示可以导出三种格式,分别是word、PDF和markdown,选择导出成word
给出三个选项事实上是扣分项,因为我已经说得很明白了,要它创建一个word写入内容,它却自己画蛇添足,这种发散思维很容易导致出现AI幻觉。
看一下内容,表面上没有问题,搜集了很多海力士的资讯,但是并没有体现出最新资讯,在豆包的资讯总结中我没有办法看到哪条讯息是新的
英伟达与海力士的合作其实是7.25的资讯,算是很新的了,但是豆包只说是七月份的,七月初和七月下在时效性上差距太大了。
很搞的是,它确实也搜集到了这条资讯,却不把时间说清楚,读者需要自己再验证一下这到底是什么时间发生的。
再看一下WorkBuddy的,它和Kimi都很利落地导出了word文档,这很不错。
这份总结,内容上我觉得很nice,不管是字体格式的观感上,还是语句的阅读体验以及资讯丰富度、时间标注上,都是一份很棒的资讯总结。
最后是Kimi的这份资讯总结,看下来我感觉有点奇怪,写得不太像资讯总结,更像是一份小论文,也并没有抓到海力士与英伟达合作的最近重大资讯。
如果这是写论文,Kimi或许可以得个优,但是这是资讯总结,Kimi这轮的表现着实有些糟糕。唯一的亮点是行文上可以看到Kimi的逻辑能力确实比较强。
鉴于可能存在的随机性,我给了三位选手第二次机会
让他们搜集最近三天的AI资讯:
搜集最近三天内的所有AI大模型相关资讯,先给简讯再一条条列出, 以html形式给出不得不说豆包是真的快,总是第一个完成任务,看看这次豆包完成得如何怎么样
可以看到豆包搜集了三天内也就是本周二(8.4)至今的18条资讯,我仔细看了看详细咨询,对这几天AI领域发生了什么有了一个迅速的了解。
再看看第二个完成的,也是刚刚表现最好的WorkBuddy本轮情况如何
期望导致了带来了些许的失望,
我所说的最近三天,WorkBuddy从8.3开始计算,可能是把三天理解成了往前的72小时吧
另外共计列出了16条资讯,相较豆包少了两条
看看最后完成的Kimi本轮如何,会不会把总结写出成小论文呢
可以看到在时间上,Kimi似乎也是往前数72个小时,和WorkBuddy犯了同样的问题。
具体的资讯方面,Kimi和前两位选手有些许不一样,豆包和WorkBuddy都是将资讯本体逐条列出
Kimi则是选择按照资讯的不同类型进行展示
搜集到的讯息也是最全面的,怪不得思考那么久
两轮下来,相较传统的word、PDF报告形式,似乎各位选手在以html展示成果时都会表现得更棒
豆包和Kimi第一轮表现不如WorkBudyy,却都在第二轮中于不同层面实现了超越。
这让我不由得期待
在最后的大比拼中,他们又会擦出怎样的火花呢?
场景3 综合能力
电脑操控和信息搜集能力都测过了,最后测试一下agent产品办公环境下的综合能力。
一份综合性的报告很多时候是大家头疼的,不够全面?深度不够?或者本来就对调研对象不够了解,不知道该如何下手。
大家都知道,AI的发展大大推动了存储行业的又一次繁荣。
那么让AI做一份存储行业的调研报告,各个agent的表现会如何呢?
接下来我给三位选手发送了同样的提示词:
写一份存储行业出现以来分析报告,讲明每一次重大变化原因,对原因要详细分析,要说清楚目前存储行业各巨头竞争格局。设计一个精美的HTML页面展示豆包一马当先,又又又第一个完成任务,用时6分钟,WorkBuddy紧随其后,用时八分钟,而Kimi则是用了整整15分钟才撰写完这份报告。
下面带大家看看,这三位选手的作品到底如何
以下是三位选手报告的封面,大家可以猜猜各自是谁做的
揭晓谜底时间
第一张是Kimi的报告封面,第二张是豆包,第三张是WorkBuddy,不知道大家有没有猜对。
对于这几个报告的风格设计,我个人最喜欢的是wrokbuddy,简朴但是有着淡淡的沉稳,还有一丝青春的感觉,不死板;
其次是Kimi,有着AI时代的神秘、冷峻以及黑金色带来的贵重。
内容上很有意思的一点是,Kimi和WorkBuddy都明晃晃的在标题中写出了存储行业七十年。
豆包显然在此方面更有自己的想法;其次豆包认为有存储行业有六次变革,WorkBuddy则认为有七次变革,而Kimi列出了十次变革。
虽然不是说列出的变革越多越好,但是Kimi给出的确实都是有理有据,逻辑融洽。
再来看看一份合格报告中不可或缺的图表
让人感到欣喜的是三位选手都在报告中列出了各自的图表,虽然图表的数据源不一,但说明它们都有这个意识,不得不再次吐槽一句豆包这个画风我看着真的是非常糟糕有些不如人意。
通篇下来,在内容的丰富度、逻辑性上,Kimi相较于WorkBuddy有着一定的优势,而WorkBuddy则又领先于豆包。
Kimi在网页的设计上还有着自己的一些小巧思
本轮测试,Kimi在内容上毫无疑问占据了头把交椅
看样子在整体的逻辑思维方面,Kimi确实无愧于国内第一开源大模型之称,它的前端设计确实很符合公司名称:月之暗面,还有着其它两位选手所没有的一些实用设计思路。
WorkBuddy在报告风格上得到了我的好评,且它生成报告只用了Kimi一半的时间。
至于豆包,速度确实很快
随后我又让三位选手对国内某家存储行业细分领域的龙头公司进行了调研,主要是看看这家公司目前的估值有没有泡沫
先来看看豆包的
豆包从PE(TTM)在行业内部的对比和行业基本逻辑层面给出了自己的判断:
存在阶段性泡沫。
再来看看WorkBuddy怎么说
WorkBuddy从PE(TTM)、PB在该公司历史分位数处境和多个财务指标以及机构预期情况综合判断,给出了自己的结论:
存在明显泡沫。
Kimi会给出什么结论呢?
Kimi同样认为估值过高,存在明显泡沫化特征
明确指出,目前的定价属于叙事定价而非盈利定价
什么意思呢?就是现在的价格是靠讲故事得来的,公司目前的基本面根本撑不起来这个价格。
Kimi对于泡沫的判断逻辑和WorkBuddy差不多,都是通过大量的技术指标和基本面数据下判断
但是有一点Kimi想得更深入
它认为泡沫化不等于估值一定下跌,如果行业景气度、国产替代叙事持续,公司盈利能力改善,那么估值能够维持,如果做不到,那么就会存在估值回归压力。
总的来说,三位选手给出的核心判断是一致的,那就是存在泡沫
只是各自的依据不同,那么呈现出来的说服力自然会有差距
对我来说,WorkBuddy和Kimi的结论更有说服力,多维度数据在说话
而Kimi给出了前瞻的指引,这让我感到惊喜
但是很遗憾的一点,在三位选手给出的两份报告中都只说明了报告所用数据在哪些平台上进行搜集的,并没有给出具体的信息源链接,这给信息的真实度带来了一丝疑虑。
其实一个很简单的方法就可以避免这个问题,在提示词中加上:所有信息附上具体来源链接,就可以解决了。
为什么一开始不加呢,就是想看看三位选手能不能躲过这个坑,没想到给了两次机会依然全军覆没。
这也说明提示词依然非常重要,一个明确的提示词可以让你的agent更懂你。
总结
几轮测试下来,结果已经显而易见。
如果你需要的是效率、内容以及性价比相结合,WorkBuddy就是你最佳的办公搭档,可能它的内容没那么完美,但是它产出的速度不慢。
最重要的是,截至目前混元3免费!
如果你只需要速度,有一个任务迫在眉睫,产出的稳定性此时没那么重要了,那你可以选择豆包,它干活很快,agent的基本能力它都有。
如果你最需要的是产出的深度,那么我推荐你使用Kimi,虽然它在处理稍大任务时速度较慢,不过它确实会给出一份很不错的答卷。
或许过段时间当Kimi解决了算力不足的问题,效率上也会得到提升。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~