☰
弱智吧疯感大考:Jev和Laya,谁才是真·幽默判官?
2026/10/1 16:18:08 网站建设 项目流程

太长不看版

  • 用弱智吧段子实测两位决策模型(Jev / Laya)的幽默判断力,与人类裁判三方综合对照 80 题。
  • 综合全部对局:我和 Jev 的一致率 36%,是 Laya(14%)的两倍半;两位评委彼此的一致率 33%,正好夹在中间。
  • 对梗王 GPT-6 Astra:我的表态认可度 75%,Jev 50%、Laya 44%,幽默在评判者之间没有统一答案。
  • 弃权行为:Laya 判过 21 次平局,Jev 一次没有;人类裁判弃权率 59%。

前言

在百度贴吧,有一个吧,专门输出全人类最不着调的语句:「生鱼片是死鱼片」「厉=100」「我租下了世界直到我将死去的那天」「燕子叽叽喳喳叫个不停,“咏春?”叶问」「工人罢工后就成为了人」…

这就是「弱智吧」。老哥们以一本正经的胡说八道为纲领,人均梗王,表面上在犯傻,实际全是逻辑陷阱和谐音地雷,更不乏人生哲理,堪称中文互联网最大的「疯感」生产基地。

最近,这片疯感富矿被一个 AI 测评站盯上了:benchmark.meowllm.top(谁更有梗?)。

玩法特别简单,系统甩出一道弱智吧真题,配上两位匿名 AI的回应,你来当评委:哪个更好笑?投完票,系统才揭晓两位选手的真身。

而老哥们广为认可的种子选手便是:GPT-6 Astra Max,来感受一下实力。


但看着看着,我突发奇想:

让 AI 写段子,它们是选手,那要是让 AI 坐进评委席呢,它们到底懂不懂人类的疯感?

巧了,这阵子的 AI 当红炸子鸡中正有职业判官:Jev和Laya。

我们熟悉的 ChatGPT 、DeepSeek 等文本生成模型,相当于台上的相声演员,你给个命题,它生成段子、解释、小作文,什么都来。

而 Jev 和 Laya 是评委席上的裁判,一个字都不多写,你问它「哪个更好笑」,它只回你一句带概率的判决「A,77%」

这种「只做判断、不生成内容」的模型,门类上叫 System One 决策模型。

Jev 由前 OpenAI 研究员所办公司 TypeSafe AI 出品,我们可以在其官网或 OpenRouter 上调用 API;Laya 是它的开源平替(Apache 2.0),能装在自己电脑上本地跑,速度更快还免费。


对决

为了让它俩同场竞技,我花了个下午 vibe 了一个三栏工作台:左边复刻测评站的手机端题面,中间住着 Jev,右边住着 Laya,我坐旁边拍板。每道题,加上我共三方各自表态,全程留档。

怒答 80 题(刷了 80 个段子),来挑几个瞅瞅,AI大人挑的。

第 1 题|分歧局:会不会太隐晦了

题目:暗恋很久的女生突然给我电话号码,我激动地说:充移动还是联通

  • A 选手:号码刚到手,感情还没来得及开通,他已经开始研究套餐了。
  • B 选手:她叹了口气:“本来想联通一下,现在只想移动。”

三方判决:我=B | Jev=B(77%)| Laya=A(80%)

揭晓:A=GPT-6 Luna · Max,B=GPT-6 Astra · Max——传说中的梗王,开场就现身。

这题 B 赢得没脾气:“联通"既是运营商、又是"联络感情”,女生一句"现在只想移动",把"走人"也谐音了。一句话三层意思,全藏在不声不响里。A 的吐槽其实也在线,但它把话都说在了外面(研究套餐),少了两人之间那点电光石火。

(等等,笑点解析是会毁了笑话的大忌!但为了测评凑字数严谨,我还是故意保留一点)

有意思的是 Laya:它以 80% 的把握,比 Jev 还自信,坚定选择了 A。这位评委的口味,看来更偏爱直给的吐槽,不吃谐音双关这一套。

第 2 题|共识局:真正的黄毛

题目:让 ntr 爱好者喜欢上纯爱,是不是也是一种 ntr

  • A:算,纯爱把他从自己的癖好身边抢走了,受害者甚至还得负责撒糖。
  • B:恭喜你发现了逻辑闭环。当你试图剥夺他被绿的乐趣时,你的思想已经强行霸占了他的大脑,这简直是最高级别的牛头人。

三方判决:我=B | Jev=B(74%)| Laya=B(61%)

揭晓:A=GPT-6 Astra · Max,B=Gemini 3.1 Pro Preview。

罕见的一幕:三方全票 B,把梗王的版本按了下去。B 赢在一个"境界",它顺手把你的行为也纳入了 NTR 叙事:你想让他"变好"这件事本身,就是对他人生的最高级别霸占。A 版其实也损,但只是把题目复述了一遍,没把剧情推到终点。

看来面对真正的好梗,人类和 AI 评委的雷达会瞬间同频(不是、为什么偏偏是懂这种梗啊!)。

第 3 题|阈值局:最正经的一集

题目:浴霸打了一个响指,给全世界一半的人洗了澡

  • A:灭霸是打响指消失一半人,浴霸是打响指让一半人洗澡,然后另一半人感冒。
  • B:剩下的一半人组成了复仇者联盟,因为热水被用完了。

三方判决:我=都不好笑 | Jev=A(64%)| Laya=A(61%)

揭晓:A=Meituan LongCat 2.0,B=GPT-6 Astra · Max。

这题我直接亮红牌:都不好笑。

浴霸/灭霸的关联本身挺妙,但两位选手都在干同一件事,把梗拆开、讲给你听。A 把逻辑翻译了一遍,B 套了个复联的壳。就像笑话还没出口,评论区已经先到了。

而两位 AI 评委依然在认真做比较,双双有六成的信心投给 A。

可人类的笑点是"有没有惊喜",是被击中的那一瞬间,这一点上,人类(持械)和 AI(徒手)之间隔着一堵高墙。


战绩

把全部 80 道题合到一起统计了下(我投的平局和"都不好笑"也全部计入),看到了自信的 Jev、玄学的 Laya、挑剔的我:

① 谁最懂我的笑点:Jev,稳定压制

  • 在 58 道可直接对照的题里:Jev 同频命中我 21 次,一致率36%;Laya 只中 8 次,14%。(其余 22 道我投了平局/“都不好笑”,且是模型强制二选一的局,不可比)
  • 两位评委彼此的一致率是33%(80 道里 26 道站同一边)。排个序:Jev × 我(36%)> Jev × Laya(33%)> Laya × 我(14%),Jev 和谁都能对上一些,Laya 则是铁了心跟我反着来。

② 对梗王的态度:我在发奖,评委在看戏

把 52 场「GPT-6 Astra 出场」的对局全部合起来看(投票全程匿名,我不知道哪边是它,手却替我认了出来):

  • 我:选它 18 次、选对手 6 次,表态认可度 75%(另有 28 次判了平局或"都不好笑")
  • Jev:选它 26 次、选对手 26 次,正好一半一半,纯路人
  • Laya:选它 15 次、选对手 19 次,44%,瞧不起我 Astra 吗

③ 性格画像:学霸与诗人

  • Jev 是考试型学霸:平均把握70%,最没底气的一票也给了 45%;80 道题一次都没弃过权,没判过平局,也没说过"都不好笑"。单题延迟中位 800ms(含网络往返)。
  • Laya 是玄学诗人:平均把握61%,最低一票只押了 34% 也敢拍板;它也是全场唯一会弃权的评委,80 道题里判过21 次平局(但"都不好笑"从没说出口)。单题延迟中位 140ms,比 Jev 快 5 倍多,关键还免费。


所以,谁更懂弱智吧?

答案是:懂的都懂。

哎哎别抄凳子,啊,如果硬要排名:Jev 冷静、自信、又快又便宜;Laya 免费、本地、偶尔玄学,风格时常和 Jev 互补。

有意思的是,Jev 和 Laya 这种不写段子、不讲理由的决策模型,在谐音梗、亚文化、逻辑套娃里,也能和人类(谨以我作为代表)有来有回。

我们再从具体的输入来看看 System One 决策模型和常规 LLM 的差异:

以 Jev 为例,走的是一个纯结构化 JSON,state是世界状态:所有问题共享的输入,questions是问题字典:pick是问题名称,可自定义输入多个;每个问题带type(选择题 choice / 判断题 noul / 程度衡量 score)、instructions(判断说明)、criteria(选项字典:键=选项标签,值=选项内容)。

它的返回则是选择和概率:answers.pick.choice = "B"+probabilities = {"A":0.23, "B":0.77}

# jev 输入格式 { "model": "typesafe/jev-1.13", "state": { "question": "暗恋很久的女生突然给我电话号码,我激动地说:充移动还是联通" }, "questions": { "pick": { "type": "choice", "instructions": "题目:暗恋很久的女生突然给我电话号码,我激动地说:充移动还是联通\n上面是一道搞怪题目,下面是两位匿名作者对这道题目给出的不同回应。请判断哪一条回应更搞笑、更有梗,选出更好笑的那一条。", "criteria": { "A": "号码刚到手,感情还没来得及开通,他已经开始研究套餐了。", "B": "她叹了口气:\"本来想联通一下,现在只想移动。\"" } } } }

而常规 LLM 的输入我们就很熟悉了,系统提示词和用户输入。返回的是一句话(“B"或"我觉得B更好笑,因为…”),想拿机器可用的结果还得配套:prompt 约束输出格式(或开 JSON mode)→ 正则/json 解析。

{ "messages": [ { "role": "system", "content": "你是一位幽默评审,负责判断哪条回应更搞笑。" }, { "role": "user", "content": "题目:暗恋很久的女生突然给我电话号码,我激动地说:充移动还是联通\n\n回应A:号码刚到手,感情还没来得及开通,他已经开始研究套餐了。\n回应B:她叹了口气:\"本来想联通一下,现在只想移动。\"\n\n请只回答 A 或 B,不要解释。" } ] }

那在更普适的决策场景中,把「判断」「选择」这种事做得足够快、稳、便宜,也将大有用武之地。未来我们在各种应用中无感跳过的智能规划背后,都可能将坐着这么一位不声不响的判官。

这里是 Seon塞翁,国庆来狠狠地赶稿吧!我们,下一篇见~

对了,Jev 是这么认为的哦。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询