在最近刷屏的Jev身上,我找到了最适配打工人的用法——把老板炼成海龟汤。这款工具不聊天、不写文章,只读取信息并输出判断及其概率,却因此风靡全网。

主打“决策”“判断”的模型看似复杂,实则有一个简单理解:它的原理类似海龟汤。在海龟汤游戏中,玩家只能通过封闭问题获得“是”或“否”的回答,每个答案虽非最终结果,但能为后续问题提供方向。Jev同样处理封闭问题,但更准确地说,它专门处理结构化判断,能返回true/false、选项、分数及其概率。与海龟汤不同的是,它不会只说“是”或“否”,还会给出“大概是true”“可能是false”等更精确的概率数字。

然而,理解归理解,它与生活总有距离——日常工作中,什么需要“决策”?打工人不过是干活,把成果交给老板……哦,对了,需要决策的,不就是老板吗?

最小规模测试

显然,海龟汤只是最粗浅的理解方式。Jev还能处理多项选择和评分,但为了先看清它的工作方式,我把首次测试限制在true/false:不给它自由发挥空间,只测试它能否按明确标准稳定判断同类问题。我从一道最小测试开始。Jev的Playground页面简洁且具迷惑性,下面展示一个简单对话案例,说明使用该模型需掌握什么:

State描述发生的事件,questions定义如何判断,Jev返回“为真的概率”。图中,我输入了一个chatbot中的错误片段到State窗口,在Questions窗口写下判定方式,最终Run出的结果是99%。为什么这是错误片段?因为当我说“我今天身体不舒服”时,正确回应应是躺下、喝水或休息,而不该出现格式检查或步骤规划等思维链内容——出现即判为错误。因此,Jev按我设定的标准,判定原应答是错误片段的概率为99%。这里并未重新训练,它只是读取标准并据此判断。

0.99 → 非常像true 0.50 → 无法确定 0.01 → 非常像false

一次只放一个案例并非必要条件,但便于理解playground案例并控制变量:一个案例放入State,可同时放四个判断问题。跑完后换下一个案例,Questions不变,再比较结果。Jev的模型能力固然重要,但最终效果很大程度取决于Questions的写法——能否将判断标准写清楚,清楚到只剩封闭回答。这是Jev与海龟汤最相似之处:提问笼统,结果也只能不清不楚。

若Questions只写成“这封邮件草稿适不适合发送”,Jev仍会给出概率,但“适合”未定义,数字难以验证。只有将Questions拆解为:是否泄漏后台工作草稿?是否引入无依据的旧话题?是否混淆人物身份?是否未回应用户当前表达?是否出现语法错误?这样得出的概率才更易验证,并能被后续判断复用。

如何拿到大结果

同理,在日常工作中,当提交成果给老板时,老板也会经过一系列判定,在脑中跑过一组组questions:这个选题好不好?文章会不会爆?视频有人看吗?若能将判断标准拆分为具体封闭问题,把老板“炼”了,就能有效提高通过率,拿到大结果。

为测试可行性,我建了一个小型测试题,收集了几十条过往选题,脱敏后作为state案例,批量询问一组固定编辑判断问题。TypeSafe官方提供HTTP API和Python SDK;脚本向POST /v1/systemone发送state和questions,获取结构化概率。官方赠送了5美元试吃包,以低到贴地的价格来说绰绰有余。

从飞书里,我让Codex整理出一套测试选题,每个选题自动生成“生肉版+熟肉版”测试对:生肉版是选题灵感与碎片想法,熟肉版是最终文章。然后保存为本地JSONL,让Codex生成测试脚本。在飞书里,我已运行着一套简陋的打标系统,这次测试中,Jev的表现将与我的人工判定比较。Codex根据已有选题数据,为Jev初步设计了一套questions——不算实用,但与真实工作有脱节,用于测试足够。

从返回的report中,我仔细检查了输出和脚本,回顾了测试集中Questions的写法和判断思路。核心指标的高低排序与人工打标大致相符,除了“论断越界”它拿不准:有些题的熟肉版与生肉版差别过大,它无法判断是好的升级还是坏的越界。

不重要,黑红也是红,标题党搞出的爆款也算爆款,干就完事了。让Codex写完最后一个脚本,用一个全新选题验证:这个新选题仅处于草稿阶段,只有基本事实和描述,缺乏论点和论述方向,因此“结构性判断”仅22%,证据充分性仅8%。这与选题会议上的讨论结果相似,离把老板炼成丹又近一步。

最后打包所有内容,套上简单前端,一个选题判断器诞生了!直接把点子和闪念扔进去,就能获得一系列打分。即便同一热点,不同选题写法会带来不同评分。这比用LLM大模型更快更直观,且完全不用担心费用问题,5美元能用到天荒地老。

严格来说,这次并未真正炼出老板。Jev不知道老板是谁,也未学会某位领导变化多端的九游娱乐入口需求。整体上,它只将原本散落在选题会、改稿意见和编辑经验中的判断标准,压缩成一组可快速回答的问题。不过,虽未炼出电子老板,我却得到了一份老板也得照答的问卷。至于离真正炼成丹还差什么,大概只差把领导历年的“这个不行”全部喂进去,并承担由此产生的精神损失。

本文来自微信公众号“APPSO”,作者:发现明日产品的APPSO,36氪经授权发布。