锐评续篇 · 2026 年 9 月 24 日

200 倍的营销,
0.46 的实测

Jev 发布第八天:官方把「快 200 倍、便宜 400 倍、零幻觉」讲成神话,独立开发者把它拉回地面——哈希数据上它的判断能力是 0.46,比瞎猜还差。祛魅之后,剩下什么才真正值得抄?

对象:TypeSafe · Jev · 独立实测 基调:拆解,非吹捧 口径:官方数字 vs 第三方实测分开标注
主旨

一页看懂

Jev 一周内走完了从「爆火叙事」到「独立祛魅」的完整过山车。官方卖的是故事,实测拆的是工程;而祛魅之后剩下的那部分——「判断 = 函数调用」——恰好是 Agent 产品最该抄的范式。

判断 01

火的不是能力,是叙事。RLHF 反叛者人设 + 千万级围观 + 4000 万美元背书,「零幻觉、输出免费」一句比一句抓眼。但六组独立实测里,Jev 单独使用从未稳定赢过强基线,最差时只有 0.46。

推文围观从 967 万涨到 3700 万
判断 02

三个头条数字全是「带限定的真话」:193.6 倍、444.6 倍是官方自测上限,测试集自家团队构建;「零幻觉」是格式保证,不是正确率保证。转述时限定词全被剥掉了,这是教科书级传播。

官方博客自己承认的限定
判断 03

它最值钱的「校准置信度」,恰恰最缺独立大样本验证。现有实测只证明「方向对、幅度收」(头等舱女性真实生还 0.97,它给 0.79),离「95% 把握 = 95% 正确」的自动化红线还差一整套证据。

校准是卖点,也是黑箱
判断 04

生态爆发是真的,护城河是假的。6.6k 星的浏览器 Agent、LangChain 集成、40 秒分析 724 条广告——需求真实;但复刻成本极低(OpenJev、jev-visual 均已 MIT 开源),国产跟进会迅速抹平先发。

生态的火 ≠ 供应商的墙
判断 05

对做产品的人,正确姿势是「抄范式、别押供应商」:当特征用、问法即超参数、冷启动先验、校准闸门——这些已被 MIT 开源的实测仓库验证,今天就能在你的数据上落地。

行动建议见第六部分
第一部分

先对质:官方说的,和实测说的

同一件事,两套口径,限定词决定真相

官方口径
独立实测口径
「快 20–200 倍」端到端 70–500ms;首页挂 193.6 倍
LangChain 实测 0.44 秒/次广告分析中位 216ms/条——快是真的,但这是小任务上的数字,且官方承认 193.6 倍是「真实收益上端」
「便宜 40–400 倍,输出免费」输入 0.042 美元/百万 token
21 万次判断总成本不到 3 美元——价格数量级是真的;但「输出永远免费」没有商业模式支撑,只开放候补
「零幻觉」schema 保证,数学上不可能输出非法值
7 处埋错只找出 6 处哈希特征数据上 AUC 0.46(比瞎猜差)——它不编造,但可以错得离谱;零幻觉≠不错
「校准置信度」RLCD 训练,95% 把握≈95% 正确
实测「方向对、幅度收」泰坦尼克头等舱女性真实生还 0.97,它给 0.79;校准的独立大样本验证尚未出现
「System One,全新类别」软件直接依赖的决策接口
「最好的位置是当特征」六组实验里它单独用从不稳定赢基线,加进强模型每次都显著提升——叙事说取代,实测说外挂
官方博客六项局限原文:工作流评测由自家模型能力团队构建、对照 LLM 用了自家封装层(更慢更贵)、演示查询简化、Doom 用结构化状态非图像、维基竞速对手开非推理模式。 出处:TypeSafe 官方博客|掘金·六组实验独立实测|机器之心/投资界

把官方数字按「技术路线参考」读,别按「产品承诺」读——这是官方自己标注的阅读方式,也是被传播剥掉的那一层。

第二部分

为什么一周就祛魅

四个机制,决定它从神话到地面的速度

机制一:叙事引擎是顶配

「参与发明 ChatGPT 的人说 RLHF 跑偏了」——这是行业里最贵的人设。推文围观 967 万到 3700 万,DCVC 4000 万美元背书,Wasp CEO 录视频解读,连 OpenAI 内部红人都在转发。发布本身被设计成了事件:反叛故事、口号化数字、稀缺的候补名单,每一层都在放大传播。

机制二:便宜到人人可验证,真相来得太快

这是最反「传统大模型」的一点:21 万次判断不到 3 美元,意味着任何人都能大规模实测。官方故事的保质期取决于实测速度,而实测成本低到可以忽略——所以只用了三天,独立开发者就拿出了「单独不赢、0.46 AUC、问法敏感」的反证。祛魅不是被黑,是价格太便宜,验证太容易。

机制三:生态用脚投票,不管叙事真假

开发者不关心校准有没有大样本验证,先接 API 试:浏览器 Agent(jev-ultrafast,6.6k 星)、Claude Code 上下文压缩(fast-jev-compaction 及其移植版)、724 条广告 40 秒分类、LangChain 的 Jev-as-a-Judge——「智能 if 语句」这个需求被反复证明为真。生态的火是真的,只是它烧的是范式,不是 TypeSafe 的壁垒。

机制四:平台化苗头 = 生死战开始

API Key 已可申请(console.typesafe.ai)、REST/gRPC、LangChain 与 Vercel AI Gateway 适配器出现——Jev 正在从「爆款 demo」走向「基础设施」。而基础设施的战争打的是:免费输出能烧多久、校准能否在真实大样本上成立、复刻潮(OpenJev、jev-visual)会不会把价格和心智同时拉平。这一周的热度,只是开场。

第三部分

反直觉判断

越是刺眼的结论,越要钉死证据

① 「零幻觉」最抓眼球,却最不值钱;值钱的是校准,而校准恰好最缺证据
现象全网传播集中在「零幻觉」;官方最核心的卖点其实是 RLCD 校准。
本质零幻觉只是格式合规,对商业价值几乎零贡献;校准才是「敢不敢自动化」的开关。营销重点和工程短板完美错位。
影响采购方若按「零幻觉=不会错」决策,会在 0.46 和 6/7 上付出代价。
② 「输出免费」不是让旧事变便宜,是赌新用途爆炸——但 4000 万烧多久?
现象输出 token 永远免费,官方称便宜到不值得计量。
本质Jevons 悖论:价格打到底,用量总量爆发,卖的是「决策流水线」的入口。策略本身精妙,但免费输出 + 候补阶段 = 纯烧钱换心智。
影响商业模式是全场最大的未解之谜;依赖它的业务,必须备好替代(开源复刻即可)。
③ 官方说「新类别取代生成」,实测说「最好的位置是当特征」
现象官方定位:软件直接依赖的决策接口,替代人类过审;实测结论:单独用不赢,当第二信号显著赢。
本质一个声称取代,一个证明互补——后者有 21 万次判断背书。Jev 的真实价值是「世界知识外挂」,不是「模型终结者」。
影响把 Jev 当特征/筛选器用的人赚了,当「万能判断器」用的人会摔。
④ 最火的演示,全是它最窄的区间
现象Doom、浏览器点击、广告分类、Agent 验收——全部是结构化状态、有限选项、语义型任务。
本质「信号在语义里」它强(泰坦尼克 0.83);「信号在行为日志里」它废(哈希 CTR 0.46)。商业数据的大头恰恰是后者。
影响选场景前先问:一个懂行的人不看你的历史数据,凭文字能猜个大概吗?答不上来就别用。
第四部分

价值链:机会正在哪里沉淀

祛魅之后,钱和机会的流向反而更清楚

模型层 先发但薄 · 正在稀释

TypeSafe 先发,但权重黑箱、校准无大样本验证、免费定价烧钱;OpenJev 等开源复刻 + 国产开源跟进会把价格和心智同时拉平。模型层不是好生意。

集成/执行层 高度分散 · 正在爆发

浏览器 Agent(6.6k 星)、上下文压缩、Agent 验收、广告分析、MCP 服务——「判断接入场景」的窗口开着,谁先在一个高频动作里用熟「判断=函数调用」,谁吃到第一波。

验收/方法论层 全新空白 · 方法论即资产

独立实测五仓库(全部 MIT 开源)示范了怎么测校准、怎么避免评审循环自欺、怎么把 Jev 当特征。校准验证、判对/判错样本库、置信度闸门——这些是无人占领的新资产。

对内容与产品团队:判断类需求(审核、路由、标签、打分、冷启动先验)正在进入「几分钱跑百万次」的区间,但先决条件是「信号在语义里」。这条新成本曲线谁先接上,谁重新定义交付质量。

第五部分

三种情景

研判,非精确预测

乐观 · 约三成30%

校准在独立大样本上被验证成立,决策模型成为 Agent 标配,「智能 if 语句」铺进千万级调用;TypeSafe 扛过烧钱期,成为判断层基础设施,集成层生态爆发。

基准 · 约五成50%

Jev 成为「高速分类器 API」之一:范式被广泛采纳,供应商被稀释。开源复刻 + 国产跟进 + 大厂同款上线,TypeSafe 变成细分供应商,生态和复刻者赚走大头。

风险 · 约两成20%

候补转正式后,校准争议或稳定性问题被大规模曝光;免费定价撑不住商业化节奏;「决策模型」叙事降温为「又一个分类 API」。范式已扩散,复刻者接盘。

第六部分

行动建议

抄范式,别押供应商——全部现在可做

1
别排队等 Jev,范式已经开源

OpenJev、jev-visual(MIT)已经把「共享上下文 + 候选直接打分」做成可运行代码;用 DeepSeek/GLM/Qwen 就能本地复刻,成本可忽略(参考:21 万次判断不到 3 美元)。

2
抄方法论,不抄模型

问法即超参数(「这是什么」多数时候比「会怎样」准)、评审别用被测模型自己、钉死模型版本、真值亲手读——zhuyansen 五个 MIT 评测仓库直接可参考。

3
第一落地场景:冷启动先验

新内容、新账号、新类目没有历史数据时,判断类能力零样本约等于几百条标注。审核、路由、标签、打分——这是内容工具最现实的第一刀。

4
预研「校准闸门」,但先自建样本库

置信度阈值自动化(≥95% 自动执行)需要校准验证集支撑;自建「判对/判错样本库」既是前提,也是未来可复用、可出售的数据资产。

5
设 90 天观察窗

跟踪:jev-ultrafast 星数增速、OpenJev 成熟度、国产模型「结构化决策」跟进、TypeSafe 商业化(免费输出能撑多久)。四根指针决定自研还是采购。

Jev 的一周教会我们两件事:好的叙事能让一个模型八天涨粉 3700 万;好的实测能用 3 美元把它的边界钉死在数据上。祛魅不是坏事——它把「哪个模型会赢」的问题,换成了「哪条范式值得抄」的问题。答案已经很清楚了。

本文为动态调研的研判性总结 · 非投资建议 · 官方与第三方数据均标注来源

附录:事实与来源清单

按时间排列,可点开复核

时间事件来源
09-15TypeSafe 发布 Jev,开放早期访问(候补)机器之心/投资界
09-16Almeida 推文爆火,官方博客发布官方博客|IT之家
09-17Mike Taylor 实测:0.7 秒 777 次判断,7 处埋错找 6 处人人都是产品经理
09-18OpenJev、jev-visual(MIT)等复刻潮腾讯新闻|GitHub
09-19zhuyansen 六组实验:单独不赢、当特征显著赢、0.46 反例掘金|五个 MIT 仓库
09-20LangChain Jev-as-a-Judge(0.44s/次);724 条广告 40 秒分类机器之心/投资界
09-21建投证券研报:关注 Agent 应用效率腾讯新闻
09-22Jev API Key 开放申请(console.typesafe.ai)TypeSafe 官网|腾讯新闻