2026年9月25日 · 作者:@limitlessdeng

把握度 0.89 的建议,是错的:我们在生产环境用 Jev 踩过的 4 个坑

Jev 最近在 AI 圈刷屏。我们用它给真实网站做 SEO 审计,换成 Jev 前后差在哪,以及踩过的 4 个坑,全部附真实数字。

Jev 这几天在 AI 圈刷屏了。

不会聊天、不会写文章、只会做选择题的一个模型,做它的 TypeSafe 刚在 9 月 15 日宣布了 4000 万美元种子轮。Daniel Agrici 用它做的开源 SEO 审计工具 Jev SEO,几天就拿了 100 多个星。

我在做 Loomaly,一个网站 SEO 审计工具。它的逐页判断、站内链接建议、转化检查,背后全是 Jev。

小白教程大家应该都看过了。这篇讲点教程里没有的:把 Jev 放到真实网站上跑,到底是什么样。

先说结论:Jev 值得用,主要是因为它逼着你想清楚「谁来拍板」。我们踩的坑,最后几乎都是加一行代码解决的。

换成 Jev 之前,我们有多惨

最早的 Loomaly,是让大模型一页一页读网站,自己写审计意见。

慢。一页要 53 到 170 秒。有一天跑了 190 次审计,163 次超时。

不稳。同一个页面审三次,报出三份不一样的问题清单。它还会编,比如报一个「颜色对比度太低」,可我们给它的数据里根本没有颜色。

贵。贵到每次只敢看 25 个页面,剩下的全靠猜。

用户看到一条问题,自己去核实,对不上,下次就不信了。

换成 Jev 之后

换成 Jev 前后对比:每页耗时从 53–170 秒变成 1–2 秒,每一页都判断,结果 150/153 一致,拿不准的直接丢掉

一次判断 1 到 2 秒,每个页面大约 $0.00003。便宜到可以每一页都判断,不用再抽样。给泡泡玛特整站跑一遍审计,Jev 的费用大约 1 美分。

结果也稳了。同样 153 个判断跑两遍,150 个一模一样。

拿不准的答案,直接丢掉,不展示给用户,也不算进分数。

站内链接建议的采纳率,从第一轮测试的 14%,到上线后的 80%。

下面是这个过程里踩的坑。

坑一:把握度高,不等于对

大家夸 Jev,最常说的就是「它会告诉你它有多确定」。

这是真的。但我们的数据说,这个数字没你想的那么管用。

我们让 Jev 判断「这句话该不该加一个站内链接」,然后拿用户真正采纳和拒绝的建议回头对照:

被采纳的,平均把握度 0.619。 被拒绝的,平均把握度 0.623。

几乎一样。

那一轮把握度最高的一条是 0.89。句子是「What are the alternatives to Google Analytics?」,要链到站内一篇讲 Google Analytics 替代品的文章。链接方向没错,可这句话是个 H2 小标题。没有哪个编辑会在标题里加链接。

被采纳和被拒绝的建议,Jev 给的把握度分别是 0.619 和 0.623,只差 0.004;锚文本评分分别是 1.63 和 1.39

Jev 对每条建议还会回答另一个问题:「这个锚文本写得好不好」,0 到 2 分。后来一轮对账里,这个分数拉得开:采纳的平均 1.63,拒绝的 1.39。所以现在我们的免费检查,只展示 1.4 分以上的建议。

别只盯着把握度。拿真实结果去对,留下那个真能分出对错的数字。

坑二:它只能根据你给它看的东西判断

第一次在泡泡玛特的网站上跑,Jev 说有 168 个页面「内容太单薄」。另一次,它说 56 个在售商品页「没有给顾客下一步」。

听着挺专业。其实全错。

那些商品页的内容是 JavaScript 加载出来的,我们抓到的是空页面。「加入购物车」这类按钮,我们也压根没传给它。它是对着一张白纸在判断。

怎么修的?两行代码:

正文不到 150 个字符,就不问它「内容单不单薄」,直接报「这个页面对不运行 JavaScript 的爬虫是空的」。

没抓到页面上的按钮,就不问「有没有下一步」。

Daniel 在 Jev SEO 里也遇到过一样的事:Jev 两次建议删掉写得好好的文章。他的办法也是一行代码,600 字以上的页面,不管模型说什么都不许删。

模型可以打分、可以排序,拍板的权力留给代码。

坑三:怎么问,决定了它怎么答

Jev 只做选择题,但题目怎么出,差别很大。

别用否定句问。「这个页面缺少作者信息吗?」这种问法,是我们记录里代价最高的一类错误。现在代码会在调用前直接拦掉否定句,一律改成「这个页面有作者信息吗?」。

别直接丢数字给它。Jev 读数字不太靠谱,页面长度这种信息,我们先用代码算好,换成文字描述再给它。

一次只问一个页面。有外部测试发现,把很多行数据塞进同一次判断,排序准确度能从 0.97 掉到 0.51。

坑四:第一次上线,50 条建议里 40 条是人家本来就有的链接

这个最丢人。

站内链接建议在测试环境里,采纳率一路从 14% 调到了 78%。然后上线,第一批 50 条建议里,有 40 条是用户网站上本来就有的链接。

测试脚本和线上读取「已有链接」的方式不一样,测试的时候根本没暴露出来。

那一轮直接作废。修好重跑,采纳率 80%。现在代码保证:已经存在的链接、用户拒绝过的建议,永远不会再出现。重复推荐一个已经有的链接,是最快让用户不信你的办法。

从 14% 到 80%,大头靠的是代码一条条挡掉 Jev 不该回答的情况。图片说明文字不算正文(那一轮 26 条拒绝里占了 14 条),目录条目不算,小标题不算,锚文本不能从一个词组中间截断。

如果你也想用 Jev

先想清楚谁拍板。能数的交给代码,Jev 只回答代码回答不了的「意思」问题。

拿真实结果校准。别迷信把握度,留下那个真能预测结果的分数。

给代码留否决权。删页面这种不可逆的事,别交给一个概率。

先看它读到了什么。页面是空的,再好的模型也只能瞎猜。

想看这套东西跑在你自己网站上是什么样:loomaly.com/check/你的域名,免费,不用注册。

致谢:Jev SEO 是 Daniel Agrici 的开源项目(github.com/AgriciDaniel/jev-seo,MIT 协议),Jev 模型来自 TypeSafe。文中数字来自 Loomaly 2026 年 9 月的设计文档、校准记录和生产运行记录;「0.97 掉到 0.51」来自外部基准测试。

查查你自己的网站

免费,不用注册。像爬虫一样读取你的 sitemap 和大约 20 个页面。

Free, no sign-up. We read your sitemap and about 20 pages.