2026年9月25日 · 作者:@limitlessdeng
把握度 0.89 的建议,是错的:我们在生产环境用 Jev 踩过的 4 个坑
Jev 最近在 AI 圈刷屏。我们用它给真实网站做 SEO 审计,换成 Jev 前后差在哪,以及踩过的 4 个坑,全部附真实数字。

Jev 这几天在 AI 圈刷屏了。
不会聊天、不会写文章、只会做选择题的一个模型,做它的 TypeSafe 刚在 9 月 15 日宣布了 4000 万美元种子轮。Daniel Agrici 用它做的开源 SEO 审计工具 Jev SEO,几天就拿了 100 多个星。
我在做 Loomaly,一个网站 SEO 审计工具。它的逐页判断、站内链接建议、转化检查,背后全是 Jev。
小白教程大家应该都看过了。这篇讲点教程里没有的:把 Jev 放到真实网站上跑,到底是什么样。
先说结论:Jev 值得用,主要是因为它逼着你想清楚「谁来拍板」。我们踩的坑,最后几乎都是加一行代码解决的。
换成 Jev 之前,我们有多惨
最早的 Loomaly,是让大模型一页一页读网站,自己写审计意见。
慢。一页要 53 到 170 秒。有一天跑了 190 次审计,163 次超时。
不稳。同一个页面审三次,报出三份不一样的问题清单。它还会编,比如报一个「颜色对比度太低」,可我们给它的数据里根本没有颜色。
贵。贵到每次只敢看 25 个页面,剩下的全靠猜。
用户看到一条问题,自己去核实,对不上,下次就不信了。
换成 Jev 之后

一次判断 1 到 2 秒,每个页面大约 $0.00003。便宜到可以每一页都判断,不用再抽样。给泡泡玛特整站跑一遍审计,Jev 的费用大约 1 美分。
结果也稳了。同样 153 个判断跑两遍,150 个一模一样。
拿不准的答案,直接丢掉,不展示给用户,也不算进分数。
站内链接建议的采纳率,从第一轮测试的 14%,到上线后的 80%。
下面是这个过程里踩的坑。
坑一:把握度高,不等于对
大家夸 Jev,最常说的就是「它会告诉你它有多确定」。
这是真的。但我们的数据说,这个数字没你想的那么管用。
我们让 Jev 判断「这句话该不该加一个站内链接」,然后拿用户真正采纳和拒绝的建议回头对照:
被采纳的,平均把握度 0.619。 被拒绝的,平均把握度 0.623。
几乎一样。
那一轮把握度最高的一条是 0.89。句子是「What are the alternatives to Google Analytics?」,要链到站内一篇讲 Google Analytics 替代品的文章。链接方向没错,可这句话是个 H2 小标题。没有哪个编辑会在标题里加链接。

Jev 对每条建议还会回答另一个问题:「这个锚文本写得好不好」,0 到 2 分。后来一轮对账里,这个分数拉得开:采纳的平均 1.63,拒绝的 1.39。所以现在我们的免费检查,只展示 1.4 分以上的建议。
别只盯着把握度。拿真实结果去对,留下那个真能分出对错的数字。
坑二:它只能根据你给它看的东西判断
第一次在泡泡玛特的网站上跑,Jev 说有 168 个页面「内容太单薄」。另一次,它说 56 个在售商品页「没有给顾客下一步」。
听着挺专业。其实全错。
那些商品页的内容是 JavaScript 加载出来的,我们抓到的是空页面。「加入购物车」这类按钮,我们也压根没传给它。它是对着一张白纸在判断。
怎么修的?两行代码:
正文不到 150 个字符,就不问它「内容单不单薄」,直接报「这个页面对不运行 JavaScript 的爬虫是空的」。
没抓到页面上的按钮,就不问「有没有下一步」。
Daniel 在 Jev SEO 里也遇到过一样的事:Jev 两次建议删掉写得好好的文章。他的办法也是一行代码,600 字以上的页面,不管模型说什么都不许删。
模型可以打分、可以排序,拍板的权力留给代码。
坑三:怎么问,决定了它怎么答
Jev 只做选择题,但题目怎么出,差别很大。
别用否定句问。「这个页面缺少作者信息吗?」这种问法,是我们记录里代价最高的一类错误。现在代码会在调用前直接拦掉否定句,一律改成「这个页面有作者信息吗?」。
别直接丢数字给它。Jev 读数字不太靠谱,页面长度这种信息,我们先用代码算好,换成文字描述再给它。
一次只问一个页面。有外部测试发现,把很多行数据塞进同一次判断,排序准确度能从 0.97 掉到 0.51。
坑四:第一次上线,50 条建议里 40 条是人家本来就有的链接
这个最丢人。
站内链接建议在测试环境里,采纳率一路从 14% 调到了 78%。然后上线,第一批 50 条建议里,有 40 条是用户网站上本来就有的链接。
测试脚本和线上读取「已有链接」的方式不一样,测试的时候根本没暴露出来。
那一轮直接作废。修好重跑,采纳率 80%。现在代码保证:已经存在的链接、用户拒绝过的建议,永远不会再出现。重复推荐一个已经有的链接,是最快让用户不信你的办法。
从 14% 到 80%,大头靠的是代码一条条挡掉 Jev 不该回答的情况。图片说明文字不算正文(那一轮 26 条拒绝里占了 14 条),目录条目不算,小标题不算,锚文本不能从一个词组中间截断。
如果你也想用 Jev
先想清楚谁拍板。能数的交给代码,Jev 只回答代码回答不了的「意思」问题。
拿真实结果校准。别迷信把握度,留下那个真能预测结果的分数。
给代码留否决权。删页面这种不可逆的事,别交给一个概率。
先看它读到了什么。页面是空的,再好的模型也只能瞎猜。
想看这套东西跑在你自己网站上是什么样:loomaly.com/check/你的域名,免费,不用注册。
致谢:Jev SEO 是 Daniel Agrici 的开源项目(github.com/AgriciDaniel/jev-seo,MIT 协议),Jev 模型来自 TypeSafe。文中数字来自 Loomaly 2026 年 9 月的设计文档、校准记录和生产运行记录;「0.97 掉到 0.51」来自外部基准测试。
查查你自己的网站
免费,不用注册。像爬虫一样读取你的 sitemap 和大约 20 个页面。
Free, no sign-up. We read your sitemap and about 20 pages.