它不是又一个会聊天的大模型。TypeSafe AI 在 2026 年 9 月 15 日放出的 Jev,定位是 System One / 决策模型:你给它一段状态(state),再塞一组事先定义好的问题,它不写段落、不吐 JSON 散文,只回三类答案——
Choice:从最多 255 个选项里选一个 Score:按你给的量表打分 Noul:是/否的概率(0–1)
每个问题大约耗时是 70–500 毫秒、输入 每百万 token 0.042 美元、输出免费。问题可以一次并行问很多个,延迟几乎不随问题数线性爆炸。所以它特别适合塞进 Agent 循环、浏览器点击、代码审查、高频交易这类「每一步都要做选择题」的场景。
按图索骥
这 20 个项目其实只有一条主线:大模型负责写和想,Jev 负责判和选。
1. jev-ultrafast:7 秒搜完 Google Flights
仓库:https://github.com/browser-use/jev-ultrafast
出品:Browser Use
这是目前生态里最炸的项目之一。它把网页变成一张「编号后的控件表」:按钮、下拉框、输入框各有编号。Jev 每一步只回答两件事——下一步做什么(点击 / 输入 / 选择 / 滚动 / 等待 / 完成),以及点哪个元素。只有选中「打字」时,才把城市名这类字符串交给一个小生成模型。
作者给出的标杆任务:苏黎世飞伦敦,Google Flights 完整搜索大约 7.1 秒(含页面加载和真实输入),中位 Jev 延迟约 178 毫秒。优化后浏览器协议调用从一千多次降到一百次左右。它不靠截图视觉循环,靠 DOM 快照和索引动作空间,所以快、也便宜。
适合:想做网页 Agent、但不想每一步都让大模型写一长段「我现在要点搜索按钮」的人。
2. fast-jev-compaction:压缩上下文,但不改写原文
仓库:https://github.com/tamaratran/fast-jev-compaction
Claude Code 自带 compaction 会让模型「总结」旧对话。总结一写,文件路径、报错原文、约束条件就容易丢。这个插件换了一种做法:把整段会话交给 Jev,对每条工具调用问「还需要吗」「输出要不要原文保留」。没用的删或截断,留下的 一字不改。用户和助手正文始终原样保留。
有人实测:Desktop 会话从约 18.8 万 token 压到 3.3 万,大约 1.4 秒、压缩率 82%。失败或压缩不够时会回退到官方摘要。社区也有 Codex 移植版,但 Codex 的 hook 不能像 Claude Code 那样直接替换压缩结果,效果会打一点折扣。
适合:会话里堆满 Read / Grep / Bash 输出、一压缩就丢关键证据的人。
3. json-render:Jev 不写 JSON,只选组件
仓库:https://github.com/vercel-labs/json-render
出品:Vercel Labs
json-render 是生成式 UI 框架:你先规定组件目录(按钮、表单、表格……),模型只能在目录里组界面。v0.21.0 加了实验性 Jev 组合器:Jev 不逐 token 生成 JSON,只在候选组件、属性和布局里做 Choice。代码再把选择拼成合法 spec,用现有 React / Vue / Svelte 等渲染器画出来。
Playground 里可以切到「Jev」模式,通过 Vercel AI Gateway 调用 typesafe-ai/jev。本质是把「生成 UI」从开放写作改成「在白名单里连连看」。
适合:做 AI 生成界面、又受不了模型写出非法 JSON 的产品团队。
4. typesafe-mcp:刚拿到 Key 的人,先装这个
仓库:https://github.com/itsmostafa/typesafe-mcp
作者 Mostafa 做的 Go 单二进制 MCP。装好后,Claude Code、Claude Desktop、Codex、Pi 都能直接调一个 evaluate 工具:把 state + Choice / Score / Noul 丢给 Jev,拿回带概率的结构化答案。没有提示词要维护,也没有 JSON 解析层。
原帖说「最适合刚拿到 API 的人」,就是这个意思——它不教你业务,只把 Jev 的三种原语接到日常 Agent 里。一条命令可完成注册。
适合:先验证「Agent 会不会主动去问 Jev」,再考虑更复杂的审查 / 路由插件。
5. jev-mcp:现成的判断工具箱
社区里叫 jev-mcp 的仓库不止一个,原帖指向的是「事实核验、内容筛查、语义排序、分类、信息提取」这一路。最完整、被引用最多的是:
https://github.com/jkudish/jev-mcp
它把常见判断收成十个 MCP 工具,例如:
jev_verify:主张 vs 证据,支持 / 矛盾 / 没说jev_screen:进上下文前先筛不可信内容jev_find/jev_rerank:语义找和重排jev_classify/jev_decide:分类和有界决策jev_review/jev_gate:看 diff、核对「做完了」的声明
一次调用大约 150–500 毫秒。Agent 仍然负责改文件、跑命令;Jev 只给类型化判决。另外还有面向编码循环的变体(如 burnigtm/jev-mcp),工具名会更偏 jev_coding_loop、jev_tool_route。
适合:已经在用 MCP、想给 Agent 加一层「廉价机械检查」的人。
6. SemDecide:Shell 里的语义 grep
仓库:https://github.com/sharziki/semdecide
作者把它叫做「意义版 grep、判断版 jq」。标准输入灌文本或 JSONL,它输出谓词、路由、分数、过滤后的流,以及稳定的进程退出码。不写 prompt,不解析散文,不确定时按你设的阈值走。
典型接法:爬虫结果先过一层相关性过滤;CI 里对 changelog / 告警文本分类;数据管道里按语义丢掉垃圾行。Jev 出判断,Unix 哲学管输入输出和失败码。
适合:运维、数据、爬虫脚本党,不想为一次分类拉起完整 Agent。
7. jev-codex-router:这一轮有多难,再决定用哪档模型
仓库:https://github.com/0xNatoshi/jev-codex-router
Codex 每一轮(含工具续写)先让 Jev 看任务难度,再选模型档位、思考深度、速度模式。简单改注释走便宜快档,碰架构 / 安全走强档。本地跑一个分类服务,再接到 Codex Router 的 jev/auto 提供者上。
注意:它只路由「下一轮该用谁」,不代替代码审查,也不保证质量分能豁免最终人工复核。同类还有面向 Claude Code + Codex 双端的 jev-router。
适合:订阅里有多档模型、心疼每轮都开满推理的人。
8. Winnow:上下文垃圾回收
仓库:https://github.com/GhalebDweikat/winnow
和第 2 条压缩不同,Winnow 发生在 工具结果刚出来、还没进上下文 的那一刻。大段 Read / Bash / Grep 会被切成约 25 行一块,Jev 对每一块问:「当前任务还需要这块吗?」
高相关、不确定:原文保留 确定不相关:换成三行占位(藏了什么、廉价模型写的一小段摘要、召回 key) 看起来像报错:一律不藏
全文缓存在本地,Agent 需要时用 key 取回。原则是:不确定就不能丢。 没有 Jev Key 时可用 Haiku 适配器顶上,但校准会差一截。
适合:动不动读整个大文件、上下文被日志淹没的 Claude Code 用户。
9. jev-review:审查前先把高风险改动挑出来
原帖强调「带本地看板」,对得上:
https://github.com/devagrawal09/jev-review
流程是分阶段判断,而不是一次让大模型写整篇 Review:
风险矩阵(Noul)→ 文件画像(Choice + Score)→ 抽证据 → 机制分类 → 严重度打分 → 再决定要不要交给更贵模型或人。
结果在本机看板 127.0.0.1:4317 里展开。另有 NiazMorshed2007/jev-review,走 MCP,给 Claude Code / Codex / Cursor / OpenCode 连续打质量维度分。两者都强调:Jev 打分,Agent 或人改代码。
适合:PR 太多、想先筛「周五能不能合」的团队。
10. Blink:把仓库当成要走的迷宫
仓库:https://github.com/ellipsis-dev/blink
不问「这段代码什么意思」,只问「下一层该进哪个目录 / 文件」。多个 walker 从根目录出发,Jev 给文件夹和文件名打分,高分路径分到更多 walker,直到落到文件。输出是一张表:每个文件收走了百分之多少的 walker。
它读的是路径和名字,不是全文件内容,所以快,也因此找不到「名字完全不像、内容却相关」的文件。适合「认证逻辑在哪」这类定位题,不适合当完整 Code Review。
适合:大仓库冷启动、先缩小范围再让大模型精读。
11. agent-desktop:读无障碍树,点下一个按钮
仓库:https://github.com/lahfir/agent-desktop
这是桌面自动化运行时,v0.9.2 起带了 jev-desktop 技能。系统无障碍树(按钮、菜单、输入框)被编成候选,Jev 判断下一步点谁、输入什么。飞标可以跟着元素走,便于录屏看决策。和 jev-ultrafast 是同一思路:屏幕是选项表,不是要看懂的照片。
同类还有 awlevin/typesafe-computer-use(macOS + OCR)。共同限制:无障碍树残缺、自定义绘制控件、验证码,都会让判断层失明。
适合:想把「电脑使用」从截图 VLM 换成结构化控件选择的人。
12. typesafe-mario:不看画面,读内存打马里奥
仓库:https://github.com/fhshaik/typesafe-mario
模拟器 RAM 被翻译成结构化 JSON:马里奥运动、跳跃轨迹、前方敌人、地形、近期操作效果。Jev 在封闭动作集里选一个:原地、右走、右跳、右跑、跑跳、跳、左走。默认每 8 帧决策一次。仓库不含 ROM,需自行合法准备游戏文件。
这是教学意义很强的例子:感知在代码里完成,模型只做选择。 去掉视觉,才能单独衡量决策质量。后续也有人做成多游戏实验室(马里奥 / 功夫 / Doom)。
适合:想直观感受 System One 在闭环控制里长什么样。
13. jev-drone:飞控保命,Jev 只做战术
仓库:https://github.com/RomanSlack/jev-drone
演示站:https://jev-drone.vercel.app
MuJoCo 里的四旋翼(Skydio X2 机模)只用机载相机飞五站障碍。几何控制器跑在控制频率上,负责稳定和安全;Jev 大约 2.5 Hz 看结构化态势,决定爬升、刹车、穿缝这类上层动作。作者把问题、选项和阈值集中写在战术层文件顶部,改策略改数字,不改提示词长文。
这是仿真,不是真机适航认证。但它把「判断」和「控制」拆开,对机器人、自动驾驶很有参考价值。
适合:做具身智能、想把大模型从内环拿出去的人。
14. OneVOneJev:浏览器里和 Jev 1v1
仓库:https://github.com/emrickgarrett/OneVOneJev
Three.js 第三人称 / FPS 竞技场,先到 5 杀。服务端 60Hz 模拟,Jev 每个决策 tick 在走位、视角、瞄准、开火、跳跃里做选择。Bolt-action 狙击,开镜稳定后才准,故意做成 MW2 式 quickscope。没 Key 时有启发式兜底。
它把「决策模型能不能进游戏循环」做成可玩的东西:延迟必须压在几百毫秒,输出必须是枚举,不能是一段作战分析。
适合:演示、录视频、或研究实时对抗策略。
15. jev-trader:每个 Monad 区块做一次买卖
仓库:https://github.com/jarrodwatts/jev-trader
演示:https://jev-trader.vercel.app
Kuru 上的 MON-USDC 订单簿,Monad 大约每 300 毫秒出一块。Jev 看盘口,回答买还是卖;程序挂 post-only 限价单,吃价差而不是吃单。作者报过模型延迟大约 81ms。没私钥默认空转;MODEL=jev 才走真模型。
口号很冲:「AI 比 Gas 还便宜。」但这是实验盘,不是理财建议。架构上仍然是:代码算中间价和库存,Jev 只做方向判断,硬风控一票否决。
适合:想看决策模型能不能进链上节奏,而不是真拿去梭哈。
16. Prism:判断市场状态,但不下单
原帖写得很明确:Jev 判断 toxic flow、市场压力、均值回归,再交给原有策略。社区目录里对应的是 irfndi 这一路 TypeScript 项目——故意不让模型碰下单键。
和 jev-trader 对照着看更清楚:
jev-trader:Jev 直接选买/卖 Prism:Jev 给「现在是不是有毒流 / 该不该收缩报价」这类状态标签,执行仍走你已经信任的规则
亏钱的那一步保持确定性,模型只负责难写规则的「读盘感觉」。另有 buberlo/jev-trader 把 regime、方向、toxic_flow、流动性压力拆成一次请求里的六个原子问题,思路同类。
适合:已有交易系统、只想加一层状态机,而不是把整盘交给模型。
17. neo4jev:在图上一次走一条边
仓库:https://github.com/jexp/neo4jev
作者:Neo4j 社区老兵 Michael Hunger
默认连 Neo4j 公开的 Companies 知识图谱。走到一个节点,就把出边(关系类型、属性、目标节点)列成 Choice,Jev 给出下一步该走哪条边的概率分布。路径和邻域用 neo4j-viz 画出来。schema 现场发现,不写死标签名。
这是 GraphRAG 的另一种走法:不是一次检索一堆邻居再让 LLM 写作,而是 语义走迷宫。适合「从这家公司找到相关投资人 / 竞品」这种跳步问题。
适合:已经把业务放进图数据库、需要可解释探索路径的人。
18. jev-curate:筛训练数据
仓库:https://github.com/AkashPriyadarshii/jev-curate
Rust CLI + Python(Polars / PyArrow)。JSONL / Parquet 流式读入,用预设量表做质量、相关性、风险判断,通过的进训练集,丢掉的另存。作者宣称可到每秒 1500+ 行(取决于并发和行长度),并强调输出 token 免费带来的成本优势。
预设包括数学推理等场景。它不做开放改写,只做「这条要不要留下」。对合成数据和预训练语料这种海量、重复、质量参差的东西,决策模型比聊天模型更对口。
适合:微调团队、数据平台,想先便宜地过一遍质量门。
19. Canny:不许 Agent 嘴硬说做完了
仓库:https://github.com/qkal/Canny
挂在 Claude Code / Codex 的 hook 上,记一本只追加、不改写的账本:改了哪些文件、跑过什么命令、退出码是多少、测试过没有。Agent 宣称「完成」时,先看账本里有没有证据。
原则写在 README 第一行:事实归代码,判断归 Jev,只有事实能否决。 没跑测试、没构建、刚改完就报完成,直接拦住。Jev 可以建议「这声明靠不靠谱」,但不能单凭概率放行。零运行时依赖,安装路径故意简单。
适合:被「我已经修完了(测试是红的)」折磨过的人。
20. killmyidea:创业点子的死刑判决书
仓库:https://github.com/monteduro/killmyidea
输入一段点子,一次请求并行问 10 个问题:8 个独立开发者视角的 0–4 分项(真问题、赚钱、切入、竞争……),外加品类和「这句话人能不能看懂」。加权平均后:
低于 50:KILL 50–64:FIX 65 及以上:SHIP
目标可切「赚钱 / 开源 / 好玩」,权重会变。没有生成模型写商业计划书,只有分数和判决。恶趣味,但把 Jev 的本职展示得很干净:多维度打分,最后落成三个动作。
适合:点子太多、需要一个不讲情面的过滤器。不当作尽职调查。