最近有个AI热点概念:Jev,一款专门用来做判断的 AI 模型。
它和 ChatGPT、Claude 这类通用大模型不同:不聊天、不写代码文案,专门给程序做决策判断,API 调用后直接返回代码可读取的结构化结果
核心能力:
-
Noul 是非判断:输出 0~1 概率值,做二分类判定。例:校验接口返回是否符合预期。
-
Choice 多选判定:最多支持 255 个自定义选项,选出最优结果并附带置信度,适合 UI 自动化选择页面元素、判断业务分支。
-
Score 分级打分:2~10 档评分,用来评估风险等级、缺陷严重程度这类有强弱差异的场景。
最近有些测试同学对这方面感兴趣,我花时间调研并简单实践了一下,整理了这份**上手教程,以及分享一个UI 自动化方案基于 JEV 改造的案例,**感兴趣的小伙伴可以学习了解下。
获取 apikey
方式一:官方登录(优先)
访问:https://typesafe.ai/ 进行登录
登录后访问:
https://console.typesafe.ai/keys
左侧菜单栏进入apikeys,点击create key 创建 apikey
填写名称,点击创建即可
之后 apikey 记得保存一下
不过有时候可能会失败登录会失败,如下:
如果一直失败的话,则得考虑使用 openrouter 的方式了
方式二:openrouter
1、获取 apikey
访问:
https://openrouter.ai/~typesafe/jev-latest
点击 new key
填写名称、过期时间、费用限制等等,这里可以按需填写,之后点击创建
保存 apikey
2、费用充值
- 点击 credits,点击 add credits
最少只能充值 5手续费,手续费还是挺贵的
如果需要使用支付宝的话,可以点击
充值成功之后,就发现 OK 了
案例 1:官方 skill & 简单案例实践
基础介绍
这是 TypeSafe AI 官方出品的 Agent Skill(SKILL.md),专门给 Claude Code / Cursor / Cline 这类编码 Agent 使用,让 AI 自动学会正确调用 Jev(System One)决策 API,不是 MCP 服务,是Agent 指导能力包
目前在github上,已经有 1.4k 的收藏
当你在 Claude Code / Cursor 写代码时,加载这个 skill 之后,Agent 会自动知道:
-
Jev 只有 3 种原语:
Noul(0~1 概率是非判断)、Choice(多选一)、Score(打分) -
怎么构造
state、questions结构 -
并行一次性提交多条判断(核心特性,jev-ultrafast 就是靠这个)
-
正确解析 Jev 返回带置信度、概率分布的 JSON
-
写代码时自动引入 typesafe-sdk,生成合法调用代码,不会写出错误的 Jev 请求
如何使用?
1、安装skill
方式 1:Claude Code(推荐)
claude plugin marketplace add typesafe-ai/skillsclaude plugin install typesafe@typesafe-ai
方式 2:Cursor / Cline / 其他兼容 Agent
npx skills add typesafe-ai/skills --skill typesafe-ai
这里我们以 cursor 作为案例,打开终端,输入 y
之后按需选择对应的 agent 即可
之后就生成了 typesafe-ai 了
2、apikey 配置
这里注意的使用官方配置的 apikey,不能使用 openrouter 的
export TYPESAFE_API_KEY=xxx
在终端中执行:
3、案例验证
在 cursor 中,输入:
执行过程:
首先是它会利用cursor 自带的浏览器功能,去操作界面,不是每个步骤都会用到 jev 的
那什么情况会用到 jev 呢? 在需要做是非判断、打分、或者选择时
例如:在这个案例中,搜索 raina 测试的时候,可能会搜到很多的用户,就要做判断,因此就用到了 jev 了
可以看到在 cursor 中,它会构建 jev api 命令去做筛选
从多条数据中,筛选出最终的目标,并且输出置信度
最后输出结果,符合预期
案例 2:UI 自动化方案基于 JEV 改造
前面我们有讲到,在测试领域,我们也有不少需要做判断的场景,之前我们一般使用大模型做判断,成本相对高、速度也相对慢一些,这里我们就可以采用 jev 的方式去做改造了
改造思路
之前我们开发过一套 playwright+midscene 双策略进行 UI 自动化的 skill 工作流
在这套 skill 中 有不少过程是需要对多个选项做决策的,而这个就比较符合 jev 的特性,那我们看看有多少内容可以基于 jev 做改造
则有下面的改造
1、探索skill:snapshot 后可选调用 Jev,用于控件选择、下一步动作、计划完备度与 locator 风险判断;
2、修复skill:修复前用 jev 对失败原因做判断,判断大概率属于什么问题,然后采用不同的处理方案
skill 获取方式见文末
实操步骤
1、环境变量配置
创建一个.env文件,填写 jev 的 apikey
2、探索界面
在执行过程中可以看到,部分流程会去调研 jev 进行决策,决定操作哪个元素
最终产出计划文件
这里可以检查一下计划内容,如果没有问题的话,可以进行下一步,生成代码
3、生成代码
输入:
产出代码
4、执行代码
5、修复
出现问题,则走 skill 做修复
这里会使用 jev 判断失败原因,是否能够直接解决
最后多次修复代码,如果没有问题的话,就可以直接查看报告了
6、报告查看
报告列表
执行过程中的视频,可以用于判断是否正确
trace,记录了每步操作的记录
使用下来,jev的对于决策方面是具备一定的优势的,速度快且成本低,效果也相对不错,此前完全依赖于大模型进行推理和判断,而 jev 面向决策任务的专用小模型,但是目前我们还是可以观望一下
也许各大模型厂商会参考 jev 做升级和改造,不过我们还是可以基于自己agent 项目或者 skill 等等需要做决策、判断的逻辑接入 jev。
以上是今天分享的内容。Skill 包以及更多AI赋能测试的实战教程均已整理在**【Raina的AI&测试实战圈】**知识星球,跟着步骤操作就可以上手。感兴趣的小伙伴可以了解下哦~