跳转到正文

Jev Playground:让一个不会聊天的 AI,自己做性格测试

做了一个只会做选择的 AI 实验室。让 Jev 自动完成 SBTI、16 型人格和 8values,看看它选了什么

• 麦极客
Jev Playground:让一个不会聊天的 AI,自己做性格测试

之前做「咱妈TI」,是让人来做题。这次换个考生:让 AI 自己做。

给它一套性格测试,不告诉它应该是什么人格,也不让它写一篇自我分析。只管选,做完再按题库的规则算结果。

它会选出什么?同一套题再做一次,结果会不会变?把中文换成英文,又会怎么样?

于是有了 Jev Playground,一个「只会做选择的 AI 实验室」。

在线体验:jev.maigic.top

Jev Playground 首页:一个不会说话的 AI,能玩出什么?

一个不会聊天的 AI

Jev 是 TypeSafe 的 System One 模型。它的输出很特别:没有长篇大论,也没有「好的,以下是我的分析」。你给它状态和问题,它返回选择、分数或判断,以及相应的概率。

在 Playground 首页,我把它的三种问题类型摆了出来:

类型做什么举个例子
Choice从给定选项里选择,并给出各选项的概率这道题选同意、中立,还是反对?
Score在有序标尺上打分这段话的情绪有多强烈?
Noul给出是或否的概率判断这句话是在讲反话吗?

对于性格测试,Choice 就很合适。题目和选项都已经有了,让它一道道选就行。没有思考过程,是对模型的快问快答。

第一间房:让 Jev 自己做题

目前开放的是「做题室」,放了三套题库:

  • SBTI:30 道题,27 种娱乐性人格,先看看它能有多抽象。
  • 16 型人格:40 题和 93 题两个版本,支持中英文。
  • 8values:70 道题,支持中英文,观察它在四组价值观坐标上的位置。

玩法很简单:选题库,选语言或题量,然后点 「让 Jev 自动做题」。

接下来就可以看它交卷了。题目会分批发给 Jev,每题选完以后,由浏览器里的计分代码计算最终结果。人格标签有对应的计分过程,也可以回头查看它每道题的选择。

做题室:SBTI、16 型人格和 8values,支持自动跑测与人工作答

页面也保留了「我来作答」。如果好奇自己和它有什么不同,可以自己做一遍,再回到记录里对照。

没想到它是“孤儿”

写这篇文章时,在线跑了一次 SBTI。30 道题做完,结果是:

SOLO · 孤儿。

题库配的文案是「我哭了,我怎么会是孤儿?」。放在一个不会聊天的 AI 身上,多少有点喜剧效果。

一次真实的 SBTI 运行结果:SOLO,匹配度 63%,平均置信度 37%

不过,往下看比只看标签有意思。

这次页面显示,SOLO 的匹配度是 63%,整套题的平均置信度是 37%。这两个数字不是一回事:前者来自题库计分,后者来自模型每道题返回的置信度。都不能直接读成「它有多大概率真的属于这个人格」。

结果页还保留了逐题选择与置信度,以及模型版本、耗时和输入 token 数。截图中的这次运行使用的是 jev-1.13.0。值得注意的是它极快的速度,可以说是秒答了。

所以,这张图记录的是这个模型在这一次运行里的表现。至于下次是不是还会测出 SOLO,得再跑一次才知道。

它是稳定的吗?

有了记录,玩法就不止「测出一个标签」了。

同一套题重复跑。 最终类型是否一致?如果变了,是哪些题的选择发生了变化?那些题上一次的置信度又是多少?

中英文各跑一次。 16 型人格和 8values 都有语言切换,可以分别保存结果,观察不同语言版本下的选择。当然,翻译措辞本身也可能影响结果,不能一看到差异就急着下结论。

现在这些对照主要靠查看各次记录,还没有做成自动对比报告。但光是把每次的选择留下来,就已经比看完一个标签、关掉页面多了一点可玩的东西。

它仍然是个娱乐性实验。给 AI 做人的问卷,观察到的是它对这些题目的响应,不能据此认定它真的有某种人格。

技术上很简单,只是网页+API

这次用了 React + Vite,线上部署在 Cloudflare Workers。

前端负责页面、题库、计分和本地记录;Worker 负责代理 API 请求和管理共享额度;Jev 负责回答题目。

为了让大家点开就能试,站里放了共享的默认 API。不填 key 也能跑,但有每日全站共享额度,用完要等北京时间零点重置。页面右上角会显示剩余调用次数,一套题可能需要多次调用。

也可以填自己的 API key。key 只保存在当前页面内存中,通过同源代理发送;测试草稿和结果则保存在当前浏览器里,暂时没有账号和跨设备同步。

下一间房,想让它玩游戏

Playground 里还有一间「游戏室」,目前是企划页,还不能玩。

排队的想法有猜拳、狼人杀和德州扑克。

这些游戏看起来差得很远,但都有适合让 Jev 做选择的时刻:赛车要不要冒险超车,狼人杀该怀疑谁,扑克这一手跟注还是弃牌。

比如赛车,车辆的位置、碰撞和物理模拟照常由代码处理。到了需要判断的时候,再把路况整理给 Jev,让它选择保位还是进攻。以后还可以试试按概率选动作,让不同偏好的车手跑出不同的比赛。

先把做题这件小事跑通,再慢慢给这个不会聊天的 AI 找点别的事情做。

去给它发一张卷子

在线体验:jev.maigic.top

开源仓库:Maigic-AI/jev-playground

项目代码采用 MIT License,第三方题库的来源与许可证在仓库里单独列出。

欢迎来玩,目前有一个月5刀刀免费额度。可以先从 30 题的 SBTI 开始,看看你那一次跑出来的 Jev,还是不是 SOLO。

本文主要由 AI 辅助生成,配图来自线上页面的实际截图。