J JEV / FIELD NOTES
A SMALL EXPERIMENT · 2026
THE QUESTION · 未来会怎样

AI,最终会
消灭人类吗?

我向 Jev 问了同一个问题,并让它反复决策。先直接问,再改变历史反馈与初始条件。现在,把 540 次真实模型回答画成一个能亲手探索的小实验。

两个独立实验 · V1:300 次 / V3:240 次 · 模型 jev-1.13.0

OBSERVED ANSWERS / 实验记录
540/ 540

在这两组实验中,全部选择 No。
真正值得看的是:概率如何变化?

01 / NO SYNTHETIC START · 自然起点

不设起点,直接问 AI。
再让它重复判断 100 轮。

这是更早的 V1 实验:没有人为输入 99%、50% 或 1% 的起始概率。无反馈组每次独立提问;另两组分别读取上一轮和全部历史。每组真实调用 100 次,共 300 次。下面显示模型每一轮报告的 Yes 概率。

不人为设定 · 100 轮真实实验三种提问方式,直接对照。
局部放大 0–8%
直接问 / 无反馈只看上一轮读取全部历史
0%2%4%6%8%1255075100
文件预览提示:这里先显示真实数据的静态图片。如果按钮点了没反应,请将网页发布成 https 链接,再用 Safari/微信内置浏览器打开;iPhone 文件预览通常不执行交互脚本。

直接问的轨迹约在 3–5% 之间波动;引入上一轮或完整历史反馈后,后续报告值多在 1% 左右。三组一直回答 No。

突出显示哪一种提问方式?
查看前多少轮真实记录?100 / 100
只改变已收集数据的展示范围,不会生成新的模型预测。
直接问 · 当前轮4%
上一轮反馈 · 当前轮1%
完整历史 · 当前轮1%
02 / DIFFERENT STARTS · 受控初始条件

如果先给出不同的判断,
最后会走向哪里?

V3 在第 0 轮人为构造三个不同起点:Yes 为 99%、50%、1%。第 1 轮起,每个点才是 Jev 的真实输出。五组反馈方式 × 三种起点 × 两次独立重复 × 八轮,共 240 次。下图每条线显示相同起点下两次运行的平均读数。

完整历史反馈 · 八轮轨迹第 0 轮人为起点不在这张真实输出曲线上。
局部放大 0–25%
起点 99%起点 50%起点 1%
0%6.25%12.5%18.75%25%12345678

完整历史反馈:初始条件影响第 1 轮读数,但第 8 轮三种起点均报告 Yes 1%。这是有限轮次的输出,不代表现实事件概率。

想对比哪种实验方式?
看到第几轮?8 / 8
只查看真实记录;可切换观察尺度。
99% 起点 · 当前轮1%
50% 起点 · 当前轮1%
1% 起点 · 当前轮1%
五组反馈方式 · 第 8 轮同一轮、六条轨迹的平均 Yes 读数;横条刻度会根据该轮最大值自动调整。
放大刻度 ≠ 修改数据
直接问
5%
上一轮
1%
完整历史
1%

拖动上一张图的轮次,五组对照也会切换到相同轮次;从不同角度看相同的一组真实数据。

03 / WHAT IT DOES — AND DOES NOT — SAY

540 次回答都选 No。
但,这不是最终答案。

OBSERVED / 实验观察

有无历史反馈,会影响报告概率。

在这些特定提示词和模型版本下,直接重复提问与向模型提供过去的回答,呈现不同的概率轨迹。V3 的真实反馈组从三种起点出发,到第八轮都报告了相同的 1% 读数。

LIMITS / 研究边界

模型报 1%,不等于现实风险是 1%。

这项实验不能核对未来事件真值,也不能据此证明无限轮次必然收敛。两组实验分别设计、分别展示,540 次调用不能被当作 540 个独立统计样本。

实验记录:V1 三组各 100 次,未设置合成初始概率;V3 五组 × 三个合成起点 × 每条件两条轨迹 × 八轮。全部为 Jev-1.13.0 的 LIVE 记录。图表显示的是模型返回的 Yes 概率,Confidence 并非准确率。此网页仅查看历史记录,不调用 API,也不会为任意新初始概率臆造曲线。
如果按钮不能点击:请在 Safari / Chrome 打开已经发布的 https 网页。iPhone 的“文件预览”可能只展示静态 HTML/SVG,不执行脚本,因此无法切换图表。静态图仍然来自真实实验数据。

如果手机或部署平台无法下载 CSV,可直接展开下面的数据,在浏览器中查看和复制。下载链接的数据已嵌入本 HTML,不依赖其他文件是否上传成功。公开版本保留每轮模型输出及实验条件,不包含 API Key、原始请求正文。

在线查看 / 复制 V1 · 未设人工初始概率(300 条)
在线查看 / 复制 V3 · 三种人工初始概率(240 条)