在 grill-me 的基础上,GPT 多问了一个数字
GPT 多问的 0 到 100 分把握度,让一次答对背后的认知状态显现出来。

一、一份“无懈可击”的学习报告
前段时间,我给一位几乎零基础的新同学做了一次 Codex 入门培训。培训结束后,我让他交一份学习报告,梳理一下所学的内容。
坦白说,这份报告写得四平八稳——该讲的概念都覆盖了,结构完整,几乎挑不出毛病。但正因如此,我反而很难判断他到底吃透了多少。
我没有拿着报告逐条考他,也没有干巴巴地问“掌握得怎么样”。而是突发奇想,和 GPT 聊起了一个叫 grill-me 的玩法:它会围绕你的回答,像剥洋葱一样一轮轮地追问,直到你把那些含糊其辞的判断、潜意识里的前提全部交代清楚。
我问 GPT:能不能参考这个思路,快速搭一个小项目?不为打分,只为帮新同学测出他的真实水平和提升空间。
二、GPT 意外多问的一个数字
不到十分钟,项目就跑通了。
它保留了“极限追问”的内核:抛出一个陌生情境,等新同学回答后,再沿着他的思路步步紧逼,追问依据、条件变化和后续行动。全程不给标准答案,也杜绝了对培训材料的机械复述。
但在这些常规设定之外,GPT 意外地给每次回答增加了一个硬性要求:
请同时给出你对这个答案的把握度(0 到 100)。
起初,我没太在意这个细节,直接把测试发给了新同学。
做了几轮后,他跑来问我:“加上这个主观数字是不是没什么意义?反正也不算进成绩,填多少全凭感觉。”
直到那一刻,我的注意力才真正停留在这个名为“把握度”的数字上。
他质疑得有道理。一个人填了 80,不代表他真有 80 分的水平;填了 100,更不会让原本错误的答案变成真理。
这个主观的数字,确实无法作为衡量成绩的标准。
三、答案之外的第二条轴
传统的考试,往往只会留下一个二元结论:对,或者错。
但现实要复杂得多。同样是“答对”,背后可能是深刻的理解,可能是对模糊结论的死记硬背,甚至可能只是碰巧蒙中。然而在最终呈现的分数里,它们都会被粉饰成一个无可挑剔的“对”字。
看到这个“对”,我们很容易心安理得地停下脚步,暗示自己:我答对了,我会了,我彻底掌握了。
答错固然会暴露无知,但“答对”,反而更容易掩护无知。
可是,当答案旁边被强行挂上一个“置信度”时,单凭一个“对”字就不够了。如果你的答案是对的,但置信度只填了 60,那缺失的 40 去了哪里?
这个数字开始让人如芒在背。它像一根刺,让你无法再借着一次侥幸的“答对”,轻轻放过自己认知上的盲区。这就是 GPT 为这场问答补上的第二条轴:
答案,用来回应题目;而置信度,用来拷问内心——你到底有多相信自己是对的?
当这两条轴交汇,同一个“答对”,就不再自动等同于“已经掌握”。
四、100 不是满分,而是认知移动的坐标
一旦将“对错”与“置信度”这两条轴交叉,知识的评估就不再是非黑即白的平面。
在这个新展开的维度里,最值得警惕的,是出现这样一种极端组合:一个完全错误的答案旁边,极其自信地标着 100 的把握度。
这暴露出的已不仅仅是一个知识盲点,而是一块巨大的、当事人毫无察觉的“认知黑洞”。地图上明明没有空白,现实的马路却早已断裂。当一个人带着 100% 的确信填下错误答案时,AI 会冰冷地戳破这份“完全掌握”的错觉。
如果我们把答案的“对错”作为横轴,把置信度的“高低”作为纵轴,原本非黑即白的学习结果,瞬间就展开成了四个象限:
- 答对 + 高置信度:最接近“掌握”的理想状态,客观事实与自我认知高度统一。
- 答对 + 低置信度:说明“正确”并未消除内心的不确定性,是实力还是运气,尚待验证。
- 答错 + 低置信度:这并不可怕。敢于打低分,说明“未知”已经进入了视野。
- 答错 + 高置信度:最致命的“不知道自己不知道”——那个写着 100 分的错误答案。
在这个坐标系里,100 不是满分,30 也不是低分。脱离了具体的答案,它们只是虚无的主观感受;只有与答案锚定,它们才真正化作一个人衡量自身所处位置的坐标。
更关键的是,这个数字必须是流动的。
在 AI 的极限追问下,哪怕最初有着 90 的把握,也可能在一轮轮拆解中降到 50。这种数字的下跌绝不是退步,恰恰是我们重新定位自我的过程。相反,如果客观事实已被推翻,主观的置信度却依然死死咬定 100 不放,那真正停滞不前的,其实是我们更新认知的能力。
学习,从来不是让置信度简单粗暴地从 60 涨到 100;而是当新证据出现时,这个数字知道自己该往哪里移动。
我这才恍然大悟:GPT 多问的这个数字,自始至终都不是用来排名的分数。它不负责衡量你在这个世界里懂了多少,它只负责照出,你的“自信”与“真实”之间,到底还有多远的距离。
