如果“惊讶”本身就是伤害
把 proper scoring rule 从记分板搬进物理引擎:理解不是收藏品,而是玩家真正的防御力。
A game design thought experiment: the player carries an explicit belief distribution, encounters sample the world, and surprise becomes damage. The useful reward is not randomness—it is the later compression that makes future encounters cheaper.
从分数到物理
设想玩家的 build 不是一组攻击数字,而是对世界的显式信念分布。每次遭遇都是一次采样,实际发生的事越出乎预料,伤害越高。准备充分的玩家不一定输出更大,却更难被世界击穿。
这个机制的关键不是套用信息论术语,而是让“理解世界”成为能改变生存状态的物理量。
为什么奖励惊讶会走向老虎机
单纯奖励预测误差会遇到 noisy TV:随机噪声每一帧都很惊讶,却没有任何东西被理解。游戏里的退化版本就是只给稀有度尖峰、不提供可学习结构的掉落。
更好的闭环是:惊讶发生时造成伤害;玩家找到可验证的解释后,伤害被退还,未来同类遭遇也变得更便宜。奖励发生在世界模型被压缩的那一刻。
回到 Roguelike
这会改变 buff、经济和死亡结算的设计。信息型 buff 可以提前暴露弹幕或下一房间,尾部保险砍掉不可学习的致命黑天鹅;商店则允许玩家花资源购买确定性。
死亡必须开收据:告诉玩家伤害来自哪里、哪个规律没有看懂,并让这次学习进入下一局。可以死于“还没学会”,不能死于“根本不可能学会”。
让比喻接受玩测
纸面原型只需要申报分布、采样和结算三步。若玩家无法凭直觉理解,或移除这套机制后决策几乎不变,它就只是一块漂亮的仪表盘。
一个理论进入游戏的资格,不是它听起来深,而是它能产生别的规则无法替代的决定。