chouheiwa, 快 10 年开发经验了 查看知乎原文 人眼对画错的影子几乎是瞎的,却能一眼识破一次假眨眼。这两件事放在一起,基本就是这个问题的答案。游戏厂商这几年把预算堆在光追、4K、毛孔级贴图上,玩家照样一眼看出 这是游戏 ,问题出在人眼根本就没在看厂商花钱的那些地方。 太长不看版 分辨率这条路早就过了人眼的分辨极限,往上堆几乎没有收益;光照错误人眼其实很难察觉,所以光追的钱花得最没回报感;出卖游戏的是脸、动作和世界的反应,因为大脑给这三样配了专用硬件,容差极低;越逼真越容易被抓包,机制是感知不一致,皮肤做到 8K 而眼睛还是木头的,比整体粗糙更假;真实感来自各个维度的一致性,单个维度的保真度堆得再高也换不来它。这个结论跟医学图像分割里 Dice 分数高但医生照样说不行,是同一件事。 分辨率这条路早就到头了 我一开始想弄清楚的是个很朴素的问题,就是 4K 到底比 1080p 真实多少。查下来这个问题在视觉科学里有定量答案。人眼中央视野的分辨极限,工程上常用的阈值是 60 像素 / 度 ,2024 年那篇 Resolution limit of the eye [1] 用实测数据把这条线画得更细,20 度偏心处中位观察者只有约 22 像素 / 度 ,95 分位也就 35 像素 / 度 。换算到客厅,3 米外看 55 吋电视,多数人已经分不出 1080p 的单个像素,4K 往 8K 走的收益接近于零 [2] 。 也就是说像素早就过剩了。电视厂商还在卖 8K,游戏 UI 里还有原生 4K 选项,但人眼这一端的带宽十年前就填满了。 GTA VI 上个月底那场扩展演示是个很好的反例材料。Digital Foundry 给的评价是这句: perhaps the most impressive showcase we've ever seen in real time rendering 大概是我们见过的实时渲染里最震撼的一次演示。 可它在标准 PS5 上跑的是原生 1440p、30 帧 [3] ,没用 FSR 也没用任何超采样,30 帧的上限还是 Zen 2 的 CPU 卡出来的。震撼全场的画面,分辨率停在七年前的水平。它赢在光线追踪的全局光照和反射,那分辨率之外的下一个嫌疑人,自然就是光。 《GTA VI》PS5 实机画面:日照同时落在骑手、车辆、路面与远处建筑上 《GTA VI》PS5 实机画面。真正撑住这一帧的不是某一块材质有多清楚,而是人物、车辆和环境像是被同一套光照规则约束着。图源:Rockstar Games,2026-08-27。 那光影呢?人其实看不出光照错了 这一段是我判断改得最大的地方。我最早以为出戏的第一来源就是光照,毕竟所有关于画面进步的宣传都在讲光追,Lumen、路径追踪、神经渲染,钱也都花在这。翻到感知心理学那一摞论文才发现,人对光照错误的敏感度低得离谱。 Ostrovsky、Cavanagh 和 Sinha 在 2005 年做过一组实验,Perceiving illumination inconsistencies in scenes [4] ,结论用的词是这个: remarkably insensitive to illumination inconsistencies 人对场景里的光照不一致惊人地迟钝。 Nightingale 等人 2019 年把题目收窄到影子和反射的错误 [5] ,结果是被试的整体检出率很差,错误细微的时候接近瞎猜。换句话说,影子方向画反了、水面的反射少了半张脸,多数人过场就过去了。这跟大多数人想的正相反。 举放大镜看影子画反的脸看不出问题,同一张脸眨一下眼它就按下了秒表 那光追的钱是白花了吗,倒也不是。光照对真实感的贡献走的是另一条路,它管的是 材质有没有活过来 ,而人对材质对不对是有感觉的。皮肤是最典型的例子,GPU Gems 3 第 14 章 [6] 给的数是皮肤反射光里约 94% 来自次表面散射,光线钻进皮肤几毫米再散出来,直接从表面反射的只占约 6% 。不做次表面散射,多边形再多也是塑料。这项技术在 2015 年被 Jimenez 那篇屏幕空间方案 [7] 压到了全高清一帧 0.5 毫秒 ,所以今天的 3A 角色脸上都有它。 UE5 的 Lumen [8] 解决的是同一类问题,间接光。房间里没被灯直接照到的角落是什么颜色,桌子底下有没有从地板弹回来的光,这些在过去靠美术手工烘焙,Lumen 让它全动态。但它也有自己的穿帮预算 [9] ,软件光追模式下 Lumen Scene 默认只覆盖相机周围 200 米 ,相机跑快了间接光会慢半拍跟上来。Nanite 那边则不支持骨骼动画角色和半透明 [10] ,也就是说场景可以有电影级几何精度,走在场景里的人还是老办法。 把这两段合起来看,光照的作用是把材质的可信度托住。能让人在半秒之内判定 这是游戏 的东西,得去人眼配了专用硬件的地方找。 出卖游戏的是脸和动作 1973 年 Gunnar Johansson 做了一个后来被引用了几千次的实验,point-light walker [11] 。他在人的关节上贴十几个光点,关灯,只放这些光点的运动给被试看。被试瞬间就能认出有人在走路,还能判断性别、情绪,甚至认出是熟人。十几个点,没有轮廓也没有材质。 后来的脑成像研究把这件事落到了具体脑区。Grossman 和 Blake 2002 年发在 Neuron 上的实验 [12] 显示,看光点行走者时颞上沟会特异激活,连梭状回面孔区都跟着亮。也就是说大脑给 生物运动 和 面孔 各配了一套专用电路,处理速度和敏感度都远超通用视觉。这两套电路就是游戏最容易被抓包的地方,因为它们从来不看多边形数,只看动作对不对、脸活不活。 脸这边最具体的证据是《死亡搁浅 2》。2025 年英国《在线安全法》上线之后,有玩家用照片模式里 Sam 的脸去过面部年龄验证,过了;PC Gamer 拿水獭帽版本复现 [13] 也过了。机器已经分不出这张脸是不是真人,人还是能。差别在动起来之后,眨眼频率、眼球微跳、视线焦点、口型和音素对不对得上,这些是脸部专用电路每天在真人身上校准的量。 手机正用《死亡搁浅 2》照片模式里的 Sam 做真人年龄验证 这不是官方宣传图,而是 PC Gamer 的实际复现:手机摄像头对着游戏里的 Sam,面部细节足以骗过真人年龄验证。图源:PC Gamer,2025-07-25。 《赛博朋克 2077》用的 JALI [14] 系统把口型和面部动画做到了十种语言程序化生成,已经是业内顶尖。它反而更能说明凝视为什么重要:对上视线时,玩家会专门发帖夸角色像在跟自己说话;Johnny 低头或把焦点落在别处时,人也会立刻读出 他没有看我 。这未必是动画错误,但大脑对眼神方向的判断,显然比对影子方向苛刻得多。 《赛博朋克 2077》对话画面:Johnny 说话时低头看向一侧,没有直视玩家 同一张脸、同一句对白,视线落点会直接改变玩家对“他是否在跟我说话”的判断。画面截自 4K 实机流程,图源:Point Zero,2021-01-05。 动作这边的敏感点更土,脚。动画混合的时候不锁脚的接触点,角色的脚就会在地面上滑,业内叫 foot sliding,解决办法是脚部 IK 把脚钉在地上 [15] 。问题在于 IK 有预算,MoCap Online 那份指南 [16] 给的数是两骨骼 IK 可以同时跑几十个几乎不花钱,全身 IK 在主机上只够前景 1 到 4 个 角色用。所以主角走路是稳的,街上第五个路人开始滑冰。玩家未必说得出 IK 这个词,但他的颞上沟看得一清二楚。 《New World》跑步动画异常的连续三帧:角色姿态与地面位移没有稳定对应 同一段实机故障录像的连续三帧。静帧里只是抬脚,连起来看却像脚下没摩擦力:动作在跑,身体的位移逻辑没跟上。图源:Reddit / u/nisbaj15,2021-10-17。 Naughty Dog 在 GDC 2021 [17] 讲过《最后生还者 2》的 Motion Matching,思路是放弃动画状态机,从动捕数据库里实时搜最接近当前姿态的下一帧,让角色从跑到停之间没有那种切状态的顿挫。这套技术之所以被反复提,说明它解决的是一件人眼特别在意的事。动作对了,脸对了,画面再粗糙也能过关;反过来,动作和脸不对,画面越精细越糟。这就到了这个问题最核心的一层,为什么越像越假。 越像越假,机制叫感知不一致 恐怖谷这个词大家都知道,它是森政弘 1970 年在《Energy》杂志上写的一篇随笔 [18] ,2012 年才有正式英译。原文只有一条手画的曲线,横轴是像人的程度,纵轴是亲和感,在快要像真人的地方猛跌一下。这条曲线四十多年来一直是个假说,真正的实证工作是最近十年做出来的,而且结论比原版精细得多。 MacDorman 和 Chattopadhyay 2016 年在 Journal of Vision 上那篇 Familiar faces rendered strange [19] 用了 365 名被试 ,变量控制得很干净。他们把人脸的各个特征分别调节真实度,皮肤、眼睛、眉毛、嘴,然后对比两种情况,一种是所有特征一起降低真实度,一种是只降其中几个。结果只有后者,也就是 特征之间真实度不一致 的脸,才引发被试的诡异感。后来同一组人用 548 名被试重跑 [20] ,进一步确认这种感觉来自不一致本身,跟这张脸是不是难以归类没关系。Kätsyri 等人 2015 年在 Frontiers in Psychology 的综述 [21] 把此前几十项恐怖谷研究过了一遍,分类困难那条假说几乎找不到支持,感知不匹配这条得到支持。 这就解释了为什么老游戏没有恐怖谷,PS2 时代的角色皮肤、眼睛、动作全都一样假,特征之间是一致的,大脑把它归到 画 这一类就不再计较。今天的角色皮肤做到毛孔级,次表面散射一应俱全,眼睛却还在按 30 秒眨一次的频率机械眨动,大脑把皮肤归到真人那一类之后,紧接着就在眼睛上撞了车。 把一块高清皮肤贴片贴到木头人偶脸上,人偶眼睛还是木头的 跨模态的不匹配也是同一回事。有一组实验把真人脸配上合成语音、机器人脸配上真人语音 [22] ,两种搭配都比各自一致的版本更诡异。所以真实感是一个 AND 关系,皮肤、眼睛、动作、声音、物理,任何一项掉队,其余的都白做。 至于大脑为什么这么干,预测编码给的解释最省事。Rao 和 Ballard 1999 年的模型 [23] 说视觉皮层一直在自上而下地预测接下来会看到什么,感觉输入进来只是拿来和预测做减法,剩下的差值叫预测误差,往上层传的只有这个差值。2025 年 Rideaux 等人在 Journal of Vision 上的实验 [24] 进一步显示,被违反的预期不光会被注意到,还会被优先处理,表征精度反而更高。 把这个机制套到游戏上,逻辑就通了。角色越接近真人,大脑调用的预测模型就越接近对真人的模型,而对真人的模型精度极高,眨眼间隔、重心转移、说话时眉毛的位置全都在里面。模型越精,容差越窄,同样一个小错,在卡通角色身上不产生误差,在照片级角色身上就是一个尖峰。 逼真是一种诅咒,它把读者的容差压到了最低。 公平起见还得说另一面。恐怖谷曲线本身的形状一直有争议,Bartneck 等人 2007 年用真人照片和各种机器人做对比,发现真人照片的好感度还不如一些玩偶型机器人 [25] ,提出恐怖悬崖模型,认为曲线右端根本不回升。这一点对游戏的启发反而更直接,它意味着追求照片级本身可能没有终点线,一致性才是能拿到手的东西。 16 毫秒砍掉了什么 游戏的假有一部分来自预算层,跟感知无关。皮克斯那个 The Science Behind Pixar [26] 项目公开过《Luca》的渲染数据,某个场景一帧要渲 50 小时 。游戏引擎在 60 帧下的预算是 16.6 毫秒 一帧,30 帧也只有 33 毫秒。50 小时是 18 万秒,除以 0.0166,两边差 约 1000 万倍 。 黑娃举着一个标着 16 毫秒的小秒表,旁边一座巨大的日历塔顶出画面 这个数解释了很多穿帮的来源。屏幕空间反射在物体移出画面时反射跟着消失,环境光遮蔽在物体边缘留一圈黑边,远处植被突然换模型,这些都是在 16 毫秒里主动砍掉的东西,工程上叫近似,感知上叫穿帮。DLSS 4 和 FSR 4 是 2025 年这一轮的新解法,NVIDIA 说 Transformer 超分模型比旧 CNN 快 40%、省 30% 显存 [27] ,AMD 的 FSR 4 也第一次转向机器学习时序模型 [28] 。但帧生成的代价也很具体,快速移动的元素和 UI 文字会出现重影和闪烁 [29] ,基础帧率越低越明显。换句话说,AI 生成的帧本身又引入了一种新的不一致。 这条路的尽头是 Genie 3。DeepMind 2025 年 8 月发布的这个模型可以从一句文字生成一个能实时走动的世界,官方数据是这样的: retaining consistency for a few minutes at a resolution of 720p 在 720p 分辨率下能维持几分钟的一致性。 24 帧每秒,记忆约一分钟 [30] ,超过这个时间走回头路场景会变。TechTalks 的评测 [31] 里记录了人物倒着走这类物理错误。同一段官方演示里,向前移动时完整的公路和护栏也会在几秒内退化成一整块泥面,再变成开阔水面。这里掉的不是分辨率,而是对象身份和空间关系。这个极端样本很干净,画面在像素级别很真,但底层缺少传统物理引擎那种刚性的一致性约束,一眼假来得比任何传统渲染都快。 Genie 3 官方演示的三个连续阶段:公路和护栏逐渐消失,最后变成开阔水面 同一段 Genie 3 官方交互演示的 16 秒、24 秒和 32 秒画面:局部纹理仍然像真的,公路与护栏的连续性却没有保住。图源:Google DeepMind,2025-08-05。 世界不回应你的时候 到这一步如果收尾,结论会是真实感取决于脸和动作,我当时确实差点就这么记下来。但有一类游戏不符合这个结论,《荒野大镖客 2》是 2018 年的作品,分辨率和材质放在今天都不算顶级,八年过去仍然是玩家口中最真的世界。它靠的是 NPC 对玩家的反应 [32] ,你身上有血污路人会躲,你蹲着走店主会盯着你,动物中弹部位不同会跛行或者挣扎。这些东西跟渲染管线一点


  • 情报分类:服务器与云资源
  • 分类依据:内容涉及服务器、云资源或网络线路
  • 信息来源:资讯 / 知乎日报
  • 发布时间:2026/9/28 07:20:13