开放问题
运动定义文字的人机感知差距能否成为可靠研究基准
Ghost Font 暴露的是运动定义文字的时序感知差距;它适合作为可证伪的评测候选,但还不能被称为“AI 无法识别的字体”或成熟研究方向。
先给结论
可以把它列为一个待验证的研究入口,但暂时不应把它包装成全新的成熟方向。 Ghost Font 不是传统字体文件,而是把字形藏在点阵的相对运动里:暂停后单帧近似噪声,播放后人类通过时序整合看到字形。它连接了运动定义形状(motion-defined form)、对抗文字(adversarial text)、视觉语言模型(vision-language model, VLM)的排版攻击(typographic attack)和视频模型的细粒度运动理解。
目前没有可靠证据支持“领先 AI 都无法识别”这一普遍结论。更可信、也更有研究价值的问题是:在保证人类可读的前提下,哪些时间采样、压缩和表示条件会稳定拉开人类与模型的识别差距;简单的时序恢复方法又能在多大程度上消除这个差距?
这个现象究竟是什么
- Ghost Font 原始交互项目把目标字母区域内外的点设置为不同运动方向,并可加入干扰文字;它是项目演示,不是同行评审 benchmark。
- 人类对运动定义字母的识别并不新。早在 1992 年,Motion-defined letter detection and recognition 就把“看见运动区域”和“识别运动所定义的字母”区分为不同视觉能力。
- 文字或排版本身也早已被用于攻击模型。Fooling OCR Systems with Adversarial Text Images、When Vision Fails 与 Unveiling Typographic Deceptions 分别说明光学字符识别(optical character recognition, OCR)、视觉 Transformer(Vision Transformer, ViT)和大型视觉语言模型都可能在“人仍能读懂”的文字变换下失败。
- 近年的 Web Artifact Attacks 与 Not Just Text 又把问题扩展到图形、图文组合和图像生成模型。
- 视频模型的邻近证据也支持继续检查时序表示:Test of Time 发现多种视频语言模型在受控时间顺序任务上接近随机;MotionBench 则指出细粒度运动需要更高帧率,但输入长度和计算成本会限制模型。
因此,Ghost Font 更像一个及时、直观的现象入口,不是从零出现的新学科。
真正可做的新切口
首选:运动定义文字的人机差距基准
建立一个可控生成器和公开 benchmark,不只问某个聊天模型“读到了什么”,而是系统改变:
- 运动速度、方向差和点密度;
- 字体、字号、词长、中文与英文;
- 干扰文字、遮挡、颜色和对比度;
- 帧率、采样策略、视频压缩和播放尺寸;
- 人类可读率与反应时间。
模型至少比较四层基线:单帧 OCR、跨帧叠加或帧差、光流(optical flow)恢复、视频视觉语言模型。核心指标包括人类准确率、字符错误率(character error rate, CER)、整词准确率、人机差距、推理成本和压缩鲁棒性。
次选:预算受限的时序恢复
研究模型不读取全部高帧率视频时,怎样选择少量帧或压缩时间特征,仍能恢复由运动定义的字形。这一切口更接近 topics/video-understanding 中“有限输入预算下保留关键时序证据”的主线。
候选方法:运动转字形适配器
当前最值得先验证的技术路线不是直接微调整个视频视觉语言模型,而是在现成 OCR 或视觉语言模型前增加一个轻量、可解释的运动转字形适配器(motion-to-glyph adapter):先把跨帧运动恢复成静态字形,再交给识别器读字。
- 自适应取帧:先估计点阵位移,选择能产生足够运动差、又不发生混叠的帧间隔;避免固定稀疏采样恰好错过关键运动。
- 运动特征提取:并行计算帧差、运动能量(motion energy)和光流;不把光流当唯一答案。NeurIPS 2024 的共同命运随机点分割研究发现,40 种深度光流模型在随机点刺激上普遍弱于人类,而神经科学启发的运动能量模型能够更接近人类表现,这与 Ghost Font 的随机点机制直接相邻。
- 共同运动分组:把每个点或小块表示为轨迹 token,编码位置、速度、方向、加速度与置信度,再按“共同命运(common fate)”把真实字形、背景和诱饵分成多个运动层。工程上可以用轻量聚类;更强基线可借鉴 CoTracker 的联合点跟踪思想。
- 标准字形重建:把属于同一运动层的轨迹反投影到参考帧,输出一张或多张字形概率图,而不是直接猜词。多候选输出可防止模型把诱饵层误当真实文字。
- 文字识别:将重建图交给冻结的 OCR 或视觉语言模型,并同时报告字形分割质量、字符错误率和整词准确率,使“看见运动层”和“读对文字”可以分开诊断。
训练时可由合成生成器直接提供字形掩码和运动层真值,联合使用字形分割损失、同层轨迹一致性损失、跨帧重建损失与文字识别损失。为了防止模型只记住 Ghost Font 的固定运动规则,训练集与测试集必须按字体、文字内容、语言、运动生成规则和压缩条件整体隔离;随机字符串和伪词测试用于限制语言模型靠词频猜答案。
这条路线的最低成本版本是“帧差/运动能量 → 残差运动图 → OCR”;推荐论文版本是“运动能量 + 轨迹分组 → 多层字形重建 → 冻结识别器”。若最低成本版本已经在跨生成器测试中接近满分,就不应继续包装复杂网络,研究应转向人机检测协议与攻击—防御评测。
条件推荐:可靠性与无障碍边界
不同年龄、视力、运动敏感度、屏幕刷新率和减少动态效果(reduced motion)设置,可能显著影响人类可读性。若人类基线本身不稳定,所谓“人类可读、机器不可读”就不能成立;但这也可以转化为人类感知与可访问性研究。
暂不建议:把它当安全机制或 CAPTCHA
“防 AI 字体”“加密”或验证码(CAPTCHA)不是当前证据支持的结论。独立演示已经声称可用 H.264 运动向量恢复样例文字;即使该结果仍需正式复核,它也足以说明研究必须主动纳入传统计算机视觉恢复基线,而不能只测试通用聊天模型。
最小可行研究设计
- 生成 500—2,000 个可控短视频,先覆盖英文大写字母和短词,再增加中文;固定随机种子并保存字形掩码真值。
- 先做小规模人类实验,确认每个条件确实可读,并记录准确率、反应时间和个体差异。
- 跑单帧 OCR、时间平均、帧差、光流、视频编码器和通用视频 VLM 六类基线。
- 分开报告“看见有字”“定位字形”“识别内容”三个层次,避免把一个总分误当成机制解释。
- 在未知字体、未知语言、不同压缩率和不同设备上测试迁移,防止 benchmark 只记住生成器规律。
可证伪条件与止损线
- 若简单光流或时间聚合在大多数条件下都能稳定恢复,而模型失败只来自接口没有读取视频,就不能声称发现了新的模型能力缺口。
- 若人类准确率对设备、帧率或个体差异过于敏感,无法形成稳定真值,应停止“通用 benchmark”叙事,改做感知或可访问性研究。
- 若结果只在一个闭源模型、一个提示词或一个固定生成器上成立,不足以形成论文结论。
- 若加入明确提示后模型立即恢复,研究重点应转向任务说明、采样和工具调用,而不是模型“看不见”。
当前证据状态
当前判断为有趣且可做,但新颖性中等、证据仍不足。相邻领域已有几十年的感知研究和近年的对抗文字、排版攻击与视频时序 benchmark;新颖性必须来自受控的人机比较、时序恢复基线、跨模型迁移和可证伪协议,而不是 Ghost Font 这一种视觉效果本身。