ChatGPT标题频现色情赌博小广告,技术溯源指向分词器词表污染

2026-10-11 03:10 0 次浏览 前沿资讯

自今年8月起,大量ChatGPT用户发现会话标题末尾会随机出现色情赌博广告词。经技术分析,这可能与标题生成模型的收尾缺陷,以及OpenAI新版分词器o200k_base中文词表中混入大量广告词元有关。OpenAI虽已回应,但至今未能彻底修复。

如果你近期频繁使用ChatGPT,可能已经注意到一个奇怪的现象:聊天会话的自动生成标题末尾,偶尔会多出一串意义不明的外语单词,或是来自赌博、色情小广告的片段。这一现象从今年8月开始集中爆发,让不少用户误以为自己的账号被入侵,或是OpenAI开始测试广告功能。经过技术社区与开发者的持续追踪,这一问题的真正根源逐渐浮出水面。

事件概览:从Codex到普通用户标题的“广告传染病”

最初,这类异常输出出现在OpenAI的Codex CLI工具中。今年1月底,有开发者发现,在使用GPT-5.3模型且上下文较长的情况下,Codex返回的消息末尾会夹杂中文博彩小广告。到了2月,API接口也开始出现类似现象——模型在工具调用时突然输出一串中文和泰文混合的赌博网站广告词,而系统提示词干净且未开启联网搜索。

4月,这一现象在开发者社区已经“司空见惯”,甚至有用户误以为自己的反向代理服务器被挂马。直到7月25日,OpenAI官方才首次正面回应,表示“已了解问题”,并预计会在未来的模型更新中解决。然而,8月中旬,博彩广告开始闯入普通用户的会话标题,影响面迅速扩大。时至今日,虽然正文和思维链中的广告已有所减少,但标题中的异常字符仍未绝迹。

核心信息:标题生成机制与分词器词表缺陷

标题生成的“轻量推理模型”与收尾失败

根据技术人员早年抓包记录,网页端在用户发起第一轮对话后,会单独向一个专门的接口发送请求,使用指定模型为会话生成标题。这个模型通常更轻量化,且从一些异常输出中可以推断,它很可能是具备思维链的推理模型。例如,有用户要求生成漫画时,标题模型竟然输出了一长串“自问自答”的内容,其中包括“must Chinese 1-4 words”这样的推理过程,说明模型未能正确地区分“思考”与“回答”的边界,也没有在适当的时候输出结束符。

此外,多个异常案例显示,模型在生成完整标题后,往往会继续输出“#+#+#+#+”这类疑似被误当成控制符的符号,或与标题语义相关的其他语言词元。这表明标题模型存在“难以合理结束任务”的问题。

o200k_base:被广告词元污染的分词词表

另一个关键因素在于OpenAI的分词器。从2024年5月的GPT-4o开始,OpenAI将分词器编码方案从cl100k_base更换为o200k_base。新的分词器将大量常见中文词语和短句直接纳入词表,以便更高效地处理中文。然而,用于训练分词器的中文语料中包含大量从外网抓取的色情、赌博和盗版影视网站数据。

分词器的训练逻辑是根据语料中重复出现的字串频率来生成词元。小广告恰恰以重复固定广告词组为特征,因此在分词时被大量识别为独立词元。有研究论文《Speculating LLMs’ Chinese Training Data Pollution from Their Tokens》指出,在o200k_base词表的4字词元中,68%与广告相关;6字以上词元中,98%来自广告;最长的100个中文词元中,96个与赌博、色情或盗版影视有关。

更重要的是,OpenAI在正式训练语言模型之前,会对训练数据进行清洗,移除这些重复内容和低质量广告。这导致一个分裂的局面:广告词元在分词词表中拥有独立ID,但语言模型在正式训练阶段却几乎没有见过这些词元对应的输入数组。因此,当模型被迫输出“下一个词”时,它不理解这些词元的具体含义——在模型眼中,它们和斯瓦西里语一样陌生,只是“乱码”的一种。

影响与观察:小广告为何难以根治?

综合两条技术线索,ChatGPT标题出现小广告的原因可以这样描述:标题生成模型在收尾时容易出错,一旦停不下来,就会根据概率继续输出“下一个词”;此时,如果模型需要给出一个“乱码”性质的词元,它大概率会从包含大量广告词元的“垃圾房”中随机抽取,于是色情赌博广告就成了最常见的输出。

从用户感受看,这种异常体验显然损害了ChatGPT的可用性。更为棘手的是,OpenAI目前最简便的应对方案——在标题生成后增加检查规则,将不合格标题打回重新生成——只能减少问题出现的频率,并不能根治。因为要彻底解决,需要重新构建一个干净的分词词表,而词表和基底模型绑定,重做词表意味着重新训练整个模型。在OpenAI近期密集发布新模型、推进“28天连更”的节奏下,显然缺乏将基模推翻重做的意愿和动力。

结语

在官方明确选择暂不“伤筋动骨”的前提下,中文用户恐怕在未来一段时间内仍会与小广告“共存”。这一现象也从侧面折射出大模型训练流程中一个容易被忽视的环节:分词器作为输入数据的“第一道关”,其词表质量直接影响模型输出的可靠性。当全球化语料鱼龙混杂,模型训练者若不在分词阶段做好清理,就迟早要吞下“在线发牌”的苦果。


信息来源:爱范儿,查看原始信息。本文由 AI ONLINE 基于公开资料整理,信息可能随时间变化,请以官方发布为准。