2022 年 11 月 30 日,ChatGPT 以“研究预览”的形式上线。大语言模型并非从这一天才出现,GPT-3 也早已能续写文本,但 ChatGPT 让普通人第一次在一个几乎不需要学习的界面里,持续追问、纠错、改写和协作。
它的爆发提醒我们:一次技术跨越,常常不是单个指标提升,而是模型、训练方法和产品界面刚好跨过了可用性的门槛。
对话界面降低了什么成本
搜索引擎要求用户挑选关键词,再自行打开网页、比较来源和整理答案;传统软件要求用户理解菜单与字段。ChatGPT 接受完整句子,也保留上下文。用户可以先给一个模糊目标,再通过“简短一点”“换个例子”“考虑这种限制”逐步靠近结果。
这种交互把一次性命令变成了协商过程。人不必在开始时就把需求写得完美,系统也不必第一次就给出最终答案。对于写作、学习和编程,迭代本身就是价值的一部分。
RLHF 让模型更像一个助手
预训练模型学习的是“接下来最可能出现什么文本”。要让它成为有帮助的助手,还需要理解指令、拒绝一部分危险请求,并以用户容易接受的方式组织答案。
ChatGPT 使用监督微调和基于人类反馈的强化学习(RLHF)来调整行为。人类标注者比较多个回答,奖励模型据此学习偏好,再用于优化生成策略。它并没有让模型获得真实人格,却显著改善了遵循指令和对话连贯性。
代价是,流畅、礼貌和自信也可能掩盖事实错误。模型优化的是符合训练反馈的回答,不是一个能对现实逐条求证的数据库。越像人交流,用户越容易忘记这一点。
“幻觉”不是一个小 bug
语言模型根据概率生成文本,当知识不足、问题含糊或上下文冲突时,仍可能给出结构完整的错误答案。要求它“不要编造”有帮助,但不能从机制上保证真实性。
在低风险场景,把输出当草稿通常足够;在代码、法律、医疗和生产决策中,则需要外部证据。检索、工具调用、测试、引用和人工复核,后来都成为大模型应用的重要组成部分。
我认为产品设计的关键不是让模型永远不犯错,而是让错误容易被发现、影响范围有限,并且用户知道何时必须验证。
我的理解:它把计算机变成了概率型合作者
传统程序对相同输入给出确定结果,我们习惯先定义规则再执行。ChatGPT 更像一个概率型合作者:擅长处理模糊任务、生成候选和连接知识,但结果需要判断。
这要求我们改变使用方式。不要只问“答案是什么”,还要提供背景、要求列出假设、把复杂任务拆小,并用外部工具验证关键结论。好的提问不是讨好模型的咒语,而是把问题边界说清楚。
ChatGPT 真正改变的,也许是人们对软件的预期。从此以后,用户会越来越自然地要求系统理解意图、记住上下文并解释结果。模型会继续更新,但这种交互范式很可能长期留下。
参考资料
- Stanford HAI:Biggest AI Headlines in 2022
- 论文:Training language models to follow instructions with human feedback
本文是 2026 年整理断更期时写下的回顾,发布日期按事件所处阶段归档。