最新曝光显示,OpenAI内部长期运行代号“莉莉计划”的人工评估项目,安排“提示词审核员”对ChatGPT用户的真实聊天记录进行人工审阅与打分。这打破了外界认为大模型进化仅靠算法升级和自动化训练数据的印象,揭示人工审核在模型训练中仍扮演关键角色。