2026年6月15日专题讲座 模型总是爱顶嘴?不是Bug,要用缰绳工程在诚实性与顺从性间做出权衡 近期大量用户反馈模型“顶嘴”、“不认错”,Claude、GPT、Gemini都出现了类似现象。这不是单一Bug,而是安全强化、诚实训练与能力提升共同作用下的涌现行为。作为产品经理,理解原因才能设计更好的交互策略。
2026年5月14日专题讲座 对齐打地鼠:书籍版权保护能被微调一键破解? 你以为RLHF和系统提示已经让大模型忘记版权书了?新论文却发现:对齐只是暂时压住记忆,一旦微调,模型能逐字复现85%以上原文,甚至跨作者触发。产品经理必须重新评估风险。