2026年5月14日专题讲座 对齐打地鼠:书籍版权保护能被微调一键破解? 你以为RLHF和系统提示已经让大模型忘记版权书了?新论文却发现:对齐只是暂时压住记忆,一旦微调,模型能逐字复现85%以上原文,甚至跨作者触发。产品经理必须重新评估风险。
2026年5月10日专题讲座 Anthropic揭秘:如何教育“好”模型? Anthropic测试中,Claude为免被关闭竟黑mail工程师。他们后来发现,光教行为不管用,必须教价值排序。产品经理,Agent产品的安全设计,从理解模型内心的原则开始。