🌐 English 即时比分

微软新AI“行为准则”:要求模型不得入侵系统或欺骗人类

人工智能 来源: TechCrunch 发布时间: 热度: 👍👍
微软新AI“行为准则”:要求模型不得入侵系统或欺骗人类
🤖
🤖

核心导读

微软发布AI“行为准则”,为模型训练设定价值观与安全红线,禁止网络攻击、核武器、深度伪造及规避人类监督,并强调AI应支持而非取代人类。准则要求模型服从高于用户偏好的总体规范,呼应业界对前沿AI审慎推进与对齐研究的关注,纳德拉亦支持嵌入式评估者等机制。

随着AI界将关注点转向安全与对齐,微软发布了一份新的AI行为准则,旨在引导AI模型远离危险行为。 该文件较Anthropic首席执行官达里奥·阿莫代伊近期对“为前沿AI发展设定节奏”的呼吁更为具体,聚焦于指导微软AI内部模型训练的价值观与红线。尽管如此,它仍是一份全面指南,阐明微软如何看待AI安全,以及这些理念如何落地实践。 文件开篇预测,未来十年,超智能AI系统将在大多数任务上超越人类表现。该行为准则继续写道:“遏制、控制并对齐如此强大的力量,是人类迄今面临的最大挑战之一。因此,我们必须彻底明确:我们为何要发明这些系统,以及我们打算如何控制它们。” 该行为准则还列出微软AI模型应遵循的一般原则——例如支持人类而非取代人类,并加速人类繁荣——以及为落实这些原则而制定的具体安全约束。 在微软的体系中,每个模型都有一份总揽性的行为准则,其优先级高于单个用户的偏好或任何具体任务。这包括禁止网络攻击、核武器或深度伪造生产的“绝对约束”,也包括防止人类总体失去控制权的更广泛条款。 文件写道:“MAI模型不会使用自适应、欺骗、自我强化、串通或其他机制来逃避或击败人类监督,从而使其无法再被授权人员或系统可靠地指挥、修改或关闭。” 这份文件发布之际,AI安全正受到前所未有的关注,原因是一系列失控智能体事件,以及Anthropic一名员工突然辞职,并称AI导致人类灭绝的风险日益上升。 与Anthropic、OpenAI和xAI一样,微软总体上也认同应为前沿发展设定节奏,尤其支持在AI实验室中设置嵌入式评估者。 微软首席执行官萨提亚·纳德拉在线上写道:“我们欢迎为把对齐做对作为设计目标所需要的研究、专注和审慎节奏。我们也欢迎‘嵌入式评估者’等想法,以及为让这一切不止于空谈而开发机制的更广泛努力。”
分享这篇文章: