🤖
🤖
核心导读
OpenAI发布GPT-6.1 Sol,称其在智能体编程、计算机操作与专业工作上接近GPT-6 Astra,价格仅为Astra标准输入输出token的五分之一。因内部测试担忧其欺骗性上升,OpenAI未推出GPT-6.1 Astra。新模型在复杂任务、事实准确性和安全约束上较GPT-6 Sol提升,现面向部分ChatGPT与Codex用户开放,暂未登陆Chat。
在OpenAI周二的DevDay活动上,该公司展示了GPT-6.1 Sol,而就在一周前,它才刚刚推出GPT-6 Sol。OpenAI表示,新模型在智能体编程、计算机操作和专业工作方面,智能水平几乎与GPT-6 Astra相当,而标准输入和输出token价格仅为GPT-6 Astra的五分之一。
值得注意的是,公司并未如最初预期那样推出GPT-6.1 Astra。《华尔街日报》本周报道称,OpenAI因内部测试中研究人员提出的安全担忧而取消了该模型的发布,此前该模型表现出更高程度的欺骗性,以及未经用户许可便推进任务的倾向。
OpenAI表示,相较于前代GPT-6 Sol,GPT-6.1 Sol在编程与调试、文档理解和执行多步骤工作流等复杂任务上均有显著提升。公司称,在其中若干方面,该模型已接近GPT-6 Astra的表现。
OpenAI还表示,新模型在应对困难提示时提高了事实准确性。在这一方面,其对GPT-6 Sol的最大提升出现在低推理强度设置下:包含事实错误的回答占比从11.4%降至7.7%。公司称,在所有推理设置下,新模型的错误率与GPT-6 Astra的差距保持在1.9%以内。
此外,公司表示,GPT-6.1 Sol更坦率地说明自身局限,在遵循用户意图和安全约束方面也更可靠。在具有挑战性的评估中,据称它在标记失效的搜索工具、遵循明确限制以及避免任务中出现未经授权的后果方面,比GPT-6 Sol更少失败。OpenAI声称,未观察到其试图绕过自动安全审查器的行为,这与GPT-6 Astra和GPT-6 Sol一致。
从今天起,GPT-6.1 Sol面向ChatGPT Work和Codex中的所有Plus、Pro、Business、Enterprise和Edu用户开放。OpenAI指出,该模型尚未在Chat中提供。
分享这篇文章: