OpenAI 将 GPT-5.6 开放至免费层级,万亿参数模型 Astra 即将登场

ChatGPT
OpenAI Moves GPT-5.6 to Free Tier as 10-Trillion Parameter Astra Looms
OpenAI 已向所有用户免费开放 GPT-5.6 Luna,并为旗舰模型 Sol 引入了全新的推理滑块功能,预示着其下一代 Astra 模型即将发布。

为了在重大架构飞跃前稳固用户群,OpenAI 在一项战术举措中正式将 GPT-5.6 Luna 迁移至其免费服务层。此举影响了全球约 10 亿用户,取代了老旧的 GPT-5.5,成为免付费账户的默认引擎。虽然中端推理能力的普及值得关注,但更具技术意义的进展在于旗舰模型 Sol 的精度提升,以及代号为“Astra”的下一代庞大模型泄露的规格,据报道该模型已进入部署的最后阶段。

作为一名机械工程师,我不仅将这些变化视为软件更新,更将其看作工业级认知工具的微调。GPT-5.6 的免费发布表明,该模型家族的边际推理成本已达到一个阈值,使得 OpenAI 能够吸收计算开销以维持市场主导地位。然而,真正的工程兴趣集中在新的“推理滑块”(Reasoning Slider)以及事实错误率 68% 的大幅降低上,这使人工智能离医疗和法律行业所需的可靠性更近了一步。

推理滑块的机制

GPT-5.6 Sol 模型中最实用的新增功能之一是集成了五级推理滑块。此前,OpenAI 的界面强制用户在“即时”(Instant)响应和“思考”(Thinking)模式之间做出二选一的决定。这是一种粗糙的按需计算实现方式。新的滑块允许用户手动调节模型内部推理过程的深度,从而有效地控制单个查询所消耗的推理时间。

从技术角度来看,这代表了朝着对模型随机过程进行更细粒度控制的方向迈进。在内部测试中,OpenAI 证明 Sol 现在优先考虑简洁性,避免了早期迭代中常见的“冗长幻觉”。例如,当询问复杂的物流问题(如为通勤导航天气模式)时,模型现在会过滤掉大气噪声,提供一个单一、可操作的结论,并辅以如风衣重量或逆风速度等具体技术要求。这种向“聚焦信息密度”的转变对于决策时间是关键指标的工业应用至关重要。

基准测试:错误率降低 68%

可靠性仍然是将大型语言模型(LLM)集成到关键供应链和工程工作流程中的主要障碍。OpenAI 最新的 GPT-5.6 家族评估指标表明,其在事实基础方面取得了重大突破。通过在金融、法律和医学等高风险领域测试这些模型——在这些领域,任何单一事实错误都会使整个回答无效——OpenAI 报告称,GPT-5.6 Sol 的错误率比其前身 GPT-5.5 降低了 68%。

这一改进很可能是增强型后训练技术和更严谨奖励建模的结果。对于我们这些关注人工智能在机器人和自动化系统中效用的人来说,这种方差的降低比添加新的创意功能更为重要。一个在法律或金融背景下准确率提高 68% 的模型,终于可以被信任去解析技术文档或安全规程,而无需持续的人工介入验证。

Astra:多智能体动力源

虽然 GPT-5.6 的更新提供了立竿见影的效用,但行业目前正严阵以待代号为 Astra 的模型发布。泄露的报告和内部检查点(特别是标记为“mewfour”的一个)表明,Astra 已达到发布候选(RC)状态。这不仅仅是增量更新;Astra 被定位为一个全新的预训练模型,是自 GPT-4.5 时代以来最大的模型。

行业估计 Astra 的参数规模在 7 万亿到 10 万亿之间。作为参考,这大约是 GPT-5.6 Sol 的两倍。然而,参数规模只是等式的一部分。Astra 的架构重点似乎是“长周期、多智能体协作”。这意味着一个能够编排多个 AI 实例在数小时甚至数天内协同工作,以解决多面问题的系统,例如端到端产品设计或复杂的代码库重构。

Astra 的技术基础最近在 OpenAI 的数学博客文章中被预告,文中指出该模型的一个内部版本成功解决了 10 个十多年来未被触及的开放数学问题。这表明其具备了当前模型所缺乏的符号推理和逻辑持久性水平。如果 Astra 能够保持长周期任务的连贯性,它将代表人工智能从聊天机器人向自主项目管理者的转变。

经济可行性与市场定位

此次“闪电战”——在准备 Astra 的同时让 GPT-5.6 免费——是对来自 Anthropic 的 Fable 5 和 Mythos 模型日益激烈的竞争的明确回应。OpenAI 的传统优势在于其后训练基础设施,而 Anthropic 在原始预训练深度上通常略有优势。借助 Astra,OpenAI 试图将全球最大的预训练基础与其卓越的微调流水线结合起来。

至关重要的是,OpenAI 正押注于基础设施优化,以保持 10 万亿参数模型的服务成本可控。今年投入使用的新计算能力,结合更高效的推理内核,可能使 OpenAI 能够以低于 Anthropic 当前顶级产品线的价格提供 Astra。对于企业用户而言,切换的决定最终将取决于单 token 成本与输出可靠性之间的权衡。如果 Astra 在兑现其多智能体承诺的同时保持 GPT-5.6 所展现的准确率提升,那么通往全面工业 AI 自动化的壁垒可能最终会被打破。

未来一周很可能成为该行业的转折点。随着 GPT-5.6 Luna 成为 10 亿人的新基准,我们正在见证“入门级”人工智能定义的巨大重校。真正的问题在于,Astra 仅仅是现有产品的更大版本,还是其多智能体架构能够提供将人工智能从数字助手转变为合法工业合作伙伴所需的质的飞跃。

Noah Brooks

Noah Brooks

Mapping the interface of robotics and human industry.

Georgia Institute of Technology • Atlanta, GA

Readers

Readers Questions Answered

Q GPT-5.6 Luna 和 Sol 模型之间有哪些主要区别?
A GPT-5.6 Luna 已转为免费服务层级,在全球范围内取代 GPT-5.5 成为非付费用户的默认引擎。相比之下,GPT-5.6 Sol 仍是旗舰模型,具有全新的五级推理滑块,且事实准确性显著更高。Luna 旨在为十亿用户提供中等水平的推理能力,而 Sol 则专为需要精细控制推理深度、且在技术或法律语境下要求极低错误率的高风险工业应用而设计。
Q 新的“推理滑块”(Reasoning Slider)如何影响 AI 模型的表现?
A 推理滑块允许用户手动调节 AI 模型在五个不同级别上的内部处理深度。通过调整此滑块,用户可以控制分配给单个查询的推理时间和计算能力。这种精细控制有助于模型优先考虑信息密度并避免冗长的幻觉内容,使其在复杂的工程任务或物流领域中表现更佳,在这些领域中,单一、可操作的结论比冗长、渲染气氛的回答更有价值。
Q 即将推出的 Astra 模型与之前的版本有哪些技术规格上的区别?
A Astra 是一款下一代模型,参数规模预计在 7 万亿到 10 万亿之间,约为 GPT-5.6 系列规模的两倍。在架构上,它侧重于长周期的多智能体协作,使其能够协调多个 AI 实例,在数小时或数天内解决多方面的问题。内部检查点显示其在符号推理方面取得了突破,该模型已成功解决了数学领域长期以来困扰研究人员十余年的难题。
Q OpenAI 如何提高其模型在专业领域的可靠性?
A 与前代产品相比,OpenAI 将 GPT-5.6 Sol 模型的事实错误率降低了 68%。这一改进专门针对金融、医疗和法律等高风险领域进行了衡量,在这些领域准确性至关重要。通过增强训练后处理技术和严格的奖励建模,该模型在解析技术文档和安全协议方面变得更加可靠,减少了工业和专业工作流程中对持续人工验证的需求。

Have a question about this article?

Questions are reviewed before publishing. We'll answer the best ones!

Comments

No comments yet. Be the first!