行业资讯

GPT-5.6一发布,Claude终于舍得重置Fable 5额度了

发布日期:2026-08-10 12:06    点击次数:147

GPT-5.6一发布,Claude终于舍得重置Fable 5额度了

听雨 发自 凹非寺量子位 | 公众号 QbitAI

OpenAI诚不欺我…今天凌晨,GPT-5.6认真来了!

奥特曼默示:这是OpenAI迄今最强模子,GPT-5.6的本领博客也可能是他们写过最佳的blog之一。

好家伙,模子要SOTA,连blog也要SOTA呗(

目下ChatGPT、Codex以及API,哪哪王人不错使用了。

Codex仍是被夺舍了…以致你不彊行遮挽的话,露馅的王人不是Codex的标(doge)。

原有的Codex桌面应用径直升级成了新的ChatGPT桌面应用,老版ChatGPT桌面应用则改名为 “ChatGPT Classic”。

社区也运行放纵整活。Matt Shumer让GPT-5.6-Sol连结搓了个“方块版曼哈顿”:

高楼、街区、谈路,全是voxel格调,GPT-5.6-Sol自主运行了一周,搭了个纽约乐高城。

他还默示:照这个趋势,来岁这个时候模子可能仍是不错one-shot生成GTA级别的游戏了。

数学征询者nasqret则共享,GPT-5.6匡助他鼓励了一个对于代数几何中K3曲面的问题。

GPT-5.6-Sol被喂进多数本领文档后,在Codex里一谈查贵寓、找方法、写智力,临了挖出了一条分式线性筹办的念念路。

模子把策动决策已毕出来,去跑他们整理的K3曲面家眷,径直打破了原先料想。

此外,此次还同步发布了ChatGPT Work

由Codex和GPT-5.6驱动,不错跨应用和文献活动,必要时捏续数小时,把贪图酿成完制品。

但也有网友吐槽:GPT-5.6太烧token了!!!

ultra格式在15分钟内就烧完Pro会员5小时名额的程度。

GPT-5.6认真上线

GPT-5.6家眷分三档:

Sol:旗舰模子,主打最高才略;Terra:均衡款,面向闲居使命;Luna:最快、最低廉,主打高性价比。

定名辞别对应太阳、地球、月亮。

官方说法是,GPT-5.6 Sol在编码、学问使命、收集安全、科学任务上达到SOTA,同期用更少token、更低估算资本完成任务。

此次GPT-5.6还带来了一个很要道的新格式:ultra。

要是说max是让模子在一个任务上插足更多推理时候,那么ultra就更进一步,径直把任务交给多个agent并行科罚。

按照OpenAI的说法,ultra默许会合营4个agent同期使命,可膨大至16个。

GPT-5.6还带来一项工程侧的新才略:Programmatic Tool Calling(智力化器用调用)。

粗浅说,模子不错我方写一段轻量智力来合营多个器用调用、科罚中间限定、监控程度并决定下一步作为。

不需要拓荒者把每一步王人写死剧本,也毋庸把每次器用复返限定王人塞回模子里过一遍。

这让“器用密集型”任务能用更少的token、更少的模子来回次数完成。

那么,GPT-5.6比较Fable 5怎样呢?

OpenAI默示,在 Agents’ Last Exam(阴事55个专科规模的长周期使命流测试)上,Sol以53.6分刷新记载,比 Fable 5 进步13.1分。

即便调低到中等推理强度,仍能以梗概四分之一的资智力先11.4分。

这种效能上风相通体目下小尺寸模子上——Terra和Luna辞别以约十六分之一的资本反超 Fable 5。

代码才略上,官方称GPT-5.6 Sol是OpenAI目下最强代码模子。

在Artificial Analysis Intelligence Index上,Sol(最高推理强度)与 Fable 5的分差被压缩到1分以内,但完成任务的时候少61%,资本约为一半。

在遐想才略上,GPT-5.6已毕了飞跃。

GPT-5.6只需要高层级的率领,就能作念出好意思不雅、相宜东谈主体工学、功能好意思满的界面。

要道的是,它的电脑操作才略让它不祥检验和打磨“渲染出来的最终效果”,而不仅仅生成底层代码或笔墨本体。

也等于说,小妖精朕受不了了高h它能我方发现视觉和功能上的问题,托付前再作念一遍落幕打磨。

比如这个风帆主题游戏,等于由GPT-5.6自主生成的:

这前端遐想,这互动体验,不得不说真有点太丝滑了。

此外,GPT-5.6也能完成端到端的学问使命

它能把Slack、Notion、Microsoft 365、Google Drive里那些“横三竖四”的闲居使命素材,升沉为专科水准、可径直共享的限定。

在触及长周期专科分析、网页浏览、器用使用和电脑操作的评测中,Sol在BrowseComp上拿到92.2%的新记载,在 OSWorld 2.0上达到62.6%。

后者以致高出了Claude Opus 4.8,同期输出token少了85%。

在演示文稿、文档、表格这类具体产出上,官方特殊强调了“战胜模板和参考文献”这项才略的耕种。

GPT-5.6能识别一份幻灯片的举座遐想体系(布局、字体、间距、配色,乃至藏在幻灯片母版里的划定),并把这些和衷共济地套用到新本体上。

在订价方面(每百万 token):

Sol:输入$5/输出$30;Terra:输入$2.5/输出$15;Luna:输入$1/输出$6。

ChatGPT Work登场:把贪图酿成完制品

ChatGPT Work此次也同步上线。

它由Codex和GPT-5.6驱动,不错跨应用和文献活动,必要时捏续数小时,把贪图酿成完制品。

主要才略有三项:

跨应用取材、跨文献活动:通过内置的“扶直插件目次”,ChatGPT Work首发即可贯串 Google Drive、SharePoint、Slack、Microsoft Teams、Gmail等一连串第三方管事。

用户不错主动指定要调用的数据源,也不错让模子我方判断该去那处找信息。

产出“制品”而不是草稿:官方给出的场景是凭证任务径直生成 Excel 表格、Word 文档、幻灯片、讲述或网站(Sites),模子会我方检验渲染后的最终效果并作念落幕打磨。

长任务与捏续监督并存:任务不错运行一次性,也不错按筹办重叠实行,或者依据触发要求(比如某个文献被更新)自动启动,这套机制复用了ChatGPT里已有的“Scheduled Tasks”。

经过顶用户不错随时检讨程度、请问模子的追问、调动主见,或者对要道作为进行审批。

安全性上强调Auto-Review:让才略更强的模子在要道作为真真是行前先作念一遍检验。在抗争性红队测试中,该机制拦下了全部尝试窃取受保护数据的袭击。

此次发布也顺带完成了一次居品架构的归拢

ChatGPT桌面端不再仅仅聊天窗口,而是拆分红Chat/Work/Codex三种格式。

Chat用于问答、搜索、头脑风暴等轻量对话;Work面向征询选题、信息分析、文档/表格/演示文稿/网站等限定型任务;Codex连续专注软件拓荒,展示更多本领细节(代码、diff、PR),而 Work则把这些细节详细掉,只呈现限定。

同期,OpenAI也趁势告示将安静淘汰零丁的Atlas浏览器,联系的智能体浏览才略会并入ChatGPT内置浏览器和新的Chrome侧边栏膨大。

安全放到了C位

安全方面,GPT-5.6也没落下。

官方称GPT-5.6是“迄今最强的收集安全模子”,并且是用廓清更少的token作念到的。

在 ExploitBench(预计从发现纰谬代码到已毕随便代码实行的好意思满进展)上,GPT-5.6得分73.5%,而 GPT-5.5 只消47.9%(token预算特殊的情况下)。

在 ExploitGym(要求智能体把真实纰谬升沉为可用的纰谬讹诈智力上),两小庸俗限内的最高通过率从GPT-5.5的15.1%险些翻倍到24.9%,六小庸俗限下能到33.7%。

在 SEC-Bench Pro(测试复杂软件中的成见考据生成)上得分71.2%,大幅最初GPT-5.5的45.8%,延前程展也更好。

出于对花费风险的考量,GPT-5.6 对“防护性”收集安全任务(代码安全审查、补丁拓荒、威迫建模、蓝队使命等)提供维持。

但更高档别的才略——比如纰谬分诊考据、坏心软件分析、检测工程、补丁考据,只向 OpenAI Daybreak的“收集安全简直侦查”筹办中通过身份考据的个东谈主和机构绽开。

才略越强,红线画得也越严慎。官方败露,这一代插足了前所未有的算力作念安全测试。

论断是GPT-5.6在收集安全和生物两个维度均未越过“要道(Critical)”风险阈值。

具体到收集安全,测试露馅它更擅长“找到并扶植纰谬”,而不是可靠地对加固过的贪图发起自主端到端袭击——这给了防护方抢先补洞的窗口期。

生物规模则是能维持正当征询,但不具备重新遐想或合成高危新式威迫的端到端才略。

临了的临了…揣度A社亦然感受到了压力。

Anthropic那边看完发布会后,连夜默示:

咱们重置了全球的额度。(狗头)

网友的梗图也仍是如约而至:

意旨…真意旨啊。

[1]https://openai.com/index/gpt-5-6/[2]https://x.com/openai/status/2075271435573244008[3]https://x.com/sama/status/2075266471316615436



Powered by 造虎电子设备有限公司 @2013-2022 RSS地图 HTML地图