GPT-6 Sol斩杀5.6全系!升级打5折,Luna比梁文谷还便宜,周二Codex重置 实时

GPT-6 Sol、Luna深夜上线,API价格直接砍半!

Astra改进的训练方法这两款也都用上了,所以也继承了Astra在计算机使用等方面的提升。

那还有啥好说的,等于5.6系列直接被斩杀了呗。


【资料图】

现在系列里Astra负责当以前的Sol,Sol负责当以前的Terra,Luna还是以前的Luna。

Terra生态位直接被挤没了。

与5.6系列相比,6系列的API定价直接砍50%,其中Luna的输出砍得比50%还多一点。

而且Luna的输入价格比DeepSeek-V4.1 Flash的梁文谷价格($0.15)还便宜一点了,就是不知道缓存命中率有没有的比。

为啥升级还便宜了?

OpenAI称这得益于缓存和推理环节的效率提升,省下来的成本直接让利给用户和开发者。

这不得尊奥特曼一声奥特之王(限时24小时)。

用一成价格,盯着Fable打

整个发布公告看下来,我先学会一招,用GPT-6 Sol最好别开Max。

这回好多跑分Max都神秘的比xHigh掉分了,OpenAI也没解释原因。

什么你不知道怎么在Codex里开Max?

在设置里可以选,默认是没选的,这下知道为什么没选了。

按照AutomationBench这个榜,GPT-6 Sol的high和xhigh两个档位已经摸到了Astra的light和medium的水平。

AutomationBench测的是AI在销售、营销、运营、客服、财务和人力资源六大领域47个工具上执行端到端业务流程的能力。

作为对比,Claude Opus 5在max effort下得分和GPT-6 Sol的medium差不多,但单任务成本是Sol的11.1倍。

Claude Fable 5.1,成本是Sol的8.9倍以上,而且这还没算上约40%任务触发Opus 5回退产生的额外开销。

为测试GPT-6 Sol的计算机使用能力,我让它在图表中把隔壁新发的Opus5.5成绩也画上去。

Opus5.5的Max档达到了GPT-6 Astra水平,价格也达到了Astra水平。

换Agents" Last Exam,这次转考长周期任务,覆盖55个子行业。

GPT-6 Sol在max effort下得分56.4%,超过Claude Opus 5在该测试中的最高分,成本还低了60%。

编程是这次重点展示的方向。

OpenAI透露了一组内部数据:公司内部的Coding Agent使用量呈指数级增长,按API价格折算,中位数研究员每天的token消耗已超过600美元,90分位的研究员超过7000美元。

随着编程agent承担的任务越来越长、越来越复杂,持续使用的成本变得更加关键,这正是Sol和Luna要解决的问题。

在DeepSWE v1.1(测试AI在真实代码库中解决复杂软件工程任务)上,GPT-6 Sol其实并没有比5.6 Sol更好,但确实便宜不少。

GPT-6 Luna在max effort下得分66.6%,与Claude Opus 5和Fable 5在medium effort下水平相当,成本分别低了93%和96%。

在Cognition推出的FrontierCode(评估AI编写的代码是否达到可合并进真实代码库的标准)上,GPT-6 Sol相比GPT-5.6 Sol同样有明显提升,能以更低成本匹配Claude Fable 5.1 xhigh的表现。

这个榜6 Sol的Ultra终于不掉分了,但是隔壁Claude的档位又乱了起来。

计算机操作,这块还是Astra比较权威。

GPT-6 Sol也仅仅是比5.6 Sol便宜了,high档位以上水平其实没超过5.6多少。

GPT-6 Luna在max effort下超过了GPT-5.6 Sol在medium effort下的表现,成本仅为后者的十分之一。

事实准确性方面,OpenAI用一组从真实ChatGPT对话中提取的、用户曾标记过事实错误的案例进行了测试。

结果是GPT-6 Sol的错误率大约是上一代的一半,接近Astra的水平。GPT-6 Luna在较高effort下能匹配GPT-5.6 Sol的准确度,而成本只有百分之一。

缓存命中率提升,重置马上来

模型能力之外,OpenAI对GPT-6的基础设施也做了几项改进。

首先是提示词缓存。

改进后的缓存机制默认提供更高的命中率,缓存命中的输入token可享受90%的价格折扣。

OpenAI还上线了缓存监控面板和诊断工具,开发者可以查看缓存使用情况、定位未命中的原因并针对性优化。

还有这样一个实用的改动:调整推理effort级别或开关工具时,不再会打断之前的缓存上下文。

GitHub已经在用这套方案。据OpenAI披露,过去几个月里这些优化让GitHub Copilot需要重新处理的提示token比例下降了超过50%,涉及数十亿次请求。

终于能在任务的不同任务灵活切换配置了。

之前看已经有人做出来,搭配Jev可以在任务中途毫秒级切换。

然后是对话风格。

OpenAI把Astra上改进过的沟通方式带到了Sol和Luna上,在技术和编程对话中感知会尤为明显,表现为更清晰、更少术语、更少无效细节、回复整体更简短但不丢失关键信息。

OpenAI在博客中展示了同一个网页开发任务下GPT-5.6 Sol和GPT-6 Sol的对比回复。

5.6会主动复述用户已知的信息并使用含糊措辞,6则更直接,会说明自己检查了什么、没检查什么。

对齐方面,Sol和Luna在测试中优于GPT-5.6同级模型,包括在编程任务中做出误导性声明的比率更低。OpenAI强调,这些对齐测试专门挑选了容易诱发不诚实行为的场景,正常使用中出现此类问题的概率远低于测试数据。

最后,关于额度重置。

总之是周二,具体时间未定,醒来的朋友们可以开蹬了。

参考链接:[1]https://openai.com/index/introducing-gpt-6-sol-and-luna/#alignment-reviewer-bypass[2]https://x.com/miu21590/status/2101857866378362926?s=20

关键词: 编程 sol gpt 梁文谷 新模型 luna

    为你推荐

    当前最新:接骨木有什么技巧?接骨木的功效与作用

    接骨木又名公道老、马尿骚等,接骨木不仅是一种常见的花卉植物,而且接骨木全株都可入药,接骨木额什么作用了,下面我们就来分享一下接骨木

    来源: 23-01-18

    【环球报资讯】和田枣和若羌枣的区别 如何挑选和田枣?

    新疆和田枣果形大、颗粒饱满、果肉厚实、皮薄核小、营养丰富,口味更甜醇。每一颗“和田枣”都是自然精华的结晶,和田枣产自新疆和田地区,

    来源: 23-01-18

    世界观点:苹果套袋技术注意什么?苹果的套袋技术

    苹果套袋是我国苹果生产中广泛采用的一项重要管理措施。苹果套袋可以改善果实外观品质,防治病虫害,减少农药残留,提高商品价值,增加经济

    来源: 23-01-18

    中国重工和中国船舶差距82% 同期涨幅仅为10%

    2022年上半年,中国重工涨幅为-8 96%,同行业的中国船舶涨幅为7 55%,两者看起来相差不大。但是,从4月27日的底部算起,中国船舶涨幅为82%

    来源: 23-01-18

    国美零售的三年蜕变:苦练内功关键数据亮眼

    5月28日晚间,京东溢价37 91%认购国美零售1亿美元的可转债,初步转股价为1 255港元 股,如最终全部行使转化权,京东将获得6 22亿股国美零

    来源: 23-01-18
    返回顶部