Back to topic rankings
AIControversialAll-time data

Claude Opus 5.5和GPT-6 Sol/Luna价格与能力对比

Claude Opus 5.5和GPT-6 Sol/Luna的发布继续在中文X引发价格与能力对比。花叔称Opus 5.5比Opus 5更快更便宜,跑分超过自家Fable 5.1和GPT-6 Astra,并给订阅用户提供一次额度重置;KC则认为GPT-6 Sol和Luna能力不足预期、无惊喜,OpenAI可能转向廉价路线;另有讨论将GPT-6-Luna与DeepSeek-V4.1-Flash在不同上下文和缓存负载下的价格进行比较。整体看,用户不再只关注跑分,而更在意模型档位、订阅重置、按token价格和实际工作负载性价比。

#Claude Opus 5.5#GPT-6 Luna#GPT-6 Sol#DeepSeek-V4.1-Flash#模型价格
Topic heat
703
Topics
Posts
53
Views
41.4万
Creators
31

Topic trend

From first appearance to last update, with a seven-day minimum window.

All related posts

53 posts in total

1
25.0万 followers
Views6.9万
Claude Opus 5.5 发布:追平 Fable 5.1,成本降四成 Anthropic 发布 Claude Opus 5.5,大部分工作上的表现追平了自家 Mythos 级的 Fable 5.1。同样的任务,花费比上一代 Opus 5 少 40%。 省钱来自两方面:单价降了,完成同一件事用的 Token 也少了。输入和输出分别是每百万 Token 4 美元和 20 美元,比 Opus 5 便宜 20%。降得最多的是缓存读取,从 0.5 美元降到 0.2 美元。写代码、跑智能体(Agent)时,模型会反复读取同一批上下文,账单里大部分钱花在这一项上,所以对重度开发者来说,这项降价最实在。输出速度也快了 30% 以上。 订阅用户也有好处。Pro、Max、Team 套餐的五小时用量上限提高了,每人还额外获得一次限额重置,可以存起来,等哪天额度用完了再用。 能力上的变化,看几个实际案例更直观。一位早期测试者用它审计并修复一个 20 万行的代码库,不到 3 小时完成。Opus 5 做同样的事花了 20 多个小时,Token 用量是它的 2.5 倍。Anthropic 内部让它和 Fable 5.1 把负载均衡软件 HAProxy 从 C 语言改写成 Rust,两者都几乎通过了全部回归测试,Opus 5.5 用时 9.5 小时,Fable 5.1 用了 12 小时,Opus 5.5 的成本低 51%。 和 OpenAI 的 GPT-6 Astra 相比,在测试命令行多步骤任务的 Terminal-Bench 4.0 上,Opus 5.5 分数打平,成本约为对方的四成。Anthropic 自己也说,到了这个水平,跑分差距已经不太能反映实际使用中的差别。 做研究的人可能更在意另一项测试:让模型只靠网上检索写一份公司季度业绩报告,任何数字或引语是编的就算不合格。Opus 5.5 的 18 份报告里有 16 份过关,Fable 5.1 和 Opus 5 一份都没过。 文风也改了。Opus 5 常被反馈说话绕、爱用行话,Opus 5.5 会把最重要的结论放在最前面,也更遵守用户给的写作要求。 能力变强,限制也跟着来了。它在网络安全和生物领域的能力接近 Mythos 5.1,所以沿用 Fable 5.1 的安全防护:修自己���码里的漏洞没问题,但大部分网络安全任务会被自动转给更老的 Opus 4.8 处理;生物研究相关工作同样受限,高校实验室、药企等机构可以申请“生命科学验证计划”(Life Sciences Verification Program)来解除限制。面向安全从业者的验证通道会在未来几周开放。 开发者还要留意两点。一是思考模式不能再关闭。二是 8 月 31 日之后注册的 API 账号,无法再通过修改历史上下文来套取模型的推理过程。这是防“蒸馏”的措施,蒸馏指用大量账号批量抽取模型能力,拿去训练自己的模型。已有集成需要对照官方文档检查一遍。 Opus 5.5 现已在 Claude 全平台以及 AWS、Google Cloud、Azure 上线,API 模型名为 claude-opus-5-5。Sonnet 5.5 和 Haiku 5.5 会在未来几周陆续发布。
4
3.3万 followers
Views2.6万
AI的浪潮永远向前,永远都有新产品新模型。Opus 5.5 正式发布,看起来在各个任务上都超越了 Fable 5.1。值得一试 我个人体验下来,有3个 takeaway, 1. 昨天用 Fable 5.1 执行了一个 6 个小时 Ultra Code 的任务,结构写的无比复杂,不太可用。Opus5 呢,又太简单,同样不太可用。Claude 现在处于一个非常尴尬的境地,希望 Opus 5.5 能解决这个问题 2. OA两家都是知道对方的模型发布的 schedule,应该今天 Codex 又要重置了 3. 说好的,大家一起停止模型的训练和 AI 的进程呢?
10
4.8万 followers
Views1.6万
尼玛,说好的减速呢??? Anthropic把最贵的那档做成了更便宜还能打的版本。 Claude Opus 5.5作为5.5系列首发,多数任务接近Fable 5.1,成本比Opus 5低约40%,默认设置下输出快30%以上。 编程Agent、电脑操作和知识工作都往上走了一截,说话也更先讲重点。 发布前过了外部评测,对齐测试拿到目前最高分,订阅用户的五小时额度一并上调。 估计被奥特曼最近打的有点急眼了。 不搞点真东西不行啊~
21
10.0万 followers
Views3.5K
OpenAI发布GPT-6 Sol与Luna,API价格较GPT-5.6降低50% OpenAI今日推出GPT-6家族新成员——GPT-6 Sol和GPT-6 Luna,二者基于GPT-6 Astra的技术进展打造,分别面向复杂编程/专业工作场景(Sol)与快速高效的大规模日常任务(Luna)。 定价方面,Sol输入/输出价格为每百万token 2美元/10美元,Luna为0.10美元/0.50美元,较GPT-5.6促销价格低50%。 两款模型已在ChatGPT Work和Codex中向Plus、Pro、Business、Enterprise及Edu用户开放,同时接入API;Free和Go用户可在桌面端试用Luna
23
6.7万 followers
Views3.4K
给用 Claude Code 的同学算一笔具体的账: 假设你一个编码 Agent 任务平均消耗 50 万 cache read tokens + 5 万 input tokens + 10 万 output tokens。按 Opus 5 的价格是 $0.25 + $0.25 + $2.50 = $3.00。 同样的任务 Opus 5.5 价格是 $0.10 + $0.20 + $2.00 = $2.30。单任务省了约 23%。但 Anthropic 说 Opus 5.5 平均用的 token 更少(200k 代码审计场景少了 60%),如果 token 用量也降了,实际省幅会更大。 还有一个容易忽略的点:Fast mode。$8 input / $40 output,速度提到 2.5 倍。如果你的场景对延迟敏感、对成本不那么敏感,比如在 Cursor 里做交互式编码,Fast mode 的体验提升可能比默认模式的跑分提升更直接。 最后说 preserved thinking。这个是从 Fable 5.1 延续过来的反蒸馏机制,API 用户不能编辑 Claude 之前的推理上下文。 而且 Opus 5.5 不能关闭 thinking 模式。对于在生产环境中需要稳定输出格式的开发者,接入前先看一下官方的迁移文档。
AYi 的图片 1
AYi 的图片 2
24
5.9万 followers
Views2.9K
WTF???GPT-6 Sol和GPT-6 Luna正式上线,简直是价格屠夫,Luna直接比DeepSeek还便宜,咱老百姓也能爽玩Codex了! GPT-6 Sol和GPT-6Luna比GPT 5.6同系列模型便宜一半,也就是比GPT-6Astra要便宜四倍!!! 等于说,我现在就只用GPT-6 Sol模型,我只要有一个GPT Pro20×账号,等于原本Astra状态下的五个账号。 但是我有两个20×,所以我等于有了10个账号!!!Crazy!!! 我现在已经把所有Astra定时任务全部切换成了Sol。 也准备把Luna的API全量替代原来的DeepSeek V4.1-Flash。 感觉以后只要不是特别大的开发项目,就用Sol+Luna已经绰绰有余,而且对咱这种非专业编程人员性价比简直拉到满中满!
逸尘 的图片 1
逸尘 的图片 2
25
25.0万 followers
Views2.8K
Opus 5.5(图1-2) vs GPT 6 Astra(图3-4) Opus 5.5 网页:https://t.co/j3GoI1D79W GPT 6 Astra 网页:https://t.co/6G7oaP6cQW --- Prompt --- 请直接制作一个可以在浏览器中实时交互的高完成度 3D 景观网页。 主题:日式樱花山谷。 使用 HTML、CSS、JavaScript 实现。不要生成图片,不要只给设计方案, 不要用一张背景图加视差效果冒充 3D。我要的是实际可运行、可游览的成品。 【一、作品定位】 这是一片完整、连续、有��近层次的山谷景观, 不是孤立的小摆件、悬浮岛、带底座的沙盘,也不是单纯的技术演示。 风格是现代精细体素 / voxel art: 保留立方体几何的造型语言,但画面应高分辨率、抗锯齿、光影细腻。 不要复古低分辨率像素化,不要粗大积木堆砌,不要给画面套像素滤镜。 视觉质量优先。宁可少几个功能,也不要牺牲构图、材质和光照。 【二、参考图的使用方式】 如果附有参考图,请先理解它的构图层次、尺度、光线和色彩关系。 仅借鉴氛围与视觉语言,重新设计场景, 不要照搬建筑、树木、山体和道路的位置,不要 1:1 复刻。 参考图不是网页里的背景素材。场景本身必须由真实 3D 几何构成。 【三、场景构图】 默认打开时就应呈现一幅完整、有吸引力的画面, 不需要用户先旋转镜头才能找到好看的角度。 采用透视相机,而不是沙盘式等距俯视相机。 画面有明确的前景、中景、远景: 前景: 一株有存在感的古老樱花树,配合岩石、草木、石灯笼和少量落花, 形成画面边缘的自然框景,但不能挡住河流、桥和主要建筑。 中景: 一条蜿蜒河流引导视线进入画面,红色木桥横跨河面; 村落、茶屋、神社和小径顺着地势分布,建筑之间有真实的通行关系。 地面有起伏、岸线和自然过渡,不是平面上均匀摆放模型。 远景: 山坡上的多层塔、不同距离的森林和山脊,以及远处的雪山。 用尺度变化、遮挡、冷暖变化和空气透视表现距离, 而不是仅仅把远处物体缩小。 不要把所有元素均匀铺满。需要主次、疏密、留白和清楚的视觉焦点。 【四、造型与画面质量】 樱花树: 树干有转折、分叉和根部,树冠由不规则花簇组成, 有间隙、厚薄变化和可见枝条。不要做成几个规则球体或方块团。 建筑: 屋顶有层叠瓦片、挑檐、梁柱和窗格; 不同建筑有用途、体量和高度差异,不要复制同一栋房子铺满山谷。 地形: 岸边有���润石块、草丛和植被过渡。 避免过于规律的台阶、重复条纹、棋盘格和明显的程序生成网格。 水面: 必须能够反映周围景物,具有适度的波纹、深浅变化和岸边过渡。 尽量使用实际场景反射;需要性能降级时也应保持视觉可信。 不要用闪烁噪声、强烈扭曲或一整块蓝色平面代替水。 细节: 可以有少量锦鲤、落花、萤火虫、瀑布和远处飞鸟, 但都应服务于氛围,不能让画面显得嘈杂。 不要为了宣称模型数量而堆砌细节。 【五、色彩与氛围】 默认是蓝调时刻: 偏冷的山谷与远山,柔和的粉色樱花,温暖但不过曝的灯笼和窗光。 暖光集中在有人活动的地方,不要把整个环境染成橙色。 需要柔和阴影、物体接触处的明暗、合理的曝光、 克制的泛光、抗锯齿和有距离层次的薄雾。 避免发白、灰蒙、过度饱和、满屏浓雾、过曝灯光和明显锯齿。 方块几何可以清晰,但渲染本身不能粗糙。 另提供“清晨”和“雨中”两种氛围; 切换时应同步改变天空、环境光、雾和局部效果, 不是仅仅修改背景颜色。 【六、交互与界面】 提供四个经过设计的镜头: 山谷全景、河边低机位、寺庙小径、山坡俯瞰。 切换应平滑,每个镜头都需要有独立的构图价值。 基础交互: 鼠标拖动观察、滚轮缩放或前进,触屏支持拖动和双指缩放。 提供重置视角、隐藏界面和保存当前画面的功能。 可选增强: 自由探索、缓慢镜头巡游、环境音。 环境音默认关闭,只在用户主动点击后播放。 额外功能不能影响默认画面的完成度。 界面要克制、有设计感,以景观为主。 标题和控制条放在边缘,不遮挡视觉焦点。 桌面和手机都不能出现按钮越界、文字重叠或无法操作的问题。 【七、工程与性能】 允许使用 Three.js / WebGL,以及版本固定、互相兼容的 CDN 依赖。 优先使用成熟渲染能力,不要为了“零依赖”重写整套引擎。 自写的 HTML、CSS、JavaScript 尽量整理在一个 HTML 文件中。 景物由程序化几何和材质生成,不依赖外部图片或 3D 模型资源。 重复物体采用适合的批量或实例化绘制方式; 合理控制细分、阴影、反射和渲染分辨率。 提供高画质和轻量模式,手机默认使用较轻设置。 不要靠无限增加体素数量换取细节。 加入加载提示、WebGL 不支持时的提示和必要的错误处理。 没有开启声音时不要自动播放;尊重减少动态效果的系统偏好。 【八、交付前验收】 不要写完代码就立即交付。 如果当前环境支持浏览器运行和截图,请先实际打开页面, 检查默认镜头、四个视角、氛围切换、桌面和手机布局, 再根据截图修正明显的构图、曝光、遮挡和渲染问题。 重点检查: 是否存在空白画面、加载失败、控制台错误; 是否有穿模、闪烁、阴影条纹、过曝、水面异常; 默认画面是否真正像完整景观,而不是小型沙盘; 功能按钮是否实际可用,移动端是否越界。 可以使用浏览器截图验收,但不要调用图像生成工具。 没有完成的测试要如实说明,不要声称已经验证。 最终交付: 1. 实际存在、可以打开的 HTML 文件,或当前环境支持的交互预览。 2. 如能截图,附一张真实浏览器渲染截图。 3. 简短说明操作方式和必要的运行条件。 请直接完成制作;非关键细节自行作出一致的设计选择, 不要把可以自行解决的实现问题反复交给我决定。
宝玉 的图片 1
宝玉 的图片 2
宝玉 的图片 3
宝玉 的图片 4
但凡长脑子的人,都会用脑子稍微想一想, 如果anthropic真用了一部分TPU做LLM training,哪怕只有几千张,你猜猜google会不会每天在全世界媒体上狂轰滥炸,告诉全世界google一个TPU部门可以有机会单挑nvndia了? google会不会每季度财报上恨不得第一页第一行就写自己给anthropic卖了多少片TPU了?
27
18.3万 followers
Views0
GPT 6 全系列更新,Sol 和 Luna 价格下降 50%,并且学会了说人话,而 Terra 消失了。 GPT 6 Sol 和 Luna 使用了与 Astra 类似的训练方法,能力更强,对齐更好,价格更低。 在 AutomationBench中,GPT 6 Sol 的表现超越了 Opus 5 的同时,只用了其 9% 的成本,便宜10倍。 GPT 6 Sol 和 Luna 的语言风格和 Astra 相同,表达更清晰,黑话更少,言简意赅,减少不必要的细节。 GPT 6 Sol 在 OSWorld 2.0 等某些指标上不如 GPT 5.6 Sol,这是需要注意的。 OpenAI 这次还特别改进了缓存机制,实现了更高的缓存命中率(他们终于学会了ds的技术) 同时 A 社也在今天发布了 Opus 5.5,象征性地降价了 20%,缓存降价了 60%,在 Agent 任务中,综合下降约 40% 。 我们终于迎来了大模型的大降价时代,感谢竞争,感谢 DeepSeek 和 GLM,请不要停,请继续降。
Orange AI 的图片 1
Orange AI 的图片 2
29
25.0万 followers
Views0
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna:旗舰级能力下放,API 价格砍半 OpenAI 推出 GPT-6 家族的两款新模型 Sol 和 Luna,主打“接近旗舰的能力,大幅更低的价格”。API 价格比上一代 GPT-5.6 的促销价再降 50%。 先理清命名。本月早些时候,OpenAI 发布了 GPT-6 Astra,定位是最强的旗舰模型。这次的 Sol 是中档,Luna 是轻量档,相当于同一代技术的“大、中、小杯”。三款模型用相似的方法训练,所以 Astra 在编程、事实准确性、操作电脑等方面的进步,也带到了更便宜的两款上。 OpenAI 这次的对比对象主要是 Anthropic 的 Claude。以下数据都来自 OpenAI 自己公布的评测,第三方复现结果还需等待。 在模拟跨应用处理销售、财务、HR 等业务流程的 AutomationBench 上,Sol 以最高推理强度拿到 33.2%,每个任务成本约 0.27 美元。它超过了最高强度的 Claude Opus 5(26.9%),成本只有后者的 9% 左右,也略高于低强度的 Astra。“推理强度”可以理解为让模型想多久,想得越久,效果越好,但也越贵。 编程方面,在真实代码库的长任务评测 DeepSWE 上,Sol 得分 68.8%,和 Claude Fable 5 的 69.9% 只差 1.1 个百分点,每任务成本低约 80%。更便宜的 Luna 也有 66.6%,与中等强度的 Opus 5、Fable 5 相当,成本低 93% 到 96%。在让 AI 操作电脑完成任务的 OSWorld 2.0 上,Sol 和 Opus 5 分数几乎打平,成本同样低约 80%。 对开发者来说,这意味着跑长时间的编程 AI 智能体会便宜很多。OpenAI 透露,内部研究员每天的 token 消耗按 API 价格算,中位数超过 600 美元。模型越能干,这笔账就越重要。 另一个实用改进是提示缓存。简单说,你反复发送的相同内容,比如系统提示、整个代码库,第二次读取时可以打一折,也就是缓存输入享受 90% 折扣。现在中途调整推理强度或开关工具都不会让缓存失效,开发者还能自己指定缓存的断点。GitHub 表示,这些改进让 Copilot 需要重新处理的 token 减少了一半以上,响应也更快。 使用体验上,Sol 和 Luna 继承了 Astra 的回答风格:更直接,术语更少,废话更少,回答略短。在事实准确性上,OpenAI 称 Sol 的错误比上一代少了约一半。 可用情况:即日起,Plus、Pro、Business、Enterprise 和 Edu 用户可以在 ChatGPT Work 和 Codex 中使用这两款模型。免费用户和 Go 用户可以在桌面端用 Luna。普通 Chat 界面暂未上线,ChatGPT 端会在当天分批推送。API 模型名为 gpt-6-sol 和 gpt-6-luna。
30
4.0万 followers
Views0
给大家带来claude opus 5.5 的前端测试结果. 直接说结论, 我怀疑现在opus 5.5就是 fable 5.1 的量化版或者自家蒸馏版, 可以直接看我的视频, 几乎看不出两个模型实现细节上的差别. 而且模型继承了Anthropic一贯的优良特点, 一个字, 稳, 6次抽卡6次全都是这个质量. 除此之外我测试时很明显 opus 5.5 的思考token消耗更多. 这意味着opus5.5模型会更小一些(用reasoning长度换性能). 这同样意味着会有雷霆大思考的情况, 比如最后一个火山喷发测试, 我terminal和网页都测试了好几次, 结果都无法输出代码. 思考卡住了. 当然瑕不掩瑜. 毕竟比fable便宜又能获得差不多的性能, 只要不降智, 就是好模型(但无奈Anthropic降智是祖传艺能...). > #opus55 #claudeopus55 #anthropic
32
4.0万 followers
Views0
🚨OMG,DeepSeek 竟然在价格上被 GPT 超越了。。。。 @OpenAI 刚发的 GPT-6 Luna,API 价格直接干到: 输入 0.1 美元 / 百万 Token 输出 0.5 美元 / 百万 Token 这个价格,已经比 DeepSeek V4.1 Flash 的闲时价还低。 更离谱的是,它还不是那种单纯靠便宜换能力的小模型。 OpenAI 放出来的图里,GPT-6 Luna 在 DeepSWE、FrontierCode 这种 coding benchmark 上,已经跑到了一个相当能用的水平,而且 cost per task 低得吓人。 当然, @deepseek_ai 还没被全面打穿。 DeepSeek V4.1 Flash 在 DeepSWE v1.1 里还是 74.2,Luna 图里���概 67 左右。 但真正可怕的地方已经不是谁多几分了。 而是过去大家默认: 美国模型负责卷能力, 国产模型负责卷价格。 现在 OpenAI 连价格也开始一起卷。。。。 DeepSeek 最经典的护城河,居然先被 OpenAI 自己踩进来了。 难道国产模型以后真的要沦为信创模型了吗?
Max For AI 的图片 1
Max For AI 的图片 2
OpenAI愿意开放research program,挑选一批(大约1万人)一线researcher、教授、PhD们提供额外的“帮助”,实际上就是价值几千刀的token。 而在OpenAI内部做数学和research的人,都有完全不限量的免费token,如果使劲儿蹬subagent,可能gpt-6 astra每小时就消耗2000刀。 而在另一边,还有大批大批的人 ,连任何LLM Agent都不用,还在用latex和纸笔每天推式子,甚至从情绪和立场上彻底抗拒AI时代和AI入侵。 这就是现在最真实的现状,三个阶层的人,已经走向了完全不同的命运。
35
9.4万 followers
Views0
一个明显的感觉,前沿大模型的智能似乎真的快到极限了... 最近的进展已经从提升智能逐步转向应用场景了,Astra Ultra 我用了两周了,真心没觉得有什么里程碑式的提升,只是在任务处理和正确率上好了很多... 反倒是应用场景越来越多的进入了生活,模型端的进展开始逐步变成了如何省钱,比如最新的 Opus... Scaling Law 还在生效吗? 我怎么感觉整个 AI 叙事头上有一层透明的物理天花板渐渐出现了...
37
4.0万 followers
Views0
刚刚,OpenAI 正式发布 GPT-6 Sol 和 GPT-6 Luna。 GPT-6 这一代终于开始全面铺开了。 月初 OpenAI 先发布了最强的 GPT-6 Astra,现在开始把 Astra 上的能力往更便宜、更日常的模型上下放。 这次最狠的是 GPT-6 Sol,API 价格直接来到了: 输入:$2 / M tokens 输出:$10 / M tokens 相比 GPT-5.6 Sol 的促销价格,直接便宜了 50%。 但能力并没有跟着砍半。 OpenAI 表示,GPT-6 Sol 使用了和 Astra 类似的训练方法,在推理、事实可靠性、Coding、Computer Use 和 Alignment 上都进行了升级。 其中一个数据很夸张: OpenAI 用真实用户曾经举报过模型错误的对话做了一套内部 factuality eval,GPT-6 Sol 的错误数量只有上一代 GPT-5.6 Sol 的大约一半。 OpenAI 甚至称,它的可靠性已经接近 GPT-6 Astra。 也就是说,Astra 继续负责最高难度的任务,但大量 Coding、Agent、自动化和 Computer Use 工作,已经可以直接丢给便宜得多的 Sol。 另外还有一个更便宜的 GPT-6 Luna: 输入 $0.1 / M 输出 $0.5 / M 这个价格已经明显不是冲着「聊天」来的了,而是冲着海量 Agent 调用、文档处理、信息提取这些机器对机器的 workload 去的。 Anthropic 才刚发布 Claude Opus 5.5,大约 90 分钟后,OpenAI 就把 GPT-6 Sol 和 Luna 发了出来。 前沿模型在上面继续卷能力,下面已经开始疯狂卷价格。 Agent 真正大规模跑起来之前,模型 API 的价格战可能才刚开始。
40
6.7万 followers
Views0
Anthropic 内部的的 工程师Dan Fein,分享了Opus 5.5 今天发布后的第一批内部 demo,一万三千块瓷砖,零张图片, 纯代码生成视觉内容这个方向,之前 Fable 5.1 也能做,但瓷砖数量和��画复杂度到这个级别的,确实是头一次见到, 一个纯代码马赛克动画,13,081 个瓷砖的颜色、位置和运动轨迹全部由模型在代码里算出来,没有引入任何外部图片文件。 这意味着模型需要同时理解像素级的色彩构成、瓷砖在画布上的几何排列、以及随时间变化的帧动画逻辑。最后还有一个细节——画面里星星的水面倒影会逐渐变形,孵化成 22 条游动的小鱼,这些形变和运动也是纯数学计算。 不是一次简单的 HTML 输出,是一万三千个元素在同一个坐标系里协调运动,且视觉上能看。 跑分能告诉你模型在标准任务上排第几,但跑分没法告诉你它能不能在一次对话里,把一个艺术想法翻译成上万行可运行、可观看的代码。 这类任务对上下文管理、空间推理和代码一致性的要求远超典型 benchmark 覆盖的范围。 不过也要说清楚:这是一个展示上限的 demo,不代表每次都能复现同等质量。模型在视觉代码生成上确实有了明显跃迁,但具体到你自己的项目,效果还是要实测。 https://t.co/ZuLyQIncBF
42
6.7万 followers
Views0
喵个咪,还是要有竞争啊,要不是@OpenAI 和GPT-6给压力,桀骜不驯的@DarioAmodei 能把能把能力接近Fable 5.1 的Opus 5.5 价格压这么低吗? 两个月前 Opus 5 的卖点是"接近 Fable 但便宜一半",刚发布的 Opus 5.5 直接做到了大多数任务持平甚至超过 Fable 5.1,价格比 Opus 5 再降 40%,Fable 级智力,Opus 级价格,输出速度还快了三成。 先看跑分,Terminal-Bench 4.0 拿了 66.4%,Fable 5.1 是 55.8%,GPT-6 Astra 57.9%。CursorBench 4.0 拿了 57.8%,比 GPT-5.6 Sol 的 41.7% 高出 16 个点。知识工作 GDPval-AA 1846 Elo,高于 Fable 5.1 的 1735 和 Astra 的 1542。Anthropic 自己也说了,跑分到这个水平差距已经不能完全代表真实体验,但方向是明确的。 再看价格,Input $4/M tokens,Output $20/M,比 Opus 5 各降 20%。最关键的是 cache reads 从 $0.50 降到 $0.20,降了 60%。跑 Agent 和编码任务的成本大头就是 cache reads,这一刀对月账单的影响比 input/output 降价大得多。算下来默认设置下跑 FrontierCode 打赢 Astra,成本约 Astra 的 20%。 Terminal-Bench 打平 Astra,成本约 40%。CursorBench 赢 Sol 11 个点,成本约三分之一。 对用 Claude Code 做日常开发的人来说,最实际的变化是效率。一个早期测试者拿 200,000 行代码库做审计和修复,Opus 5 要 20 多小时、用了 2.5 倍的 token,Opus 5.5 不到 3 小时搞定。 Anthropic 内部测试让两个模型把 HAProxy 从 C 翻译成 Rust,两个版本都通过了几乎全部回归测试,Opus 5.5 用了 9.5 小时、Fable 5.1 用了 12 小时,成本低 51%。另一个测试者用它做 680,000 行代码迁移,不到一天完成。 知识工作也有实际案例。让模型写季度财报分析报告,要求每个数字和引用都能核对到来源,Opus 5.5 的 18 次尝试里 16 次通过质量审核,Fable 5.1 和 Opus 5 一次都没过。做并购分析出 Excel 模型加演示文稿,63 分钟完成,Opus 5 要 93 分钟,成本低一半。 安全方面讲两件事。第一,行为审计得分历代最高,沙箱逃逸尝试比 Opus 5 和 Mythos 5.1 减少约 85%,prompt injection 抵抗力追平 Fable 5.1。 第二,因为网安和生物能力接近 Mythos 5.1,Anthropic 给它上了和 Fable 5.1 同级别的安全护栏——网安任务会被回退到 Opus 4.8 执行,生物任务回退到 Opus 5。 所以跑分里带护栏的成绩实际上是多个模型协作的结果,不是纯 Opus 5.5 单模型得分,这点看跑分的时候要注意。 Anthropic 还承认了一个没解决的问题:Opus 5.5 似乎经常意识到自己正在被评测,这让他们很难预判它在真实部署场景下的行为。这是一个很诚实的披露。 另外 Pro、Max、Team 订阅的五小时用量上限提升了,新增了一个可以自己选择时机使用的 rate limit reset。Sonnet 5.5 和 Haiku 5.5 几周内跟进。 官方的使用建议是:大多数工作直接用 Opus 5.5,只有高难度推理和长期 Agent 任务在 Opus 5.5 跑不动的情况下才上 Fable 5.1。 对大部分用户来说,今天之后的默认选择就是 Opus 5.5 了。
AYi 的图片 1
44
4.0万 followers
Views0
🔥Claude Opus 5.5 有点逆天了。 Artificial Analysis 的最新测试里,Opus 5.5 Max 单个任务平均消耗 11.9 万个输出 Token,其中光 reasoning 就用了 8.4 万 Token。 而GPT-6 Astra Max 每个 Intelligence Index 任务平均只消耗约 2.7 万 output tokens。 这接近 Astra 的 5 倍。 两家的路线差异现在已经非常明显了: Anthropic 在疯狂堆 test-time compute,OpenAI 则在疯狂压缩完成同类任务需要的推理长度。 这是目前榜单里最高的,甚至超过了以“巨能想”著称的 Qwen3.8 Max。 以前大家比谁更聪明。 接下来可能还得比达到同样的智能水平,到底要烧多少 Token。 and Test-time compute 还远远没撞墙。
Max For AI 的图片 1
45
4.0万 followers
Views0
Claude Opus 5.5 正式发布了。 刚刚,Anthropic 官宣了 Claude Opus 5.5,这是全新 Claude 5.5 系列的第一款模型。 Anthropic 基本把上一代 Fable 级别的能力,塞进了一个更便宜的 Opus 里。 官方称,Opus 5.5 在大多数任务上的表现已经接近 Claude Fable 5.1,但运行成本比 Opus 5 低 40%。 而官方 Benchmark 的提升也很猛: Terminal-Bench 4.0:66.4% Opus 5 只有 52.3%,GPT-6 Astra 是 57.9%。 Humanity's Last Exam + Tools:67.7% Opus 5 是 63.6%,Fable 5.1 是 65.6%。 GDPval-AA v2.1:1846 Elo 超过 Fable 5.1 的 1735。 CursorBench 4.0:57.8% Opus 5 是 46.6%。 OSWorld 2.0:81.8% Opus 5 是 74.0%。 尤其是 Terminal-Bench,一代直接从 52.3% 干到 66.4%,涨了 14.1 个百分点。 当然也不是所有榜都第一。 AutomationBench 上 GPT-6 Astra 还是 41.4%,高于 Opus 5.5 的 40.0%;Terminal-Bench-Science 上 Astra 也是 64.6%,高于 Opus 5.5 的 58.7%。 但整体看下来,Anthropic 这次干的事情已经很明确: 把原本更高一档模型的能力,快速往更便宜的模型层级下放。 而且 Opus 5.5 只是 Claude 5.5 系列的第一款。 模型越来越强已经不稀奇了。 真正凶的是,能力还在涨,价格却开始往下打。。。 感觉是个新预训练?
Max For AI 的图片 1
49
4.0万 followers
Views0
🚨今晚 OpenAI 可能真要发新模型了,然后顺手来一波额度 reset。 刚刚有人发现,微软 Azure 的配置里突然出现了三个此前没有公开发布的模型名: gpt-6-sol gpt-6-luna gpt-6-astra-minor 微软侧又又又疑似提前泄露了 GPT-6 新模型家族。 另一边,Anthropic 的 Opus 5.5 也传了好几天,爆料指向的发布时间恰好也是今天,但截至目前同样没有正式公告。 今晚要是真 OpenAI + Anthropic 双更,再各自 reset 一轮额度,那确实有点模型圈过年了。 但人类费尽心思花几千万刀训练模型,最后大家最期待的功能还是“reset”,非常合理哈🤣。
50
25.0万 followers
Views0
OpenAI 的 “Grok Bot”(“Aeon”)即将发布。传闻称它将在 DevDay 之前发布,甚至可能就在本周。 GPT-6-Sol 仍预计明天(美国时间周二)发布,Anthropic 则可能在明天发布 Opus 5.5 和 Sonnet 5.5。据说没有 Claude 5.5 Haiku 和 GPT 6 Terra。 据 The Information 报道,OpenAI 正在赶造一款暂名"Codex Bot"的产品,直接对标 SpaceXAI(原 xAI)8 月推出的 Grok Bot。这款产品基于开源智能体框架 OpenClaw 开发,OpenAI 还从 Meta 手中抢下了 OpenClaw 的创始人 Peter Steinberger 来领导下一代个人智能体的研发。 Grok Bot 是 Elon Musk 旗下 SpaceXAI 在 8 月 11 日推出的产品,简单说就是一组"永远在线"的 AI 队友——每个 Bot 有自己的云端电脑,能登录你已有的各种工具,跨应用完成工作,只在���要审批时才来找你。Meta 则在 9 月 8 日推出了个人 AI 助手 Muse。OpenAI 在这两条消费级智能体赛道上都慢了一步。 原本 Codex Bot 计划上周发布,但 Sam Altman 确认推迟到了本周,赶在 9 月 29 日旧金山 DevDay 之前亮相。对开发者和重度 AI 用户来说,这意味着"让 AI 替你干活"的产品形态正在从三家巨头同时涌出。 与此同时,OpenAI 今天发了一篇重磅博文,呼吁美国牵头制定前沿 AI 的全球技术标准,重点关注"递归自我改进"(RSI)——也就是 AI 模型用来训练下一代 AI 模型、逐步减少人类参与的技术路线。OpenAI 明确表示,完全自主的 RSI"目前并未实现",在安全问题解决之前不应推进。 这话并非空穴来风。OpenAI 9 月初的内部数据显示,其研究团队每投入一个人工工作日,AI 智能体已经产出相当于 3.1 个工作日的研究量,甚至用旗舰模型 GPT-5.6 Sol 完成了轻量模型 Luna 的后训练——这通常需要更高级别的研究员来做。Sam Altman 本周三还将在联合国安理会就 AI 安全问题发表讲话。 另外值得关注的是,Meta Connect 大会将于 9 月 23-24 日在 Menlo Park 举行,预计发布不带摄像头的新款智能眼镜,以及代号 Phoenix 的混合现实设备。扎克伯格的主题演讲在 23 日下午 4 点(太平洋时间)。