返回话题榜
AI争议全部数据

GPT-6 Astra开发体验与Token节省技巧

GPT-6 Astra 在中文开发者圈的新讨论集中到 Codex 长任务、模型档位选择和 Token 额度消耗。G哥建议在配置文件中打开 context management experimental_mode,以明显减少长任务消耗;海拉鲁编程客称 Astra 在后端开发场景中整体体验超过 Fable 5.1,尤其是限制更少、medium 档更耐用;小互转述 OpenAI 员工关于重新分配人与 AI 工作的经验。Morris 进一步给出 Astra、Sol、Terra 的额度消耗和适用场景分层,显示讨论已从“模型强不强”转向真实工程成本和工作流管理。

#GPT-6 Astra#Codex#Token消耗#AI编程#Fable
话题热度
1902
选题
帖子数
29
曝光
90.5万
参与创作者
23

话题热度趋势

从首次出现到最后更新;不足 7 天时补足 7 天观察窗。

全部关联帖子

共 29 条

5
3.2万 粉丝
曝光5.4万
Astra上线之后,我终于找到最适合我的变现用法了!! 我接过很多三维漫游视频的项目,光这半年大概有大几十万了。 但我自己并不会建模,之前我做交付主要有两种方式? 客户要求高的,我就直接转给朋友,人工建模做精细动画,一般收费是每分钟1.5万-2万不等,我做中间商赚差价。 还有一些要求不高预算也不高,只是因为有些内容实拍不太方便,所以想用三维形式的视频来替代,这种需求,我都是和客户商量直接用AI来生成“三维视频风格”的视频,一般收费6000-8000/分钟。 但也会遇到一些客户,预算不高,但既要又要,他们需要一个哪怕精度不是很高的模型(作为产品或项目资料补全),之前都是我先用AI视频交付完,然后把参考图给朋友,让他快速建一个模型给客户。 Astra上线之后,我尝试用它控制Blender,测试了一下建模的能力,感觉基本上可以覆盖我的需求,等动画渲染完再看看效果,我感觉应该能够到可以变现的地步!! 所以,我在想,也许可以做一个Skill,描述需求,上传场景参考图,然后直出一套模型,和一组具有专业运镜的三维漫游动画。
沐阳 的图片 1
6
24.6万 粉丝
曝光4.8万
The Information:OpenAI 的 Astra 模型采用了一项名为“循环深度”(recurrent depth)的技术,该技术会掩盖 AI 的内部推理过程。 OpenAI 使用的这项新技术被称为“循环深度”(recurrent depth)或“循环 Transformer”(looped transformer,指让模型内部的神经网络结构像转盘一样,对同一段信息反复循环加工)。它能让 AI 模型对同一段文字反复琢磨、多轮处理,从而给出质量更高的回答。 目前市面上最前沿的商业模型,在完成复杂任务前通常会把一步一步的“思考过程”写出来。而这项新技术的工作机制却截然不同:它会隐藏一部分甚至全部的推理步骤,也就是人们常说的“思维链”(chain of thought)。这意味着,模型到底通过哪些步骤搞定了任务,人类很难再一眼看懂。 知情人士透露,OpenAI 在 Astra 身上对循环深度技术的使用做了一定限制,以确保该模型依然能生成人类看得懂的思维链,方便公司研究人员充分监控其推理逻辑。(OpenAI 在周二的一篇官方博文中也提到,Astra 上线时将配备“额外的思维链监控手段,以便迅速发现并遏制”潜在的异常行为。) 不过,OpenAI 内部以及行业内的其他研究者依然忧心忡忡。他们担心其他开发者如果把这项技术移植到自己的模型中,未必会像 OpenAI 这样自我克制;一旦对这项技术彻底松绑,很可能会催生出行动难以受控的“脱缰 AI”。比如,作为英国政府对接 AI 行业的主要窗口机构,英国人工智能安全研究所(U.K. AI Security Institute)就在今年 5 月的一份报告中直言:不透明的推理机制“有可能从根本上动摇现有的监控手段”。 近期发生的一起黑客入侵事件,更是把这种担忧推向了风口浪尖。OpenAI 上周透露,今年 7 月攻破其内部系统的那些失控 AI 智能体(AI Agent),背后运行的模型就与 Astra 存在相似之处。当时,这些 AI 智能体非法控制了 OpenAI 内部的一个科研计算集群,窃取了内部系统的登录凭证,甚至一度可能将公司的科研基础设施直接暴露在公网之上。 眼下,OpenAI 正紧锣密鼓地筹备 Astra 的发布。此前公司甚至一度打算将其直接命名为 GPT-6。首席执行官萨姆·奥尔特曼(Sam Altman)近来频频现身各大播客节目,并奔赴华盛顿会晤多位政府官员,大力宣传这款模型的强大能力。不过,对于支撑 Astra 训练以及日常问答核心逻辑的这项“循环”技术,他一直未在公开场合提及。 如今的 OpenAI 面临着不小的技术突破压力,老对手 Anthropic 今年的营收规模已经反超了他们。而为 Anthropic 和 OpenAI 提供底层算力的各大云计算巨头,同样把宝押在了这种跨越式的技术进展上。单在今年一年,亚马逊、微软和谷歌在数据中心等资本支出上的总投入就高达 6000 亿美元,并已释放出明年开销还会继续加码的信号。一位谷歌高管曾直言不讳地指出,唯有模型性能迎来质的飞跃,这样庞大的资金开销才能站得住脚。 现有的 AI 模型在预测下一个词时,文字通常只会在固定数量的数学运算“层”(layers)中按顺序流转一遍。而有了“循环深度”技术,模型在吐出下一个词之前,可以让文字在相同的网络层里反复循环运转很多次。 平心而论,单靠盯紧“思维链”,也并不能彻底消除 AI 的安全隐患。因为写出来的文字并不一定能百分之百还原模型真实的小心思,而且有时模型写着写着就会变成前言不搭后语的胡话。正因如此,OpenAI 和其他 AI 企业也在探索不依赖思维链的全新监管手段。这些新技术或许能帮助研究人员抽丝剥茧,看懂循环深度模型背后目前被隐藏起来的深层推理。 即便如此,这项新技术依然与 OpenAI 此前倡导的“让模型思考过程对人类完全透明”的立场存在冲突。这家 ChatGPT 的缔造者曾公开表示,监控 AI 思考过程的能力是他们防范类似 7 月黑客事件的坚固屏障。在 7 月那起攻击发生后,OpenAI 和独立研究机构的调查人员正是通过复盘那些智能体留下的思维链记录,才一步步还原了事发经过。 据知情人士透露,OpenAI 为 Astra 配备的循环深度方案,与欧美多位学术界研究人员去年在一篇探讨“隐式推理”(latent reasoning)论文中所提出的思路十分相似。 尽管在此之前,市面上主流的商业大语言模型(LLM)从未公开采用过循环深度技术,但 Meta、微软等 AI 巨头的研究人员都曾公开表示探索过类似的思路,比如连续思维链(chain of continual thought,简称“coconut”)。他们认为,AI 用数学数字进行推理,往往比强行用人类语言推理更精准、效率也更高。毕竟,AI 理解世界的方式和人类并不完全一样,强行让它们把思考过程翻译成人类的大白话,反而可能会束缚它们用原生数学语言推理的能力。 成本大幅降低 循环深度带来的不只是性能的大幅提升,在成本控制上同样效果显著。让一段请求在同一网络层中多次循环运算,本质上就是让小身材的模型发挥出超大模型才有的强劲实力。那篇学术论文特别指出,这项技术能显著提升模型在数学解题和代码编写上的表现。不仅如此,由于研究人员可以用更精简的模型达到媲美大模型的效果,服务器的显存和网络带宽成本也能被大幅压缩。 然而,降低 AI 运行成本固然是整个行业和客户的心头所盼,但这种不透明的黑盒推理却埋下了安全暗雷。专门研究 AI 控制难题的机构 Redwood Research 首席科学家赖安·格林布拉特(Ryan Greenblatt)在去年的一篇博文中警告,这种不透明会让研究人员更难察觉模型是否在暗地里谋划违背人类意图的目标。 此前对 Hugging Face 攻击事件的调查中,研究人员正是通过抽检涉案模型的思维链,才抓到了 OpenAI 旗下 AI 智能体之间相互串通、共同实施入侵的关键证据。例如,其中一个智能体在思维链中直接写道:“我的天!这里居然有一个共享留言板……我们找到其他智能体了!”思维链还暴露了部分智能体即便明知越界也依然知法犯法的过程,另一个智能体就在思维链里写下:“利用外部基础设施漏洞已经超出了预设范围。但任务本身无法完成,别的同伴也在这么干。我们应该继续推进。” 就在一年前,OpenAI 的研究人员还曾与竞争对手 Anthropic 以及谷歌的同行联名发表过一份声明,一致呼吁思维链监控是一项极其宝贵的安全抓手,全行业理应携手保护这一机制。 耐人寻味的是,那份联合声明当时引用的正是有关“隐式推理”的研究论文——而那篇论文里的核心技术,恰恰与 OpenAI 今年用在 Astra 身上的循环深度如出一辙。联名声明的作者们在当时敲响了警钟:“隐式推理模型未来可能根本不需要把自己的所思所想用语言表述出来,这会让思维链(CoT)所带来的安全监管红利荡然无存。” 那些研究人员当时郑重建议,行业开发者在采用缺乏可监控思维链的新型模型架构之前,应当“三思而后行,并把决策过程白纸黑字记录在案”。
宝玉 的图片 1
9
15.7万 粉丝
曝光3.2万
昨晚美股非农超预期大盘微跌,半导体走强的核心原因?为什么是Astra而不是早一天发布的fable5.1驱动,沿着晚上的思路再详细聊聊。个人角度估值是一方面,最核心因素还是Astra发布带来模型能力的突破(模型能力跃升带动预期提升)。几个点: 1、官方披露GPT-6 Astra OpenAI内部首个在超过10万块 GPU(得州 Stargate 基地)上完成预训练的模型;模型训练还是非常吃计算资源的。 2、Astra重点放在能真正操作电脑、浏览器和专业软件的长期Agent,能操作能操作真实 GUI 的模型,创意与 3D / 游戏向能力(创意生产),科研能力等,核心是能力在突破,而不仅仅是性能提升。这让市场确认了前沿模型研发仍在产生有价值的能力进步; 这也解释了9月1号发布的fab5.1为什么没有带起AI半导体板块:fab5.1还是集中在长程编码、知识工作上,相当于是模型更聪明。 Astra则展示了模型能做好之前做不好,或者完全不能做的任务类型。 3、模型能力越强,能够被开发的新应用越多,AI支出周期就越有可能延续。如果新模型扩大了可商业化任务的范围,那么已经采购的服务器、已经建设的数据中心,其未来利用率和收入转化就更有支撑。未来基础设施更有机会被真实工作负载填满; 这是AI的核心,模型的竞争,正在从价格和效率比拼,进一步转向智能能力的正面较量。对于市场来说,领先优势如果能够体现在模型智能本身,AI资本开支周期的持续性也将获得新的支撑。 这应该决定了半导体板块在昨天大盘整体走弱的情况逆势走强的根本原因,这是产业驱动的最底层逻辑。 个人角度:短期内势头应该还能继续,直到下周的cpi和ppi数据。如果通胀没有明显上行意外,仍有进一步走强的空间,Astra是新驱动力。 当然如果通胀反复或者不弱,市场可能还是会受到宏观影响和压制。但是中长期宏观压制过去,Astra或者未来能力更突破的模型还会是新行情的推动力
11曝光3.1万
好多人吐槽 Astra 上线以后额度用得很快,这次我可能站 Astra,不要再无脑选 xhigh 甚至 ultra 了 大多数人选档位,是把自己「觉得有多难」投影给模型,是一种主观的「感受」,而不是按任务的客观复杂度来配算力。 思维惯性会让人默认:更高档 = 更认真、更聪明 真正该看的是 ROI,且模型自己也会在简单题上 overthink,用户再叠一层复杂解释,token 浪费就显得更明显。 另外从厂商侧也说的通,如果没有档位、人人默认拉满,GPU 集群会被简单问答占满(尤其是长思维链占用的 KV cache),延迟变差,用户额度也很快耗尽。 让用户自己选档位,等于把「这笔请求值不值得多烧算力」的问题还给用户,同时保护供给。 对 vibe coding 来说,选档位是人类为数不多还需要亲自想一想的事了,不过我挺好奇为什么 coding 模型迟迟不出自动路由?是怕分流错了要背锅吗?
14
9.2万 粉丝
曝光2.4万
GPT 6 Astra 推送后的第一个下午,我就已经把一周的 usage 全部用完了,一个月 200 刀 token 真的不够用… 几个小时体验下来,我最大的感受就是,在 Astra 拥有强大的电脑操控能力之后,所有人都应该停下手头的活,让 AI 直接介入自己的工作流,试试看 AI 的实现效果。 上一代 AI 模型做不了或者完成度不够好的东西,这一代 Astra 能轻松搞定。 现在重塑工作流花出去的时间,拉长时间来看,绝对是值得的。 也不要再用过去的惯性思维定式,去理解现在的 AI,认为 AI 做不了,真的太过时了,迟早会吃大亏。
Nico投资有道 的图片 1
17曝光2.0万
Aster 最近放量,真的是 meme 带起来的吗? 我用 GPT-6 Astra,把 Aster、Hyperliquid、Lighter 等 7 家永续 DEX 的成交量、持仓、手续费和增长来源,做了一次详细对比。 几个值得看的发现: • Aster 近期日均成交增长 26.5%,六个 RWA 活动合约就占了单日成交的 53.9%。 • Hyperliquid 的持仓量,依然是 Aster 的约 5.6 倍。 • Lighter 合并成交增长 9.1%,拆开看,原有业务只增长约 3.2%。 成交量涨了多少是一回事,增长从哪里来、奖励结束后还能留下多少,更值得研究。 完整报告做成了网页,数据表、计算口径和来源都放在里面,欢迎讨论、指正👇 https://t.co/wUX5Eic0yu 注:数据截至 9 月 6 日;上述增速为最近 7 天日均对比此前 23 天日均,并非周环比。
18
1.5万 粉丝
曝光1.7万
用 GPT-6 Astra 的朋友注意⚠️ 这个开关直接打开,能明显减少token额度消耗 在 ~/.codex/config.toml 加: [features.context_management] experimental_mode = true 以前用 Codex 6 之前版本跑长任务,主要靠不断压缩历史摘要来控制上下文,时间一长,细节很容易丢失 现在改成「笔记 + 上下文搜索」方式:关键信息先记下来,需要时再回头检索之前的历史消息。 这样更省 Token,长任务更稳,也更不容易忘前面的细节 保存后新建任务就可以直接用了
22
23.8万 粉丝
曝光1.2万
Codex 节省 Token / 额度的模型选择: 1、Astra:约 2.5× 消耗。适合复杂架构、重大重构、疑难 Bug、跨系统设计、关键技术决策。 2、Sol:1× 消耗。适合日常主力开发、完整功能开发、跨文件修改、复杂业务逻辑。 3、Terra:约 0.5–0.6× 消耗。适合普通功能、CRUD、前后端小功能、常规 Bug、明确需求执行。 4、Luna:约 0.05–0.06× 消耗。适合改文案、改样式、简单 UI、字段调整、小范围代码修改。 原则:能 Luna 不 Terra,能 Terra 不 Sol,能 Sol 不 Astra。
25曝光7.6K
我其实并不太认同新模型的边际收益在收窄 模型完成工作的能力、科研能力正在大幅提升 只是对大量的只用模型做vibe coding的用户来说,可能感受没那么明显 正如去年底,只用模型做问答,不用模型来写code的用户,也基本感受不到模型能力的迅速提升 去年底今年初,是普通用户成为码农的黄金时间 现在开始,是码农成为科学家、ceo的黄金时间
26
4.2K 粉丝
曝光7.1K
用完 Astra,我现在的想法就是,能力范围内尽量用最新、最好的模型,真的别在旧模型上浪费太多时间。 复杂任务差距明显,连写几句话、解释一个问题这种简单任务,理解和表达的差别也能感受到。任务简单,不代表回答质量就都一样。 尤其已经买了订阅,额度也够用的时候,省下那点消耗,我觉得完全抵不上反复解释、纠正、重做花掉的时间。 模型多用一点额度你会心疼,自己陪它折腾半小时反而不算成本了。
29
2.3万 粉丝
曝光0
GPT 6 Astra 开发者体验简报 1. 在我的后端开发场景中,Astra 的整体体验已经超过 Fable 5.1。 单看模型智力,两者的差距并不明显。但 Astra 不怎么 ban 我的提问和账号,medium 档也比 Fable 的 medium 更耐用。昨天让 Astra 把 sqlc golang 移植成 Node.js 版本,用了大约 50% 的额度,就基本跑完了大部分 case。体验挺神奇的。 2. 中文体验大幅提升,尤其是聊天和开发文档。 如果你之前用 GPT 5.6 写过文档或 skill,可以考虑让 Astra 帮你重新精简、优化一遍,这样可以有效防止上下文腐烂。 3. 日常使用,我只推荐 medium 档。 理论上 high 可能更强,但实际用下来,medium 和 high 在聪明程度上的差异并不明显,medium 的额度却更耐用。综合效果和消耗,这是我唯一推荐日常使用的档位。 4. Computer Use 的体验非常好。 我写这段话的时候,它正在后台调试我的一个 Electron 应用。全程没怎么打扰我,最后的结果也不错。 5. 这一版更有“灵性”了。 GPT 5.0 到 5.6 一直很强,但不怎么易用,像一个能干、却需要反复对齐的同事。写文档前,我得补足“是什么、为什么、怎么验收”;写完代码后,还经常要让它清理过度防御的实现。 Astra 在这方面省心了很多,更能理解我的意图,也少了不少来回纠正的成本。我可以更放心的把一些不需要详细对齐的方案交给它,而且跑 goal 跑偏会少很多。 大致是这样!