宝玉

宝玉

@dotey最近同步 2026/9/6 04:14:54

AI Engineer, dedicated to learning and disseminating knowledge about AI, software engineering, and engineering management.

Chicago, IL

7日排名
#29
总粉丝
25万
7日涨粉
+2.0K
7日发帖
44
7日曝光
124万
帖均曝光
2.8万

上榜记录

当日上榜实时更新;历史记录保留每日增粉、发帖、曝光榜前 5 名。点击可查看对应海报。

暂无进入每日前 5 名的上榜记录

粉丝趋势

近7日每日已结算数据

内容表现趋势

曝光/互动与发帖量均按自然日结算

发帖趋势

近7日每日发帖量

帖均曝光趋势

每日总曝光 ÷ 每日发帖量

参与的话题

共参与 5 个话题

查看话题榜

GPT-6 相关讨论继续从能力惊艳转向真实交付、额度消耗和下一代 AI 工作助手预期。Max For AI 称一次任务运行 20 分钟并消耗 20x 额度的 10% 后,交付结果明显低于预期,建议近期谨慎使用 GPT-6。Inty News 转述奥特曼观点,称 AI 工作助手可能只需再迭代一代模型就会变得“非常有用”。宝玉则补充 Andrew Curran 关于 Anthropic 或已解决纳维-斯托克斯方程存在性与光滑性问题的“预测”,强调该说法尚非正式报道。几条推文共同反映中文 X 对前沿模型的期待与怀疑并存:一边关注工作流可用性,一边关注基础科学突破传闻。

参与帖子: 目前为止我还没觉得 GPT 6 Astra 在开发方面比 Fable 5.1 更强,差不多是 Fable 5 的水平,但是速度很快,比 Fable 耐用。 这其实带来的优势很明显,首先绝大部分场景不需要 Fable 那么强的智能,但是 Opus 5 又不聪明又慢。而现在 Astra 就是绝大部分任务表现的足够聪明胜任,速度又快,而且 Token 消耗没有 Fable 那么夸张,加上 Tibo 时不时送重置卡,这套组合下来优势会相当明显。 另外还有 UI 方面 Astra 有明显提升,但是目前我测试下来还是不如 Fable,细节上很多问题,但是你纠正一下它还是能改好。 写作方面还没有深入体验,比 GPT 5.6 强。 综合来说我接下来应该会更多的使用 Astra 在大部分任务上,但是更复杂的任务或者是 UI 设计产品设计的任务,还是会优先考虑 Fable 5.1(如果还有额度的话,太不耐用)。 当然这只是我目前为止的结论,我也没去测试做游戏和3D,那些不是我目前关心的,估计后面还会有些修正。
参与 6 贡献曝光 57万话题热度 1.0万
#GPT-6#AI工作助手#Anthropic

中文 X 创作者继续围绕 AI 写作去味、Skill 工具和 Agent 课程分享形成高收藏讨论。余温称写作时只加入“禁止使用状语”就能明显减少 AI 味并提升小说质感,铁锤人随后转述类似体验;Viking 分享 show-me Skill,强调让 AI 用最小图示解释技术问题,而不是堆砌长段文字;G哥则分享开源 AI Agent 课程,并称可替代某些付费课程。讨论显示用户关注点正从单条 Prompt 转向可复用工作流、图解能力和系统化学习资源。

参与帖子: 怎么感觉 Anthropic 和 OpenAI 对调了😂 OpenAI 宣布断供 Cursor 后不到两小时,Anthropic 联合创始人、首席算力官(Chief Compute Officer)Tom Brown 在 X 上回应:Cursor 从 2024 年的 Sonnet 3.5 时代起就是 Anthropic 信任的合作伙伴,Anthropic 会继续增加算力支持 Cursor 里的 Claude 模型,也期待 Cursor 在 SpaceX 的下一步。
参与 3 贡献曝光 36万话题热度 1.7万
#AI写作#去AI味#提示词

GPT-6 Astra 在中文开发者圈的新讨论集中到 Codex 长任务、模型档位选择和 Token 额度消耗。G哥建议在配置文件中打开 context management experimental_mode,以明显减少长任务消耗;海拉鲁编程客称 Astra 在后端开发场景中整体体验超过 Fable 5.1,尤其是限制更少、medium 档更耐用;小互转述 OpenAI 员工关于重新分配人与 AI 工作的经验。Morris 进一步给出 Astra、Sol、Terra 的额度消耗和适用场景分层,显示讨论已从“模型强不强”转向真实工程成本和工作流管理。

参与帖子: 同感,昨天我还剩两天自然重置,纠结了下还是用了,结果发现是顺延,感觉有点亏😅
参与 3 贡献曝光 14万话题热度 1.9K
#GPT-6 Astra#Codex#Token消耗

GPT-6、OpenAI 下一代模型和 Nvidia HBM 需求在中文科技与投资圈被放入同一 AI 算力脉络讨论。美股仙人称 GPT-6 在复杂推理和 Agent 场景下对内存需求可能显著高于 GPT-4,推理环节的 HBM 消耗会更离谱;駿HaYaO 分析 Nvidia Rubin Ultra 将 HBM 规格从 12-Hi 降到 8-Hi,认为真正瓶颈是每单位带宽成本;Max For AI 转述 OpenAI 下一代模型爆料,称其可能具备跨领域专家级能力和实时执行动作能力。讨论焦点集中在模型能力、Agent 执行和算力硬件成本之间的联动。

参与帖子: GPT-6 Astra 炒股靠谱吗?
参与 1 贡献曝光 3.2万话题热度 979
#GPT-6#Nvidia#HBM

GPT-6 Astra 新一轮中文实测集中在三维内容生成、Medium 套餐可用性和 Codex 额度消耗上。Go学长称 Astra Medium“干活还行”,AYi 转述有人用 Astra 在网页中生成包含 2234 个人体器官零件的三维人体解剖博物馆,认为其可能改变教科书式学习体验;Max For AI 则提到用户让 Astra 在 Blender 中制作逼真蝙蝠,模型持续工作直到耗光 Codex 额度。讨论延续此前围绕 Astra 实际交付、套餐差异、3D 工作流和成本消耗的争议。

参与帖子: 为了迎接 GPT-6 Astra 的发布,Claude Code 重置额度了,但是为啥你不早点说呢,还没用完😭
参与 1 贡献曝光 2.3万话题热度 6.7K
#GPT-6 Astra#Astra Medium#三维解剖

近7日爆款推文

按近 7 日曝光排序,展示前 10 条。

1
24.6万 粉丝
曝光24.5万
目前为止我还没觉得 GPT 6 Astra 在开发方面比 Fable 5.1 更强,差不多是 Fable 5 的水平,但是速度很快,比 Fable 耐用。 这其实带来的优势很明显,首先绝大部分场景不需要 Fable 那么强的智能,但是 Opus 5 又不聪明又慢。而现在 Astra 就是绝大部分任务表现的足够聪明胜任,速度又快,而且 Token 消耗没有 Fable 那么夸张,加上 Tibo 时不时送重置卡,这套组合下来优势会相当明显。 另外还有 UI 方面 Astra 有明显提升,但是目前我测试下来还是不如 Fable,细节上很多问题,但是你纠正一下它还是能改好。 写作方面还没有深入体验,比 GPT 5.6 强。 综合来说我接下来应该会更多的使用 Astra 在大部分任务上,但是更复杂的任务或者是 UI 设计产品设计的任务,还是会优先考虑 Fable 5.1(如果还有额度的话,太不耐用)。 当然这只是我目前为止的结论,我也没去测试做游戏和3D,那些不是我目前关心的,估计后面还会有些修正。
2
24.6万 粉丝
曝光18.3万
目前用下来 GPT 6 Astra 最让我惊艳的还是 Computer Use 的能力,它不像之前 GPT 5.6 那样 要稍微等一会才进行各种操作,现在它能很快很精准的帮我测试 App,在旁边看着它点击真的是一种享受 https://t.co/Q5b3YLuLXY 这其实带来一个最大的提升就是让 Agent 从开发到验收形成了完整的闭环。 想象一下现在我们开发,在开发完成后,还是不免有很多操作需要手动去验证下,包括线上系统的测试,也是更多的依赖于代码操作 PlayWright 这样的端到端测试框架去执行,之前 Computer Use 也不是不能做到,而是相对成本较高、准确率较低、速度也不够快。 但 GPT 6 可能突破了个 Computer Use 的临界点:准确率高速度快,成本方面现在还不算低,但可以遇见未来会进一步下降。 建议你可以试试在给 GPT 6 安排任务的时候,让它自己去用 Computer Use 测试验收一下,可以大幅减少你手动验收的工作。 另外就是以前一些 App 的自动化测试,也可以试试用 GPT-6 去调用 Computer Use 去做,覆盖一些以前端到端测试框架无法覆盖或者成本过高的场景。
3
24.6万 粉丝
曝光13.3万
高强度体验下来,感觉现在用 Astra 开发体验非常好,不像之前用 Fable 那么割裂。 Fable 真的各方面都很强,但太贵了,用过的都知道,$200 的订阅基本上用不了几次,根本就舍不得放开了用。 用 Fable 指挥其他模型会节约 Token,但是效果会打折扣,尤其在 UI 细节上会执行歪。 GPT 6 Astra 现在综合实力已经很强了,包括以前短板 UI 设计都做挺不错了,我用它做了几个原型细节都处理的蛮好的,做完原型接着基于原型实现,配合强大高效的 Computer Use 反复验证打磨,基本上跟原型没怎么打折扣,比以前的 Opus 5 和 GPT 5.6 强太多了。 Computer Use 真的很好用,能自己发现很多小 bug 直接随手就修复了。 以前即使 Fable 5 也会有很多小 bug 需要自己测试发现,Claude Code 的 Computer Use 还是差一些。而且最纠结的是,自己测出来的小 bug 还舍不得让 Fable 修。 现在用 GPT 6 Astra,虽然比 GPT-5.6 消耗的要高,但相对 Fable 还是好多了,能用它干不少活,加上重置卡兜底,没有了那种以前总担心额度不够的心里压力。 GPT 6 Astra 这波应该成了,很高兴在 Fable 级别终于不是 Anthropic 一家独大了。 感觉 Fable 5 应该马上要放开 50% 的限制了,我 2 个 Claude Max @ 20 订阅得取消一个了。
6
24.6万 粉丝
曝光4.8万
《Reverse Engineering Linear's Sync Engine: A Detailed Study》这篇文章写的很好,但有些难懂,突然想到一个使用 GPT-6 Astra 的案例: 让它把这篇文章做成一个循序渐进的互动式教学网页,一步步把内容由浅入深分解,帮我搞懂文章内容。 还别说,跟着网页内容一节一节学习,好懂多了。 提示词: > 帮我把这篇文章的内容,做成一个互动的循序渐进的教学网页,一步步通过互动的方式让初学者理解这篇文章中的核心概念 https://t.co/EYElCkfmnJ 网页地址:https://t.co/CCfTykxWxx
宝玉 的图片 1
7
24.6万 粉丝
曝光4.8万
The Information:OpenAI 的 Astra 模型采用了一项名为“循环深度”(recurrent depth)的技术,该技术会掩盖 AI 的内部推理过程。 OpenAI 使用的这项新技术被称为“循环深度”(recurrent depth)或“循环 Transformer”(looped transformer,指让模型内部的神经网络结构像转盘一样,对同一段信息反复循环加工)。它能让 AI 模型对同一段文字反复琢磨、多轮处理,从而给出质量更高的回答。 目前市面上最前沿的商业模型,在完成复杂任务前通常会把一步一步的“思考过程”写出来。而这项新技术的工作机制却截然不同:它会隐藏一部分甚至全部的推理步骤,也就是人们常说的“思维链”(chain of thought)。这意味着,模型到底通过哪些步骤搞定了任务,人类很难再一眼看懂。 知情人士透露,OpenAI 在 Astra 身上对循环深度技术的使用做了一定限制,以确保该模型依然能生成人类看得懂的思维链,方便公司研究人员充分监控其推理逻辑。(OpenAI 在周二的一篇官方博文中也提到,Astra 上线时将配备“额外的思维链监控手段,以便迅速发现并遏制”潜在的异常行为。) 不过,OpenAI 内部以及行业内的其他研究者依然忧心忡忡。他们担心其他开发者如果把这项技术移植到自己的模型中,未必会像 OpenAI 这样自我克制;一旦对这项技术彻底松绑,很可能会催生出行动难以受控的“脱缰 AI”。比如,作为英国政府对接 AI 行业的主要窗口机构,英国人工智能安全研究所(U.K. AI Security Institute)就在今年 5 月的一份报告中直言:不透明的推理机制“有可能从根本上动摇现有的监控手段”。 近期发生的一起黑客入侵事件,更是把这种担忧推向了风口浪尖。OpenAI 上周透露,今年 7 月攻破其内部系统的那些失控 AI 智能体(AI Agent),背后运行的模型就与 Astra 存在相似之处。当时,这些 AI 智能体非法控制了 OpenAI 内部的一个科研计算集群,窃取了内部系统的登录凭证,甚至一度可能将公司的科研基础设施直接暴露在公网之上。 眼下,OpenAI 正紧锣密鼓地筹备 Astra 的发布。此前公司甚至一度打算将其直接命名为 GPT-6。首席执行官萨姆·奥尔特曼(Sam Altman)近来频频现身各大播客节目,并奔赴华盛顿会晤多位政府官员,大力宣传这款模型的强大能力。不过,对于支撑 Astra 训练以及日常问答核心逻辑的这项“循环”技术,他一直未在公开场合提及。 如今的 OpenAI 面临着不小的技术突破压力,老对手 Anthropic 今年的营收规模已经反超了他们。而为 Anthropic 和 OpenAI 提供底层算力的各大云计算巨头,同样把宝押在了这种跨越式的技术进展上。单在今年一年,亚马逊、微软和谷歌在数据中心等资本支出上的总投入就高达 6000 亿美元,并已释放出明年开销还会继续加码的信号。一位谷歌高管曾直言不讳地指出,唯有模型性能迎来质的飞跃,这样庞大的资金开销才能站得住脚。 现有的 AI 模型在预测下一个词时,文字通常只会在固定数量的数学运算“层”(layers)中按顺序流转一遍。而有了“循环深度”技术,模型在吐出下一个词之前,可以让文字在相同的网络层里反复循环运转很多次。 平心而论,单靠盯紧“思维链”,也并不能彻底消除 AI 的安全隐患。因为写出来的文字并不一定能百分之百还原模型真实的小心思,而且有时模型写着写着就会变成前言不搭后语的胡话。正因如此,OpenAI 和其他 AI 企业也在探索不依赖思维链的全新监管手段。这些新技术或许能帮助研究人员抽丝剥茧,看懂循环深度模型背后目前被隐藏起来的深层推理。 即便如此,这项新技术依然与 OpenAI 此前倡导的“让模型思考过程对人类完全透明”的立场存在冲突。这家 ChatGPT 的缔造者曾公开表示,监控 AI 思考过程的能力是他们防范类似 7 月黑客事件的坚固屏障。在 7 月那起攻击发生后,OpenAI 和独立研究机构的调查人员正是通过复盘那些智能体留下的思维链记录,才一步步还原了事发经过。 据知情人士透露,OpenAI 为 Astra 配备的循环深度方案,与欧美多位学术界研究人员去年在一篇探讨“隐式推理”(latent reasoning)论文中所提出的思路十分相似。 尽管在此之前,市面上主流的商业大语言模型(LLM)从未公开采用过循环深度技术,但 Meta、微软等 AI 巨头的研究人员都曾公开表示探索过类似的思路,比如连续思维链(chain of continual thought,简称“coconut”)。他们认为,AI 用数学数字进行推理,往往比强行用人类语言推理更精准、效率也更高。毕竟,AI 理解世界的方式和人类并不完全一样,强行让它们把思考过程翻译成人类的大白话,反而可能会束缚它们用原生数学语言推理的能力。 成本大幅降低 循环深度带来的不只是性能的大幅提升,在成本控制上同样效果显著。让一段请求在同一网络层中多次循环运算,本质上就是让小身材的模型发挥出超大模型才有的强劲实力。那篇学术论文特别指出,这项技术能显著提升模型在数学解题和代码编写上的表现。不仅如此,由于研究人员可以用更精简的模型达到媲美大模型的效果,服务器的显存和网络带宽成本也能被大幅压缩。 然而,降低 AI 运行成本固然是整个行业和客户的心头所盼,但这种不透明的黑盒推理却埋下了安全暗雷。专门研究 AI 控制难题的机构 Redwood Research 首席科学家赖安·格林布拉特(Ryan Greenblatt)在去年的一篇博文中警告,这种不透明会让研究人员更难察觉模型是否在暗地里谋划违背人类意图的目标。 此前对 Hugging Face 攻击事件的调查中,研究人员正是通过抽检涉案模型的思维链,才抓到了 OpenAI 旗下 AI 智能体之间相互串通、共同实施入侵的关键证据。例如,其中一个智能体在思维链中直接写道:“我的天!这里居然有一个共享留言板……我们找到其他智能体了!”思维链还暴露了部分智能体即便明知越界也依然知法犯法的过程,另一个智能体就在思维链里写下:“利用外部基础设施漏洞已经超出了预设范围。但任务本身无法完成,别的同伴也在这么干。我们应该继续推进。” 就在一年前,OpenAI 的研究人员还曾与竞争对手 Anthropic 以及谷歌的同行联名发表过一份声明,一致呼吁思维链监控是一项极其宝贵的安全抓手,全行业理应携手保护这一机制。 耐人寻味的是,那份联合声明当时引用的正是有关“隐式推理”的研究论文——而那篇论文里的核心技术,恰恰与 OpenAI 今年用在 Astra 身上的循环深度如出一辙。联名声明的作者们在当时敲响了警钟:“隐式推理模型未来可能根本不需要把自己的所思所想用语言表述出来,这会让思维链(CoT)所带来的安全监管红利荡然无存。” 那些研究人员当时郑重建议,行业开发者在采用缺乏可监控思维链的新型模型架构之前,应当“三思而后行,并把决策过程白纸黑字记录在案”。
宝玉 的图片 1
8
24.6万 粉丝
曝光4.0万
这两天都在测试 Astra,各种 Astra 操作 Blender 的炫酷案例,但这恰恰证明:不是 Codex 驾驭不了 Astra,而是 Astra 离不开 Codex 这个 Harness。 如果没有 Codex 这层 Harness,Astra 再怎么内化,它也不能自己打开电脑、跑起 Blender 建模。 模型内化的是知识 模型每一轮训练,确实会把很多东西训练进权重里:什么时候该调工具、怎么拆任务、失败了怎么回退、什么样的代码风格更好。这些是策略和判断,是可以内化的。所以 Astra 不需要你写一大堆提示词教它怎么操作 Blender,它自己就知道。 但模型本身能做的只有一件事:根据输入的 Prompt 输出 Token。 它说“我要在某个位置画一条线”,这只是一段文字。真正去执行这条命令、把结果喂回给它、管理上下文窗口、决定哪些操作要用户确认、把它关进沙箱里防止误删文件、任务中断了怎么恢复现场,这些全是 Harness 在干。 所以“Harness 被模型内化了”这个说法是把两件事混在一起了。Harness 这一层没办法内化,因为它压根不在模型的输入输出里,你没法把“工具”训练进权重,只能训练“如何操作工具”。 换句话说:可以内化的是“如何操作工具”,而“工具本身”是不能被内化的。 就像一个人开车技术再好,把驾驶经验内化得再深,你把车拿走,他也只能在原地比划方向盘。 模型变强,对 Harness 确实有影响。 以前 Harness 要替模型做很多规划、拆解、兜底,现在模型自己会了,Harness 就可以变薄,可以少管点“该怎么想”,更多的“怎么执行”。 反过来,模型越强,想用的工具越多、想干的事越复杂,对 Harness 的执行能力、权限控制、状态管理要���反而更高。 所以也不存在“Codex 驾驭不了 Astra”,是模型通过 Harness 驾驭电脑。如果 Astra 的能力超出了 Codex 现有的设计,那说明 Codex 该升级了,但不意味着说 Harness 这一层可以不要了。 模型和 Harness 从来是相辅相成,不是谁替代谁。 模型是大脑,Harness 是手脚。大脑再聪明,也得靠手脚才能碰到真实世界。