
Back to topic rankings冷知识:
地球上唯一一个不用VPN、不用翻墙也能使用的美国最强AI工具是——Grok Bot
悄悄地使用,一定别声张! https://t.co/S9bf265baF
OpenAI 一次性公开 722 篇 AI 写的数学论文
OpenAI 把一个内部未发布模型做出的数学成果整体公开了:722 篇论文,归成 372 组结果,全部放在 GitHub 仓库 openai/math 里,谁都能看。
这个模型就是上个月宣称解决了纳维-斯托克斯方程问题(千禧年七大数学难题之一)的那个。它从 8 月 28 日开始训练,能力比 OpenAI 已发布的 GPT-6 Astra 更强,目前还没对外开放。
OpenAI 说,原有的数学测试题已经难不住模型了,所以改拿真实的未解数学问题来考它。前后一共给了模型大约 4000 道题,筛掉分量不够的,剩下这 372 组。平均每个结果花的算力,相当于在 ChatGPT Pro 里思考三个小时左右。
论文覆盖数论、代数几何、组合、数学物理等大部分数学分支。标题里能看到不少有名的问题,比如证明 π 的无理性测度(衡量一个数能被分数逼近得多好)等于 2,证明卡塔兰常数是无理数,还有黎曼 ζ 函数零点分布、特殊情形下的霍奇猜想。后两项 OpenAI 特别说明,用的流程和其他结果不同,其中黎曼 ζ 那篇的文字还经过人工润色。
这些结论可信吗?OpenAI 自己的说法是“处在不同验证阶段”。约 160 篇的主要结论附带了 Lean 形式化证明。Lean 是一种能让计算机逐步检查数学证明的编程语言,过得了 Lean,基本可以排除证明里的逻辑漏洞。剩下的论文还没形式化,OpenAI 承认其中可能有错,说会尽快修正,所有修订都保留历史版本。另外还附了 10 份模型推理过程的摘要,让人能看到模型是怎么想出来的。
发布方式本身也是这次的重点。9 月下旬,OpenAI 在普林斯顿高等研究院(爱因斯坦待过的那个研究所)支持成立了独立的“数学与人工智能顾问组”,成员是 Timothy Gowers、Edward Witten、Martin Hairer 等 9 位数学家,不拿 OpenAI 的钱。此前 25 位菲尔兹奖得主联名发公开信,批评 AI 公司抢着宣布破解名题的做法。
顾问组 9 月 29 日发布了一份建议,征集了 600 多位数学家的意见。核心要求有三条:AI 写的证明要按正规论文格式重写,并引用相关的已有文献;成果要放进不受 AI 公司控制、可长期引用的学术存档平台;AI 公司要出钱支持数学界去真正理解这些成果。顾问组还明确表示,不赞成 AI 公司在外界用不到的私有模型上攻数学难题,希望它们停下来。
OpenAI 这次回应了其中一部分:先放 GitHub,同时在找符合顾问组标准的社区托管平台;承诺资助一系列研讨会、学术会议,帮数学界消化这批成果;也表示正在推进“负责任地发布”这个模型。至于停止在私有模型上测试,OpenAI 没有回应。
对数学专业的人来说,接下来最实际的变化是:自己研究方向上的某个猜想,可能已经在这 722 篇论文里了,值得去仓库里翻一翻。
原文:https://t.co/uAxjHXhNeK
仓库:https://t.co/aPgNSqXevr 真实的商战,ChatGPT 的产品和 Grok Bot 工程师,在评论区相互问候了一天,而且是美国时间的夜晚。
Grok Bot 工程师 lauren,阴阳 ChatGPT 的 Tibo 连基础都不会,让自家 Grok Bot 给他补个编程入门课,结果 Grok Bot 一本正经地接了活。Tibo 只好自嘲,AI 一眼就看出咱俩谁最菜。 https://t.co/MV837qU4ge

Grok Bot 现在可以直接搜索和监控X上所有内容
不再需要你付费API
甚至无需 X 账户或连接器… 别等Fable5.5了,如果你有Claude Code账号的话,直接把这个开源仓库发给他:https://t.co/ofacrkcRuy
然后,静待魔法发生即可! 我操,Grok bot 现在无敌了!
老马刚才说,Grokbot 会根据特定任务使用当前任务的最佳模型。
也就是说,它不止使用 Grok 4.7 或者 4.6 了。
还会使用 Opus 5.5、Midjourney、Suno 等各种 API 帮你构建内容或者是执行任务。 马斯克宣布 Grok Bot
以后只用顶��模型来驱动
哪家模型最好,Grok Bot就使用哪家,包括Claude Opus 5.5、MidJourney、Suno 和其他各种领先的 API...
似乎是为要即将推出大一统的订阅服务做准备 有一种观点认为,人类会朝两极分化:大部分人继续沉迷于 AI 生成内容和“奶头乐”产品,小部分人则会借助 AI 极大丰富自己的创造力。
我觉得还有第三种观点值得认可:这种技术的加速主义会导致越来越多的大众开始思考,在很长一段时间之内,他们人生中真正值得去做的事情。所以最终,这反而会加速“奶头乐”产品的灭亡。AI 生成短剧就是一个比较明显的例子。如果在一个完全竞争的市场当中,制造 AI 短剧的成本越来越低,最终会往两个方向发展:
第一个方向是大量低内容、低质量的 AI slop 类型短剧。这种短剧很显然在火爆一阵子之后会彻底沉寂,因为内容的极大丰富实际上在提升所有人的审美(或者审丑)水平。
当然,我们也会看到一小部分创作者使用 AI 去创造很多优秀的、在现实社会当中不存在的精彩剧本。我觉得这一部分内容创作者的群体会越来越大,可以说是从零增长为一个不容忽视的内容分类分野。 让 Grok bot 每天早上定时出一个 AI 早报的视频,没想到效果还真挺不错的!
全程都没用我本地电脑,全跑在它的云端虚拟机上,包括内容收集、写代码和视频渲染。
我写了个提示词,直接复制过去的话,你的 Grok bot 也能执行这些任务
提示词太长放下面了 https://t.co/dYDB0JrsEd 没想到 AI 聚合器这事,被马斯克给干了。
马斯克宣布,自家的 AI 助手 Grok Bot,后续在处理用户下达的命令时,会根据需求,自动选取市面上最佳的 AI 模型。
比如写代码、推理这类,可能会用 Claude Opus 5.5,画图可能走 MidJourney,做音乐可能走 Suno。
而不是所有用户对话需求,都由 Grok 模型来处理。
考虑到现在 X,疯狂推 Grok Bot,这个用户群体应该会很庞大。
不过费用怎么算,目前帖子还没有明说,然后果然马斯克也没提及 ChatGPT,这下 Sam 老哥更意难平了。
老马的这条推暗含着一个重大转变,老马今天说以后Grok Bot这个agent产品层面会“挑最好的模型用”,不锁死自家模型。按具体任务选最合适的后端模型——文本推理可能用 Claude Opus 5.5,生图可能用 MidJourney,音频/音乐可能用 Suno,再加上其他领先 API。标准只有一个:哪种最可能给出最好结果,就用哪种。
重点是agent产品和模型路由,Bot是上层助手:能连账户、主动做事、跨工具执行;底层模型则按任务外接,不强制全走 xAI 自己的模型。当然不是xAI停掉 Grok 模型研发,但明显未来重心在Bot这个Agent层面上了。
这个思路是对的,与其大模型这个已是红海的领域疯狂卷,还不如去卷Agent这个自己更有好优势的领域。
这就是暗含了SpaceX在AI上未来的重点就是两个:
1)夯实最底层的算力中心、这是现金流业务,spacex有着极强的工程能力(每MW的建设成本能做到最低);
2)抢占入口、基于X这个越来越活跃的社交平台、bot一开始天然就有一个无可比拟的分发渠道平台,不锁死自家大模型会让用户对bot的体验更好、更能留住用户。未来还能向其他大模型厂商卖更多算力。
活久见了,有位声称不再亲自写代码,让 AI 来做事的老哥,用 Claude 做了套能在 X 上,直接玩类似 Minecraft 的联机在线游戏。
由于现在 X,支持把外部网页,在推文内展开,因此这老哥实现了它。 https://t.co/REh3K3TX8v
从今天开始,我的 X 私信会默认全部接收请求,我的 Grok bot 会帮我管理所有的私信。
它一天有三个定时阅读时间,会阅读完所有的私信之后,草拟回复并经过我同意后发送给各位,所以如果大家有感兴趣的话题,全都可以给我发私信。 这个网站不错,很多从 X 上收集的 Opus 5.5 动画视频案例,有 X 链接,大部分有可以跑起来的 Prompt
https://t.co/JaMU9MbjWr Boris 让 Opus 5.5 为一部剧集做了一个互动网站,效果确实很不错。
提示词相当简单,核心就三点:
1. 你希望它做什么?
2. 你希望它消耗多少算力去推理?
3. 它应该如何验证自己做对了?
这里面最重要的是第一和第三,做什么和如何验证,以此为抓手 Agent 就可以形成自我验证的闭环,当然推理强度可以给任务赋能。
--- 原始提示词(摘录自评论) ---
> 最新一期 Acquired 播客关于 Home Depot 的内容非常精彩。我想让你制作一个能够叙述整集内容的 Artifact。把它做成精美且互动的形式,重点传达贯穿整集的商业智慧精华。一定要做得非常出色,使用大量的 token 并不断迭代,直到你对其感到自豪为止。也许可以在整个作品中加入水彩插图和历史照片,目标是营造出《纽约客》或《纽约时报》数据可视化的风格,甚至要更好。我认为你可以使用 OpenCV 来处理水彩图片。 这个功能太实用了,Grok Bot可以帮我们搜索、阅读和监控X平台上所有的内容,包括不限于产品反馈、突发新闻和行业汇总。还是昨天说依托X这个越来越活跃的平台,Bot一开始就有了无可比拟分发到的渠道平台。X的数据价值也会越来越强。不仅个人,企业在做舆情、用户产品互动都有极强的需求、甚至进阶版付费商业化空间也很大。
最近给我每天都在使用的工程师合集技能 Waza 加上了一个很有用的操作以及回复规则,来源于 ASD-STE00,一套最开始用于航空维修文档的简化技术英文标准。
最开始是看到 Andrej Karpathy 的推荐,让大模型参考这一套规范来解释事情,回复会更加易读,刚好晚上有空,我顺着看了看规范和官方的 AI 白皮书,发现它对于词语、条件、和操作顺序的要求,真的非常适合拿来检查 AI 到底有没有把话讲明白讲清楚,想着基于我的理解给大伙更好懂的解释一下。
可以理解飞机维修手册其实面向阅读的人来源于各个国家,英文不一定是对方的母语,比如说修飞机的时候,拆哪一个零件、什么时候可以操作、前一步做到什么地步才可以继续做下一个步骤,是不是感觉非常像现在我们让 Agent 去做一些事情,我们也是想着尽可能 Agent 非常准确快速的做好,并把我们的诉求理解到位。刚好就和这个飞机维修手册上的说话操作规范非常像。
很多时候,一个词语换一个意思,一句话里面漏掉一个条件,面对说明书操作的人可能会做成不同的操作。好比大公司里面,CEO 的想法是经过多轮传递,很容易会导致很多信息失真,最后做出来的东西可能会当时想的完全不一样。
这套标准从我的理解正是用来解决这种说话和执行偏差的问题,它由协作规则和词典组成,词典会限制一个词可以用什么词性、表达什么含义,包括这个行业里面的哪些技术属于可以允许使用。同一个东西也不会为了避免重复就换一个名字去做,操作的步骤会需要写清楚条件和顺序等等这样的要求,其实这些放到技术文档里面也非常好理解。
我在 Waza 里面为了让 AI 更好理解,比如说在 write 写作技能里面我放了这样的例子,让 AI 写出来的内容更加清晰明白。
比如“上传完成后,删除本地文件”,如何被 AI 简化成“开始上传,然后删除本地文件”,会很容易出问题,可能文件还没有传完就被删除掉了,这里的“完成”就是决定了什么时候能删除,是必须存在的词。
再比如“只有检查通过,才允许重启” 和 “检查通过后就重启”,前一句就符合这个要求,后一句没有执行要求的动作容易多出很多可能,“才允许”在这里就是那个保持原意的关键词。
这正是我希望 AI 在日常回复和帮我干活时候要注意的地方,把做的结果讲明白、讲清楚,让它和我都不困惑不懵逼,说到点上,不要我再去多问一句更多的才好。比如说代码改好了、测试通过了、已经推送了、用户可以下载了都是对于结果的详细表述,假如它只回一句“已经修复并验证”,这种情况下,我肯定会继续问,到底解决了啥都好了没。
不过我认为,这里没有必要让 AI 去完整参考所有的标准,归纳起来的规则其实非常短,「同一个对象保持同一个名称,指代不清时写明对象,把条件和例外放在对应动作附近,保留先后关系,分清建议、要求和可能性。已经清楚的话就不改,不要为了简短删掉原因和边界。」
当然你也可以直接安装 Waza 的 clarity 规则来使用,或者直接去这里看看。
https://t.co/ogGSjIXGhN
在币圈,我们经常需要用 𝕏 的信息来投研
但是 Codex/Claude Code 一般没办法直接访问 𝕏 上面的信息,有几个解决方案,第一就是可以花钱买 𝕏 的 API,或者通过任何第三方 API,但是 𝕏 的 API 不便宜,配置起来也比较麻烦。
第二是直接用 Grok,但是 Grok 肯定没有 Codex/Claude Code 来得智能和全面,大家目前的主力 Agent 基本都还是 Codex/Claude Code。
我自己的一个方法是:让 Codex/Claude Code 自己去用 Grok
通过 “Grok Build” 可以实现这个效果,Grok Build 就是 Grok 的 CLI 版本,它可以访问 𝕏 的信息。我们只需要让 Codex/Claude Code 在需要查询 𝕏 的信息的时候,自己主动去调用 Grok Build 来问出答案,就可以实现类似 API 的效果。
这个过程对于我来说不需要额外付费。
因为我本来就有订阅 𝕏 的 Premium+ 会员,所以我是可以免费使用 Grok Build 这个功能的,这点很多人都不知道,白白浪费了 𝕏 送给你的 Grok Build 免费额度。
我们只需要让 AI 大概写个 Skill 就可以实现这个流程,如果你懒惰写的话,也可以直接用我写的「groking」:https://t.co/mEXgS5AZ3B
我的 Grokbot 现在最重要的用法,就是把我的 Twitter 书签全部读完之后,根据我项目当中潜在的用例和可能用到的技术进行分类,然后把这些信息全部交给我的 VAS 服务器上的开发环境。
Codex 和 Claude Code 收到这些每日简报之后,就会自动根据我的代码仓库里的代码来进行 review 决定是否需要进行开发(Codex 的某个 session 作为协调者)

Grok Bot 应该是被 Muse 揍的有点肿,马斯克决定把焚决交了:把 X API 直接开放给 Grok Bot。
低频的推特监控/总结现在可以直接用 Grok Bot 来做了,高频的还是要通过 API。 最近我的 AI 工作重心慢慢地转移到了制造业和媒体这两个方向,所以做出来的东西更像是实验,而不是产品。
我相信大家应该很快可以看到这些实验的结果。 Grok 帮我自动读书签,并且分发给我的软件开发工作站,真的很有意义。
以前想要完成类似的功能,必须得自己实现,通过服务器上的 MCP 来连接 Twitter,然后授权自己的开发者账户。或者绕一大圈,通过电脑操作来完成。当然,这只是把一件事情变得简单许多,但我从后边看到了一种潜在的 agent 协作景象,这就是垂直化的专业 agent。
Grokbot 其实在模型选择上,一开始的策略是主打 Grok 的模型,但现在已经开始对所有优秀的 SOTA 模型和低成本模型开放。实际上,它变成了有着 personal agent 外表、类似于 OpenRouter 这样的 harness 路由器。
但它拥有基于 X 的专业背景知识。这就让它在这个领域(也就是文字化的社交网络,尤其是现在 X 几乎是所有 AI 产品发布的最重要平台的前提下),成为了一个非常具有专业性的垂直化个人代理。
也许在两三年之内,我们可以看到传统的软件(即便是移动端软件)的主要界面,也会从复杂的 UI 变成类似于 Grokbot 这样的垂直化 Personal Agent。
然后,我们会操作这些真正无可替代的、具有专业背景知识的 Agent,在它们内部来进行互相通信和协作。我想,这就是移动端软件和传统软件的未来。
马斯克刚宣布 Grok Bot 以后会按任务自动选最好的后端模型,名单里直接点了 Claude Opus 5.5,还有 Midjourney 和 Suno
上个月底他自己承认 Grok 4.7 还比不上 Opus 5.5,现在干脆把 Opus 接进自家产品了。Anthropic 本来就在租 SpaceX 的 Colossus 算力,这下两家的关系更复杂了,又是竞争对手又是供应商又是客户
我之前就说 Grok Bot 的 harness 挺好,就是模型太笨。现在它基本变成了一个模型路由,哪个强用哪个。就是不知道在 Grok Bot 里调 Opus 的额度和价格会怎么算
AIPositiveAll-time data
Grok Bot云端制作AI早报,X信息接入与任务执行受关注
Grok Bot的使用讨论从X平台信息检索延伸至云端任务执行,归藏分享了让助手每天早上定时生成AI早报视频的实践。他称内容收集、代码编写和视频渲染均在Grok Bot的云端虚拟机完成,无需使用本地电脑,并表示可通过复制提示词复用任务。WolfyXBT则指出,Codex与Claude Code通常难以直接访问X信息,付费官方或第三方API存在成本与配置门槛,并将直接使用Grok列为解决思路。另一帖转述ChatGPT与Grok Bot工程师的评论区交锋,其中Grok Bot接下编程入门教学任务,呈现产品竞争与任务执行能力的交织。现有材料属于用户实践及转述,不能据此确认全部账号均具备相同权限、稳定性或免费额度。
#Grok Bot#AI早报#云端虚拟机#X信息检索#任务自动化
Topic heat
5063
Posts
23
Views
152.0万
Creators
12
Topic trend
From first appearance to last update, with a seven-day minimum window.
All related posts
23 posts in total























