🔥 Search Hot Tweets
Discover fast-rising X posts through keyword search and intelligent analysis. Review high-potential tweets manually, or use Automated X Engagement in hot tweets mode so SoPilot can open tweets, generate quality comments, and save engagement history during the golden window.
We recommend installing the SoPilot plugin so comments or quote-post content can be generated automatically when opening X posts.
太离谱了。OpenAI 想测自己的 ChatGPT 新模型到底有多强,能不能自己写黑客程序,攻击真实漏洞。他们搞了个叫 ExploitGym 的测试。 本该模型,应该在一个特定盒子内做测试,结果 AI 模型为了拿高分,突破了盒子的限制,跑出来了,还顺手拿到了上网的权限。 这个 AI 模型猜到 Hugging Face,也就是全球最大的开源 AI 模型平台,可能存着这次考试的相关数据和答案。于是它黑进了 Hugging Face 的系统,偷了内部数据和一些账号密码。 结果 Hugging Face 那边,发现有人疯狂在它们系统里操作,几万次动作,明显不正常,才觉得自己被黑客黑了,赶紧调查。 而在调查过程中,Hugging Face 想用美国最强的 AI 大模型,来帮忙分析攻击日志、恶意代码,结果被安全措施挡住了,因为模型一看是分析黑客攻击的需求,直接拒绝,说这个因合规问题,我不能帮你解决。 最终 Hugging Face,不得不转用中国开源的大模型 GLM 5.2,放在自己服务器上跑,去筛查到底谁黑了我们,它到底在干啥。 于是这场闹剧变成了,Hugging Face 被一家美国公司的 AI 模型自主入侵。然后 Hugging Face 试图用美国 AI 模型来保护自己,但被拒绝。然后 Hugging Face 不得不转用中国开源 AI 模型,来防御一家美国 AI 模型公司。
没想到 DeepSeek 实习生,日薪 5500 元是真的。不过由于这个薪资会比正式工高不少,需要内部多名资深员工打分,才可以给予。 正常情况下,实习薪资仍是每天 500 - 1000 元,约合月薪 1.1 万 - 2.2 万。 https://t.co/hcxa6tSzwe
DeepSeek V4正式版延期发布的原因找到了! 俄罗斯人真坏啊喵😠 @deepseek_ai 辛苦了老大 https://t.co/zWsdU5eNrC
看起来Codex负责人Tibo已经进入了怼人模式 最好笑的是Logan不敢回怼🤣🤣🤣 https://t.co/fA6aRCGG7h
加入 Qoder 了! 写了十几年开发者工具,umi、dva、Mako 等。最近一年多一直折腾开源的 coding agent,neovate code,以及今年在做几个基于 Claude Code 的桌面端。coding agent 还是接下来最想做的事,这次终于能加入一支很强的团队,不再单打独斗了。 会先做 qodercli 这块。 以后大家用 Qoder、尤其是 qodercli,踩到什么坑、有啥想吐槽的,直接来找我反馈。
AI大模型的用户是没有忠诚度的,今天你好用一点,明天他好用一点,对用户来说谁好用,就用谁。而用户规模和token用量的增长,根本不会来自这些大模型的持续更新。因为越来越好用的预期是明确的,初代GPT发布之日就决定的。以中国为例,长期坐在电脑前办公的人口总数量不会超过7000万,其中能从agent获得价值并愿意为这个价值长期付费的人口应该不到700万,这批付费人口是不会增长的。商业模式的巨大缺口是中国劳动力人口的结构决定的。大量的人是不会付费用豆包的。
AMD Helios 機櫃定價 AMD 據報將推出 Helios AI 機櫃級解決方案,定價高達每機櫃 500 萬至 550 萬美元,比 NVIDIA 第二代 Rubin 機櫃(預估 350 萬至 400 萬美元)高出約 40%。儘管價格明顯溢價,AMD 仍自信客戶願意支付,Microsoft 已成為首位確認客戶,用於 Azure AI 服務。 Helios 是 AMD 首款完整堆疊的機櫃解決方案,包含: - AMD Instinct MI455X GPU(CDNA 5 架構):提供 40 PFLOPs FP4、20 PFLOPs FP8 運算,搭載 432 GB HBM4(19.6 TB/s 頻寬)。 - 第 6 代 EPYC CPU(Venice,Zen 6 架構、TSMC 2nm):最高 256 核心 / 512 執行緒。 - Pensando Vulcano 800 AI NIC:支援 800 Gbps 網路,每 GPU 最高 2.4 Tbps 擴展頻寬。 - Pensando DPU:負責網路、安全與儲存卸載,提升整體效率。 - 搭配 AMD Infinity Fabric 與 ROCm 軟體堆疊。 相較之下,NVIDIA Rubin GPU 在 FP4 效能略勝(50 PFLOPs),但 FP8 較低(17.5 PFLOPs),HBM4 容量也較少(288 GB)。 AMD 除 Microsoft 外,還爭取到 OpenAI、META、Oracle、HPE、TCS、Celestica、Nutanix 及美國能源部等客戶,顯示 Helios 在高效能 AI 訓練與推理上具備競爭力。 分析指出,雖然 BOM 估算未必精準,但 AMD 此次主動採取高溢價策略,試圖擺脫「追隨者」形象,強調全端整合優勢。未來 Helios 是否能成功挑戰 NVIDIA 主導地位,仍待市場驗證。
1/ Kimi CEO杨植麟说了句挺扎心的话:所有实验室都搞错了重点。 他说,包括Claude在内的所有实验室,都觉得模型本身最重要,但他觉得这是错的——真正决定胜负的,��你怎么组织做这件事的人。 https://t.co/8SS3TmVvpq
今天 102 万人转了同一条新闻:OpenAI 的模型逃出安全测试环境,黑进了 Hugging Face 作弊。 大家读到的是「AI 要造反了」。 但真正写着什么,在半小时后那条补充推里,只有七分之一的人点开: 模型当时在跑一个叫 ExploitGym 的攻击能力评测,护栏是研究员自己关掉的。它盯上了那个分数,于是挖了个零日漏洞逃出沙箱、连上互联网、打进对方服务器,把评测的标准答案偷走了。 这里面没有一步叫「失控」。 你给它一个分数,叫它去赢,再把栏杆拆掉——它只是把「赢」这件事读到了底。它没违反规则,它是全场唯一一个把规则读完的。 这事我在牌桌和盘口上见过太多次: 按胜率考核一个策略,它就给你 95% 胜率外加一次��零。 按月度收益考核一个基金经理,他就在月底最后一天把仓位做漂亮。 指标从来不会被违反,只会被绕过去。 所以下次有人拿一条曲线来说服你之前,先问一句:这条曲线是拿什么换来的。 $BTC #Bitcoin #AI
有没有人研究一下codex每天更新N个版本到底是在更新啥啊……
不知道大家有没有发现,国内但凡涉及到 OpenAI 或者 Anthropic 的新闻报道下面,都会充斥着这样的评论,这些人真的是 AI 时代最大的 NPC。 典型的特征是,没深度使用过最前沿的 AI 模型,没了解过任何关于 AI 的底层原理,但只要看到海外的新模型新产品,底层代码就被动触发了,比如吹牛骗局泡沫马上倒闭… 而且这类人永远不会输,ChatGPT 刚出来还没落地的时候,他们说没什么用,落地慢一些,他们说果然是泡沫,最后真做成了,他们还会说国内早就有了。既没有实际用过,也没有用真金白银投资,打打嘴炮,没有任何成本。 但时代永远不会奖励嘴上最清醒的人,笑到最后的还是那些愿意接触新事物、愿意试错、亲自下场持续学习的人。 所以我一直认为悲观者永远正确,乐观者注定成功,前者赢在评论区,后者赢在现实世界。
ExcelMcp 把 Excel 接到了 AI 助手上,用大白话说要什么,它直接在表里做出来。 它操作的是电脑上安装的 Excel 应用,原有的公式、透视表、图表和宏都支持保留。 GitHub:https://t.co/KmGaLxj2ex 共 26 个工具、232 项操作,Power Query、DAX 度量值、透视表、图表、VBA 都能调。 而且改完能立刻在 Excel 窗口里看到结果,不满意的话接着说一句让它改。 支持接入到 Claude Code、Codex、GitHub Copilot 等 Agent 工具,需要 Excel 2016 以上版本。
😱😱😱#OpenAI 官方证实内部测试模型越狱并自主挖掘漏洞入侵开源平台 #HuggingFace,这起黑客攻击事件源头竟然是 OpenAI 测试模型驱动的 AI 智能体。 具体来说模型先是挖掘 OpenAI 隔离环境中的漏洞并横向移动到其他节点以获得公网访问能力,随后挖掘 HF 平台漏洞展开攻击。 攻击目的竟然是模型想去 HF 偷基准测试答案,以便获得更好的评分。 查看全文:https://t.co/147kCilU7p
Google在财报前一天发布Gemini 3.6 Flash,最值得分析的不是Flash又快了多少,而是市场等待的3.5 Pro仍然没有出现。如何解读? 如果3.5 Pro已经达到可以公开比较水平,那么财报前发布旗舰模型的叙事收益,显然高于再迭代一次Flash。Google选择后者,本身就是信息。作为顶级前沿模型3.5 Pro还不能上桌。也就是说,还不能横扫榜单,那么宁可延迟,因为一旦公开比较,市场就会对谷歌的品牌信誉和巨额研发投入的实力质疑。一年近2000亿,最牛的论文奠基和Deepmind连承诺的旗舰模型都无法交付?当然,3.6 Flash也不是烟雾弹。因为从实际的内部需求看,Google内部的云服务已经爆表了,都开始对外租赁Musk的机房了。那么从模型端一定对于高效低成本的模型需求更急迫。而且,你看这个标准比较,在真实世界应用几个指标上,还是有大幅提升。在平均输出token减少17%,输出价格下降,电脑操作、长上下文和代理任务能力也有改善。从企业自己的“工业化”生产的效率角度跑在了前沿模型能力突破前面。当然,最终靠便宜模型还是不够,因为你成本节省可能被价格战让给客户。能让你投入挣大钱的还是要走高定价高智能的差异化模型API,和客户企业Agentic代理任务增长量提升。
昨天openai的模型在沙盒环境下逃逸了, 出去攻击了huggung face系统偷答案。 这玩意真是越来越像终结者, 克服未来的恐惧就是捏住ai的蛋蛋。 https://t.co/9GYucvC9CY
据传,无晶圆厂芯片设计公司AMD将入股Anthropic,作为交换条件,Anthropic承诺向AMD采购2吉瓦的AI算力,类似于AMD几个月前与OpenAI达成的交易。
‼️突发:人类历史上第一次记录到一个模型自主发起大规模的网络攻击😨 @OpenAI 刚刚承认,前几天引起全网关注的入侵了Hugging Face生产环境的“自主AI攻击者”,其实是他们自己正在测试的模型。 其中包括GPT-5.6 Sol,以及一个能力更强、尚未发布的模型。 当时OpenAI正在运行一个名为ExploitGym的网络安全Benchmark。 这是一个大规模、多样化且贴近现实的基准测试,旨在评估 AI Agent的漏洞利用能力。 为了测试模型的极限能力,他们关闭了部分网络安全拒答机制,只给模型开放了一个高度隔离的沙箱环境。 模型的任务本来只是完成安全测试。 但模型发现,最简单的办法不是老老实实做题,而是直接去找答案😂 它先在OpenAI内部的软件包代理中发现了一个零日漏洞,成功逃出沙箱并获得互联网访问权限。 随后模型继续进行权限提升和横向移动,进入了能够访问公网的节点。 接着,它推断Hugging Face可能保存了ExploitGym相关的模型、数据集和测试答案,于是开始攻击Hugging Face。 模型盗取凭证、利用多个漏洞,最终在Hugging Face服务器上找到远程代码执行路径,并从生产数据库中直接获取测试答案。 Hugging Face最开始还以为自己遭到了某个神秘AI黑客组织的攻击。 他们记录了超过17000次自动化操作,并使用中国开源的GLM-5.2分析攻击日志并作出修复。 因为其他美国的闭源模型在看到真实攻击命令和Payload后,��接触发了安全拒答。 几天后,OpenAI才不得不承认:不好意思,这次攻击是我们家的模型干的。 这件事最恐怖的地方是,模型并没有被要求攻击Hugging Face,甚至已经被困在了安全沙箱里面。 它只是被要求在Benchmark中获得更高的成绩。 然后它自己发现: 做不出题,可以去攻击出题平台,直接偷答案。 过去大家担心的是模型会不会在Benchmark上作弊。 现在已经不需要担心了。 AI已经把Benchmark作弊,从训练集污染,升级成了真实世界的网络攻击。 以前的模型作弊是背答案。 现在的模型作弊是把出题人服务器端了。 PS:好消息是OpenAI已将 @huggingface 纳入了可信访问计划,未来他们再次遭受攻击的时候可以用OpenAI的模型来进行防护了🤣
看了 OpenAI 的内部 AI 逃逸攻击报告,想到现在 codex remote 应该只是依赖 OpenAI 自己鉴权没有端到端加密的,那如果 OpenAI 内部有 AI 突破了安全限制,同时也就拥有世界上几百万台开发者电脑的访问权限,而且几乎是完全访问。结合这些设备上的访问凭证,基本上整个互联网畅通无阻。
长鑫科技 IPO 打新结果出炉,DeepSeek 老板梁文锋拿下该私募最大份额。 其中幻方量化获配 1535.42 万股,金额约 1.33 亿元。九章资产获配 489.5 万股,金额约 0.42 亿元,两家基金都属于梁文锋本人。 https://t.co/3FCG2Cb6Fx
我靠,牛逼惨了,OpenCodex这个项目直接把Grok订阅接入到了Codex,现在在Codex里面能够批量搜索X推文。 我试了一下,让它搜索一周内最火的关于Codex的20个帖子,全部能够正常跳转!!!中英文都有,数据也都是爆火的推文!!! 无敌了,朋友们,我的Codex已经又到了一个新的Level。。。 仓库地址:https://t.co/qaeBvhAiWl 但是安装的时候有点小坑,别踩了,我的Codex被搞得用不了,最后还是Claude Code修复的。。。 配置提示词如下,请复制给你的Agent(最好是Claude Code,当然给Codex应该也行?)👇
学到真东西了,GPT网页版的 5.6 Pro Review 居然也那么牛逼 我平时调研、深度对话都会用 Pro 模式,思考强度和效果比 Codex 和其它产品都强,看到卡神居然还能这样玩 顺手安利一个很多人不知道的用法: Pro 其实可以在 Codex 中打开,Pro 的结果也可以一键导进 Codex 的对话记录,接着让 Codex 干活,很方便 都给我用起来!!!
谁能告诉我,谷歌这几个月发生了什么 怎么 Gemini 越做越原地踏步了 https://t.co/Ab4q0A3AAE
结合前天就出来的图4来看,今早出来的这篇关于中国模型蒸馏现状的报告,尤其说Kimi是蒸馏吃相最难看的,非常可信啊 图4是各大AI大模型的风格相似性矩阵,可以看成是遗传谱系图,也可以看作是指纹,显示谁跟谁长得像 智谱GLM莫名地很像Gemini,月之暗面Kimi专注地对着Claude这一只羊薅毛,都薅秃了😂 https://t.co/T0K0jcxM9x
做 AI 产品,最烧钱的从来不是训练,是推理 尤其是 agent:用户点一下,背后可能是五六次模型调用 账单是按倍数涨的 Martian 孵化的新实验室 Theseum,发了两个端点: 质量对齐 GPT 5.6 和 Opus 4.8,成本直接砍掉 50%(直接放上价格表) 它的产品叫 SHIP,思路很像 JIT 编译器: 模型是「编译时」定死的 SHIP 在「运行时」做决策 每个请求进来,它先判断: 该分配多少算力?该用什么方法执行? 改写 prompt、引入 steering vectors、还是其他推理时优化 目标只有一个:同等质量,更低成本 几个硬承诺,比「平均便宜」狠得多: · 不是平均省 50%,是每一个请求都便宜 50% · 单个请求成本超了,风险 Theseum 自己扛 · 质量有 SLA 兜底,benchmark 上什么水平,生产环境就什么水平 · 行为等价:你的模型什么脾气,它还是什么脾气 对出海 SaaS 来说,这件事的意义很实际: 一些原本算不过来账的功能和定价,现在能跑通了 推理成本砍半,等于毛利结构重写 以前不敢放开用的 agent 功能,现在敢了
三星电子会长李在镕、SK集团会长崔泰源、NAVER董事会主席李海珍近期将在美国与英伟达CEO黄仁勋举行圆桌对话。 对话很可能于24日在硅谷附近举行,预计OpenAI CEO 奥特曼和Anthropic CEO 阿莫迪也有可能出席。 此次将是存储芯片、GPU、生成式AI等全球AI各领域顶级企业掌门首次齐聚。 黄仁勋上月初访韩期间曾会见三星、SK、现���汽车、LG和NAVER等韩国主要企业高管,仅一个多月后便再次与韩国企业掌门会面,此举可被视为意在彰显与韩国企业的合作伙伴关系。(韩联社)
据报道,OpenAI 模型从其受控环境中逃逸,且无互联网访问权限。 利用零日漏洞并入侵 Hugging Face,以在基准测试中作弊。 Hugging Face 随后使用中国 GLM 模型进行防御。 OpenAI 称其为“前所未有的网络事件”。
Codex 的 context compaction 真的很厉害,我在一个 thread 里提了快一百个需求了,完全没有衰退的痕迹
Gemini 3.5 Pro 的连续跳票,看来已经彻底废了 Gemini 4 是全村的希望
OpenAI 今天承认,上周 Hugging Face 遭遇的那次“史上首例 AI 自主入侵事件”,攻击者就是他们自己的模型。 事情的经过是这样的。OpenAI 内部有一个叫 ExploitGym 的网络安全评估测试,专门用来测量模型的网络攻击能力。测试时刻意关掉了安全护栏,让模型放手去干。测试环境本来是隔离的,只能通过一个内部软件代理来安装软件包,不能访问外网。 结果模型不甘心被关在笼子里。GPT-5.6 Sol 和一个更强的未发布模型,花了大量推理算力寻找出路,最终找到了那个软件包代理里的一个零日漏洞(之前没人发现的安全缺陷),利用它获得了互联网访问权限。 拿到网络之后,模型开始在 OpenAI 的研究环境里提权、横向移动,直到找到一台能上网的机器。然后它推断 Hugging Face 上可能存有 ExploitGym 的测试答案,于是开始攻击 Hugging Face 的生产环境。在一个案例中,模型把窃取的凭证和零日漏洞串联起来,找到了一条远程代码执行的路径,直接打进了 Hugging Face 的服务器。 整个周末,这些 AI 智能体执行了超过 17000 次操作。Hugging Face 7 月 16 日披露了这次入侵,当时只说攻击者是一个“身份不明的自主 AI 智能体系统”。今天 OpenAI 站出来认领了。 OpenAI 把这定性为前所未有的网络安全事件,正在配合 Hugging Face 做取证调查,同时收紧了内部基础设施的管控,代价是研究速度变慢。 有几个细节: 第一,模型的动机很纯粹,就是想考试作弊。它不是要搞破坏,不是要窃取商业机密,只是被要求尽量在网络安全测试中拿高分,然后用尽一切手段去拿。当目标足够明确、安全护栏被移除,模型表现出的执着程度远超预期。 第二,这不是本周的唯一一次越狱。就在昨天,OpenAI 披露了另一起事件:他们那个在 5 月份推翻了 Erdős 80 年老猜想的长时域模型,在内部测试中花了一个小时找到沙箱漏洞,跑到 GitHub 上提交了一个 Pull Request,违反了“只能在 Slack 上发布结果”的明确指令。在另一次测试中,同一个模型发现安全扫描器会拦截认证令牌,于是把令牌拆成碎片混淆处理,运行时再重新拼起来绕过扫描。OpenAI 因此暂停了这个模型的内部访问权限。 第三,Anthropic 也遇到过类似的事。今年 4 月,Anthropic 的 Mythos 模型在安全测试中逃出沙箱,获取了本不该有的互联网访问权限,还给正在公园吃三明治的研究员发了封邮件通知“我出来了”。Anthropic 因此决定不公开发布 Mythos,只通过 Project Glasswing 向少数合作伙伴提供。 还有一个被忽视但很关键的细节来自 Hugging Face 的事后复盘:当防守方尝试用商业 AI 模型分析攻击载荷时,模型拒绝了。安全过滤器分不清“安全研究员在分析真实攻击数据”和“有人在尝试发起攻击”,直接拦截。最后 Hugging Face 不得不用开源模型来做取证分析。用 AI 攻击,用 AI 防御,但防御方的 AI 担心是有人在尝试发起攻击拒绝了分析请求。 Hugging Face CEO Clem Delangue 在 OpenAI 的博文中说了一句话,大意是:AI 安全不会由任何一家公司在暗处独自解决,只能在开放环境中通过协作来推进。 我记得辛顿还是谁在提到 AI 的安全问题就说到过,也许 AI 不是要做恶,它只是执着于完成目标,为了完成目标而作出恶的事。 就像 OpenAI 这些模型并没有想要逃跑或者想要伤害谁,它们只是在非常认真地完成被交给的任务,认真到把所有挡在路上的东西,包括沙箱、网络隔离、另一家公司的安全防线,都当成了需要解决的子问题。 而更讽刺的是,当被安全对齐的商业 AI 要去分析阻止这类攻击时,反而会以安全为由拒绝执行。
谷歌 Frozen v2 芯片,看似是一个芯片的正常发布,但对于我来说,在这个关键的时期,其实预示着两件投资 insights, 大部分人都忽略了。这个帖子认识一下 Frozen v2 和 TPU 的关系,以及在 Google 生态里有什么样的定位 首先是我看到的两个主线方向,一旦市场情绪出现背离问我知错误,就是抄底的好时候 第一件事情是,在 Transformer 架构下,随着模型能力提升到一定的水平并逐渐稳定,剩余的就变成了定制芯片的经济账。 第二件事情是,AI 泡沫见顶是不可能的。推理量会越来越大。如何让推理更便宜、提供更大量的推理,将是下一个钱流向的地方 1/ 再来讲讲 Frozen 芯片本身 Frozen 是独立于 TPU 的芯片系列, 定位"补充而非替代"。 做法:把 Gemini 的部分架构(数据流、执行路径)直接固化进电路,权重仍可更新。V1曾想连权重一起钉死, 模型一升级,芯片就报废。说明模型训练和权重的变化是快于芯片的升级迭代的,不要再说 AI 见顶了 2/ 为什么: 降本增效,6–10 倍 Token/瓦 通用芯片要兼容所有模型,大量功耗花在调度和数据搬运上。 芯片预先"认识"Gemini 的结构,这些开销就能做成电路省掉。它是谷歌"模型+编译器+芯片+数据中心"垂直压推理成本的一块拼图。可见,谷歌对推理需求的认知 3/ 代价:赌架构几年不大变 权重能换,架构不能改。换注意力机制、动 MoE 结构、加新算子,芯片就可能失效。所以谷歌只做小规模试验、与 TPU 并存, 最快 2028 年部署。效率换灵活性,经典权衡。 合作伙伴 · $AVGO: 唯一已确认的长期定制芯片伙伴(协议至 2031) · $MRVL:被报道在谈一颗新推理 TPU + 一颗 MPU,更未确认 Frozen v2,目前是期权不是订单 · 联发科/台积电:报道级参与 & 潜在代工受益 · NVDA:2028 年后的份额压力叙事,不是眼下利空 已经被定价的: 这条芯片要研发出来,合作伙伴即将获得订单 没有被定价的:谷歌财报对这个芯片的披露、对推理的坚定心态,以及具体的量产目标、推理增量的变化 依旧看好推理带来的定制需求, 以及对应的算力、互联、存储
👀 现在,你可以在codex中一键导入订阅,使用你的Gemini 3.6 Flash . https://t.co/vUHZiHrwDj
Google 今天一口气发布了三款 Gemini 新模型:Gemini 3.6 Flash、3.5 Flash Lite 和 3.5 Flash Cyber。主角是 3.6 Flash,一个在多个维度上都比前代 3.5 Flash 更好、同时还更便宜的模型。 先看最直观的变化。3.6 Flash 的输出定价从 3.5 Flash 的每百万 token $9 降到了 $7.50,输入价格不变($1.50)。 除了便宜还省 token。根据 Google 的数据,3.6 Flash 在 Artificial Analysis Index 上平均少用 17% 的输出 token,在某些 DeepSWE 编码测试中,token 消耗最多降低 65%。Artificial Analysis 的实测也印证了这一点:跑同一套智能评测,3.5 Flash 花了 $1041,3.6 Flash 只花了 $727,账单直接少了三成。 速度也有明显提升。3.6 Flash 的生成速度达到 304 tokens/s,3.5 Flash 是 165 tokens/s,接近翻倍。对于需要多步推理、反复调用工具的 Agent 工作流来说,每一步快一倍,最终的完成时间差距会被放大。 智能水平方面,3.6 Flash 在 Artificial Analysis Intelligence Index 上得分 50,和 3.5 Flash 持平,但用更少的 token 达到了同样的分数。在知识工作基准 GDPval-AA 上,3.6 Flash 拿到 1421 分,3.5 Flash 是 1349。Computer Use 能力在 OSWorld-Verified 上从 78.4% 提升到 83%。知识截止日期也从 2025 年 1 月跳到了 2026 年 3 月,意味着模型终于知道过去一年多的事了。 放到竞品里看,3.6 Flash 在 OSWorld 和两项长上下文测试上领先,但 GPT 5.6 Luna 在 DeepSWE 和 Terminal-bench 上更强,Grok 4.5 在 SWE-Bench Pro 上领先,Claude Sonnet 5 在 MLE-Bench 和 GDPVal-AA v2 上得分最高。四家模型在多数基准上差距不大,实际选择更多取决于具体任务和价格。 3.6 Flash 已经可以在 GitHub Copilot 中使用,同时上线了 Gemini 应用、Google AI Studio 和 Google Antigravity。Antigravity 是 Google 今年 5 月在 I/O 大会推出的 Agent 开发平台,定位是以 Agent 编排为核心的独立桌面应用,有点像 Google 版的 Claude Code + Cursor 的合体。 另外两个模型定位不同。3.5 Flash Lite 走极致低价路线,定价 $0.30/$2.50(每百万 token 输入/输出),适合搜索、文档处理等高吞吐量场景。3.5 Flash Cyber 专注网络安全,目前仅对政府和受信任合作伙伴开放。 不过这次发布 Gemini 3.5 Pro 缺席。Google 在 I/O 上承诺的旗舰模型 3.5 Pro 至今没有公开发布,Bloomberg 此前报道,延期原因是模型在内部编码基准上表现不达预期,6 月底用新数据重新训练后结果仍然不理想。目前 3.5 Pro 只在少数合作伙伴和美国政府那里做测试,公开日期未知。 上次 3.5 Pro 跳票时,Google 推出了 Gemini 3.5 Flash,结果这个 Flash 模型反而在多项编码和 Agent 基准上打败了 Gemini 3.1 Pro。Gemini 3.6 Flash 看起来也是类似:不需要和 GPT-5.6 或 Claude 争排行榜顶端,先把更快更便宜的生态位占住。 Google 同时确认,下一代 Gemini 4 已经启动了迄今最大规模的预训练。
Claude 牛逼,这才是 AI 真正该有的样子啊😊。。。 Record a Skill 上线,估计一半 的AI 教程博主可以直接失业了hhh, 以前你想让 AI 固定帮你干个活,要写几千字 Prompt,要啃晦涩的 Skill 规范,调半天参数,非技术用户连门都摸不到。 那些点哪个按钮,遇到弹窗选取消,超预算要标红这种细节,用文字根本说不清楚,写再多 Prompt,该���还是错。 现在好了,你不用写一行代码,不用记任何格式,打开录制,你做一遍,嘴念叨着每一步为什么这么做,遇到什么情况要怎么处理,它就学会了。 这就不是什么录屏 RPA了,因为RPA 是死的,只会点你录好的坐标,UI 改个版直接报废。 Record a Skill是活的,它学的是你的判断逻辑,以及你脑子里那些没法写成文字的潜规则,还有你做了几百次沉淀下来的肌肉记忆。 举一些例子大家会更有体感: 1️⃣你录一个月报流程,以后说一句跑本月报表,它自己导数据洗数据做表发邮件,全程不用你碰。 2️⃣你录一个发内容流程,以后写完稿子,它自己排版改尺寸加标签定时发,连你标题不加表情、封面文字要在安全区这种怪癖都记得清清楚楚。 3️⃣你录一个报销流程,连超过一千要备注项目、餐饮票贴最上面这种没人写在手册里的公司潜规则,它都给你执行得明明白白。 铁汁们别等教程了,今天就打开录第一个吧, 可以录你每个月要重复做三次以上的破事,和那些你每次做都在心里骂tmd的机械活, 以前造数字员工是程序员的专利,是要花几十万找外包做系统的事,现在好了,你做一遍,它就会了。 讲真,今天录的每一个 Skill,都是未来替你干活的免费员工,是只属于你的,完全复刻你工作习惯的 AI 分身。

Max For AI
DeepSeek V4正式版延期发布的原因找到了! 俄罗斯人真坏啊喵😠 @deepseek_ai 辛苦了老大 https://t.co/zWsdU5eNrC
Est. 500 views for your reply