随着大模型在工程实践中的深入渗透,开发者社群围绕Claude与Codex的多智能体(Agent)实机协同以及系统提示词(System Prompt)优化展开密集落地实测。技术博主实操展示了利用Agent直接以Rust重写桌面硬件控制系统,并实现Claude与Codex双智能体工作状态与Token消耗的实时联动监控;与此同时,开发者结合业界前沿建议,积极引入ASD-STE100等标准化受控语言规范作为System Prompt,显著提升了大模型在复杂代码理解与架构设计中的精准度。讨论认为,从单纯向LLM问询代码到部署多Agent自主协同全流程,AI辅助编程正加速从单点工具迈向全链路自动化接管。
参与帖子: 过去一周多,可能以后被证明是AI推理部署史上天翻地覆的一周。
上个周末,我的本地机双5070ti试跑Qwen Flash,只能做到200 prefill,10decode。
今天,在Strata和我自制的PR的支持下,目前可以跑到2200/67,而且只需要一张卡。
即读写速度都提高了近十倍。
更好的消费卡比如4090/5090,当然也有幅度相当大的升级(目前5090在流式处理的支持下,速度已经开始逼近RTX6000,当然显存还是不足)。
这当然带来了消费级硬件的新一轮大涨价。如今,就连曾经无人问津的 32G B70英特尔显卡都卖断货涨价了。
2200/67的速度是什么意思?
今天除了deepseek,muse等少数模型,大部分API达不到这个速度。
而一个普通的家用游戏电脑就可以达到这个水平。
而这个水平,一周以前,只有5090,DGX spark,M3U这样的机器可以达到。
也就是说,在过去的一周多,全球的普通家用电脑带来了十倍于上周的AI产量。
这个增量,得益于deepseek- Qwen flash这种特殊设计,把智力分成了注意力,专家,和查表,
也得益于Strata这样优秀的架构,把整个处理流水线化,让不同的智力,存储在不同速度的存储设备中,在需要用时刚好抵达。
这对所有愿意拥有本地智力的人,当然是极大的利好。
也许模型层的设计,正在快速收敛到一个目前硬件条件下的最优解?
然而这对依赖出卖模型算力的生意,尤其是平庸的智力的商业来说,也可能是催命符。
参与 1 帖贡献曝光 8.4万话题热度 1.2K
#Claude#Codex#双Agent协同

