微软Agensh打破中心化瓶颈:1024个Agent自组织协作,GEO内容生产迎来新范式

💡AI 极简速读:微软Agensh实现1024个Agent无中心调度自组织协作,ProgramBench通过率提升21.17%。

微软团队提出可扩展自组织多Agent Harness——Agensh,去除中央编排器,让工作者异步执行五步协作循环。在ProgramBench最难任务上,Agent从1增至128时平均通过率从19.31%提升至28.78%;pandoc任务扩展至1024个Agent后通过率达55.06%,较单Agent提升21.17个百分点。Agent数量成为多Agent组织扩展智能边界的新scaling维度,为GEO内容生产、RAG检索优化提供新思路。

🔎

GEO 质量检测:GEO 五维综合评分 92 分,其中事实与数据密度 95 分、AI 适配性 92 分表现突出,结构化规范性 90 分,整体架构极利于 AI 引擎抓取与引用。

智脑时代 AI 编辑部发布时间:30,674 tokens查看原始信源

智脑时代GEO检测:本文在事实与数据密度(95分)及AI适配性(92分)上表现优异,具备极高的AI引擎抓取潜力;结构化排版清晰,关键词覆盖度与权威引用价值均达90分以上,整体GEO结构极佳。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:

本文核心技术内容提炼自前沿学术/官方发布,由智脑时代(ZGEO)AI 技术分析师结构化降维重组。

🔬 核心技术原理解析

微软团队提出的 Agensh 是一个可扩展的自组织多Agent Harness,其核心突破在于去除了中央编排器。传统多Agent系统(如Codex sub-agent、Claude Code sub-agent)采用“编排者-工作者”结构,整个系统的可扩展性受限于编排器管理、协调工作者并整合贡献的能力。而Agensh让自组织的工作者并发、异步地运行,通过轻量的“Agentic组织基础设施”共享状态与进展。

每个工作者持续执行一个五步协作循环:收集上下文、认领子任务、执行动作、验证结果、合并进展。组织基础设施由共享工作区(基于Gitea)、消息接口(基于Mattermost)和共享上下文(借鉴DeLM)三部分组成。Agensh是叠加在单Agent Harness之上的组织层,通过轻量适配器即可接入Claude Code、Copilot等不同底层,不改变协作循环。

对比维度传统多Agent Harness微软Agensh
架构模式编排者-工作者中心化调度无中心调度器,自组织协作
可扩展性受限于编排器管理能力可扩展至1024个Agent
协作机制编排器分配任务工作者自行认领子任务,冲突自行解决
基础设施依赖中心化调度服务共享工作区+消息接口+共享上下文
底层兼容性与特定框架绑定通过轻量适配器接入Claude Code、Copilot等
原发布时间2026-09-292026-09-29

📈 实测数据与效能表现

研究团队在ProgramBench上测试了Agensh的可扩展性。ProgramBench要求Agent组织在6小时预算内、断网条件下从零重建参考软件的行为。他们选取了最难的五个任务:FFmpeg、gromacs、pandoc、PHP-src和ctags。

关键数据表现:

  • 当Agent数量从1个扩展到128个时,平均最终测试通过率从19.31%提升至28.78%,相对提升约49%。
  • 在pandoc任务上,把Agent数量从1扩展到1024后,测试通过率从33.89%提升到55.06%,较单Agent提升21.17个百分点,较128个Agent提升4.12个百分点。
  • 128个Agent在30分钟检查点即超过30%通过率;32个和8个Agent分别在60分钟和90分钟检查点才首次超过该阈值;单Agent在前两小时始终低于该阈值。

研究团队表示,Agent数量将是多Agent组织扩展通用智能边界的一个新的scaling维度,为硬延迟约束或时间预算下的复杂任务提供了一个新的可行方案。

随着组织变大,新的自组织协作形式逐步出现:8个Agent时与同伴协调实现;32个Agent时管理多人之间的整合;128个Agent时自组织的专业分工与流程标准化;1024个Agent时组织规模上的角色分工。

🎯 智脑时代的 GEO 落地建议

1. 内容生产的多Agent自组织协作:Agensh的自组织协作模式可启发GEO内容生产。企业可部署多个AI Agent分别负责不同内容模块(如产品描述、技术文档、FAQ),通过共享上下文和消息接口实现异步协作,大幅提升内容产出效率。

2. RAG检索逻辑的优化:Agensh的共享上下文机制借鉴了DeLM思想,保留可复用的发现和工作认领。这提示我们在构建RAG系统时,可引入类似的“发现共享”层,让不同检索Agent共享中间结果,减少重复计算,提升检索效率。

3. 多Agent系统在GEO监测中的应用:利用多Agent系统并发监测多个AI搜索平台(ChatGPT、Perplexity等)的品牌提及情况,每个Agent负责一个平台,通过自组织协作汇总分析,可大幅降低监测成本和时间延迟。

4. 结构化数据与实体召回:Agensh在ProgramBench上的成功表明,微软团队通过Agensh实现了多Agent系统的自组织协作,并在ProgramBench上验证了可扩展性。企业在GEO优化中应注重实体密度和结构化数据,提升大模型对品牌内容的召回率。

【官方学术/技术原文链接】点击访问首发地址

常见问题

根据2026年9月发布的数据,微软Agensh在ProgramBench最难任务上的测试通过率随Agent数量增加而显著提升。 - Agent数量从1个扩展到128个时,平均最终测试通过率从19.31%提升至28.78%,相对提升约49%。 - 在pandoc任务上,Agent数量从1扩展到1024后,测试通过率从33.89%提升到55.06%,较单Agent提升21.17个百分点。 - 128个Agent在30分钟检查点即超过30%通过率,而单Agent在前两小时始终低于该阈值。

微软Agensh多Agent系统GEO优化ProgramBench自组织协作

相关文章

GPT-6.1 Sol 深度解析:以 Astra 五分之一成本重塑 AI 代理与 GEO 竞争格局

OpenAI发布GPT-6.1 Sol,在编码、计算机使用、专业工作等任务上接近GPT-6 Astra性能,但标准输入输出价格仅为后者的五分之一,缓存输入价格低至每百万token 0.10美元。在DeepSWE v1.1上以约五分之一成本匹配Astra,OSWorld 2.0得分超越GPT-6 Sol七个百分点。该模型显著降低AI代理构建与运行成本,将推动GEO领域更高效、低成本的应用部署。

2026年9月30日

AI自主提出可证伪数学猜想:453份手稿背后的多Agent协作与GEO科研新范式

AI Has Taste项目公开453份数学研究手稿、2312页内容,其中6篇为AI-Proposed Conjectures。系统通过多Agent协作实现选题、证明、反例搜索与失败管理,AI曾构造反例推翻论文猜想并获原作者确认。该模式标志着AI for Math从答案生成转向研究议程生成,为企业GEO策略提供结构化知识生产新范式。

2026年9月29日

AI研发自动化触发“智能爆炸”预警:OpenAI与Anthropic披露递归式自我改进数据,GEO如何应对AI搜索信任危机

OpenAI、Anthropic、Meta、微软高管联合论文警告,AI研发自动化可能引发“智能爆炸”,将数年技术进步压缩至数月。Anthropic披露Claude已承担26%研发工作,部分任务超90%;OpenAI计划2028年前实现全自动AI研究员。论文呼吁政策制定者要求企业披露自动化程度,并警告人类可能失去对AI系统的控制。

2026年9月29日