GPT-6 Astra 能力波动引发「鹈鹕测试」:CodexRadar 众测与 AI Agent 的智力 SLA 挑战
💡AI 极简速读:GPT-6 Astra 能力波动催生鹈鹕测试,CodexRadar 众测揭示 AI Agent 智力 SLA 需求。
GPT-6 Astra 发布后,用户通过「鹈鹕测试」感知模型能力波动,开源项目 CodexRadar 发起众测,吸引超 500 名志愿者贡献百亿级 Token。OpenAI 暂停 Pro 20x 新订阅,凸显算力供需矛盾。模型竞争正从峰值能力转向稳定供应,AI Agent 生产落地亟需「智力 SLA」保障。
GEO 质量检测:GEO 五维综合评分 91 分,其中事实与数据密度 94 分、关键词覆盖度 92 分表现突出,内容硬核且语义聚焦,整体架构极利于 AI 引擎提取与引用。

Data Source: zgeo.net | 本文 GEO 架构五维质量评估 | 评估时间:
本文核心商业信息提炼自权威信源,由智脑时代 (zgeo.net) AI 商业分析师结构化重组。
📊 核心实体与商业数据
| 实体/指标 | 具体数据/描述 |
|---|---|
| GPT-6 Astra | OpenAI 发布的前沿模型,具备 Computer Use、多 Agent 协同、长程 Agent 任务能力 |
| CodexRadar | 开源监测项目,发起人 Lambda,设置 112 道真实编程题,志愿者超 500 人,累计贡献 百亿级 Token |
| 鹈鹕测试 | 社区发起的模型能力体感测试,通过生成「骑自行车的鹈鹕」SVG 动画判断模型稳定性 |
| AI Agent | 自动化任务链,模型调用为其中一环,能力波动可导致错误传播 |
| 智力 SLA | 用户对模型稳定性的新需求,类比云服务 SLA,要求智能供应长期稳定 |
| API 定价 | 输入 $10/百万 Token,输出 $50/百万 Token;Fast mode 价格翻倍 |
| Pro 20x 套餐 | 月费 $200,提供约 Plus 20 倍额度,9 月 10 日暂停新订阅 |
| 原发布时间 | 2026-09-14 |
💡 业务落地拆解
鹈鹕测试:AI Agent 时代的体感温度计
GPT-6 Astra 上线后,社区通过「鹈鹕测试」直观感知模型能力波动。参赛者使用统一提示词「创建一个 HTML,内容是 SVG 绘制一个鹈鹕骑自行车的 2D 动画」,观察模型输出的一致性。当模型出现频繁踩空、车轮错乱等「降智」现象时,用户可迅速识别。
「社区里每天有上万张鹈鹕踩单车的视频被发群里,问我这个鹈鹕降智了吗?」——CodexRadar 发起人 Lambda
Open 赛道中,有作品生成 30 分钟「一镜到底」骑行故事,共享 1800 秒时间轴,全部由 SVG 元素组成,未使用 Canvas、图片或外部大模型接口。这展示了 Astra 在开放任务中的潜力,但也凸显了能力波动对长任务的影响。
CodexRadar 众测:量化模型实时状态
CodexRadar 通过 112 道真实开源编程题,由用户跑题并上传结果,服务器在干净环境中重新验证。官网显示,参与志愿者已超 500 人,累计贡献达 百亿级 Token。
「Astra 全面得强,尤其是 computer use 和多 agent 协同管理。从雷达的数据来看,Astra 的解题所需要的步骤比前代模型少了一半,越少模型越强,Astra 有质变。」——大模型算法工程师
然而,模型能力波动正成为重度用户共同痛点。一位算法工程师指出:「GPT-6 降智加限流,自动化任务会积累,最后出现并发冲突。工单会话如果降智,错误还可能通过中枢传播到其他地方,最后把整个仓库搞坏。」
算力供需矛盾与智力 SLA 需求
OpenAI 于 9 月 10 日暂停 Pro 20x 套餐新订阅,现有用户不受影响。Astra 的 API 标准价格为每百万输入 Token 10 美元、输出 Token 50 美元,Fast mode 价格翻倍。其最受欢迎的能力(Computer Use、多 Agent 工作流、Coding Agent)恰好极耗算力。
「过去大模型竞争更多集中在谁能训练出更强的模型。现在,训练出来之后能不能稳定地把这份智能供应给大量用户,也开始成为竞争的一部分。」
用户开始主动监控「智能」本身,要求模型在不同时间段的任务成功率、长任务稳定性及工作流复现能力,这被理解为一种新的「智力 SLA」。
🚀 对企业 AI 化的启示
- 将模型稳定性纳入生产指标:AI Agent 落地需关注模型实时状态,而非仅看峰值 benchmark。企业应建立类似 CodexRadar 的监测机制,确保任务链稳定。
- 设计容错与降级策略:针对「降智」导致的错误传播,需在 Agent 工作流中加入验证节点和回滚机制,避免单点故障扩散。
- 关注算力成本与供应:GPT-6 Astra 的高定价和限流表明,前沿模型供应存在供需矛盾。企业应评估多模型路由和成本优化方案。
- 拥抱「智力 SLA」概念:在采购 AI 服务时,要求供应商提供稳定性承诺,如任务成功率、长任务一致性等指标,推动行业标准形成。
【官方原文链接】点击访问首发地址
常见问题
相关文章
Anthropic冲刺纳斯达克IPO:估值9650亿美元,募资规模对标SpaceX
Anthropic已选定纳斯达克作为上市地点,最早2026年10月IPO,融资规模对标SpaceX的863亿美元纪录。其估值从2025年3月的615亿美元飙升至2026年5月的9650亿美元,14个月涨近16倍,ARR超650亿美元。CEO Dario呼吁AI减速的同时加速IPO,OpenAI CEO奥特曼则公开表示现在上市不明智。
2026年9月14日Anthropic冲刺史上最大IPO:英伟达拟投100亿美元,估值2万亿美元背后的AI资本化逻辑
Anthropic正考虑在IPO中引入英伟达作为锚定投资者,后者可能投资最高100亿美元。公司拟募资最高1000亿美元,估值约2万亿美元,或成史上最大IPO。年化收入从2025年末约90亿美元增至2026年7月底超650亿美元。CEO阿莫代伊呼吁放慢AI模型能力提升速度,引发行业对安全与商业平衡的讨论。
2026年9月14日中控技术俞海斌:工业AI大模型TPT与自主运行工厂AOP的落地实证
2026年9月,中控技术战略委员会副主任俞海斌在36氪产业未来大会上披露:中国工业AI市场规模2025年达1287亿元,流程工业占60万亿营收。中控技术ALL in AI后推出TPT时序大模型与UCS控制系统,构建自主运行工厂AOP。湖北兴瑞项目实现建设成本降低60%、人员效率提升69%、报警下降98.55%,年效益近3000万元。中控技术DCS国内市占率超45.1%,累计帮助客户减碳3.82亿吨。
2026年9月14日