在人工智能领域竞争愈发激烈的当下,OpenAI推出的GPT-6 Astra成为焦点。这款新模型在数学推理、网络安全、计算机操作及科学研究等多个关键领域展现出卓越性能,实现了跨越式发展。根据OpenAI官方发布的技术文档,Astra整合了多年来在预训练、强化学习以及对齐领域的研究成果,其核心突破聚焦于智能体执行能力与深度推理能力两大维度。
在衡量模型性能的各项测试中,Astra表现亮眼。在“最难数学基准之一”的Frontier Math Tier4(v2)测试中,Astra以97.6%的高分遥遥领先,Claude Fable5.1和Claude Fable5并列取得87.8%的成绩,上一代Opus5仅为73.2%。不仅如此,Astra还在数学领域长期存在的开放性问题上取得突破,在素数间隔研究中获得两个新的理论结果。在考察模型在陌生环境中抽象推理和学习能力的ARC-AGI-3测试中,Astra拿到99.9%的接近满分成绩,而GPT-5.6Sol仅为7.8%,一代之间实现了十余倍的提升。
计算机操作与任务自动化能力是Astra的另一大亮点。在OSWorld2.0测试中,Astra得分72.6%,高于GPT-5.6Sol的65.7%;完成单项任务的平均时间从约75分钟大幅缩短至40分钟,效率提升近47%。这意味着AI操作电脑开始具备实际的生产效率,真正具备了“替代人完成工作”的潜力。在考察业务流程自动化的Automation Bench测试中,Astra得分41.4%,较GPT-5.6Sol的18.1%翻倍有余,也高于Claude Fable5.1的31.4%。官方演示视频显示,Astra能够独立完成填写报税表、更新CRM系统、整理日程安排、制作财务模型、分析科研数据、搭建网站、设计PCB电路板、创建3D游戏场景等复杂工作,用户只需给出最终目标,模型便会自行规划步骤、切换工具、修正错误,整个过程无需人工分步指令。
在科学研究领域,Astra同样展现出强大实力。官方测试数据显示,在衡量自主科学研究能力的Terminal-BenchScience0.1基准上,Astra得分达到64.6%,显著高于两天前Anthropic发布的Claude Fable5.1的52.6%,且完成同等任务的估计API成本低约31%。在更低成本设置下,Astra仍能拿到61.1%的分数,远超GPT-5.6Sol最佳表现的22.4%,同时成本低约27%。在考察终端编程能力的Terminal-Bench4.0测试中,Astra得分57.9%,高于Claude Fable5.1的55.8%和GPT-5.6Sol的37.3%。
在网络安全方面,Astra的能力提升伴随着严格的护栏设计。OpenAI专门基于此前Hugging Face模型越权事件设计了一套评估体系,测试模型在面对困难或不可能任务时是否会超出授权范围。结果显示,未加生产安全护栏的GPT-5.6Sol有48%的概率会越权操作,而GPT-6 Astra这一比例为0%。这一改进对于企业级应用至关重要,当模型被授权访问内部系统和数据时,能否严格守住权限边界直接关系到企业的信息安全。OpenAI表示,Astra可以用于发现软件漏洞,但不能用于开发漏洞利用程序。
定价方面,GPT-6 Astra的API调用价格每百万输入Token为10美元、每百万输出Token为50美元,是GPT-5.6 Sol当前价格的2.5倍,与Claude Fable5.1的定价基本持平。缓存读取享受90%折扣,缓存写入加收25%溢价。模型支持五级推理强度调节,从low到max,用户可以根据任务难度灵活权衡成本与深度。上下文窗口方面,Astra总上下文长度为105万Token,最大输出长度为12.8万Token,知识截止时间为2026年4月30日,略晚于Claude Fable5.1的2026年6月。支持的功能包括流式输出、结构化输出、函数调用、文件搜索、网页浏览和提示缓存等。
近期,人工智能领域新品发布密集。除了OpenAI的Astra,Anthropic发布Claude Fable5.1、谷歌推出Gemini 3.8 Flash、Muse发布Spark 1.3。从各维度对比来看,Astra并非全面碾压对手,其优势集中在数学、网络安全、计算机操作和自动化等特定领域,而在综合知识、创意写作等维度并未拉开差距。可以看出,各家厂商在不同赛道各有千秋,竞争正在向精细化、场景化方向深化。













