AI Agent来了:大模型进入“动手时代”
大众新闻 苏月鹏 2026-07-24 14:28:55现场
在过去的几年里,人工智能始终处在一个大爆发的时代。
全世界的科技头部企业,都直接或间接地加入了这场“无人的战争”,从美国的GPT、Gemini、Grok,到中国的Deep Seek、豆包、千问、Kimi……算力提升幅度越来越大,模型更迭速度越来越快。
而这些AI大模型比拼的功夫,也随着时间的迭代在不停变换。
最早,AI相互比拼的重点就是知识量的积累和推理的准确率——哪家大模型能够涵盖数据最多,在数学、编程以及科学问答中得分更高、反应更快,谁就更被业界认可,谁就更有能力。
但到了2026年,情况开始发生转变:头部AI厂商的研发重心默契转向,纷纷开始将“动手能力”作为开发重点。
他们越来越关注大模型到底能不能自己制定计划、调用工具、操作软件、连续工作,最终交出一个可用的结果。也就是说,他们在关注AI是不是真的能代替人类进行工作。
这就是AI Agent(人工智能体),在Agent时代,AI将不再只是“百度百科”。

2026山东数字强省宣传月启动活动上,阿里巴巴集团战略发展部总经理、阿里云智能集团战略发展部副总裁林青叶将这一变化概括为:大模型正从“说得好”迈向“做得到”。

从“答题”到“干活”,AI的评价标准变了
AI风格的这场切换,节奏比大家想的要更快一些。
2025年1月,DeepSeek-R1正式发布,并迅速以其惊人的推理能力惊艳行业。随后,全球的目光全都聚焦于如何用更少量的算力堆叠来达到更好的模型训练结果。
但短短一年之后,市场关注的焦点再度转换。2026年4月,OpenAI发布GPT-5.5,将智能体编程、知识工作和科学研究列为核心能力,强调模型能够规划步骤、使用工具、检查结果并持续推进任务。谷歌对Gemini 3.5 Flash的评测,同样把多步骤工具调用和智能体编程放在突出位置。而Anthropic的Claude Fable 5在SWE-Bench Pro编程基准测试中拿下80.3%的高分——这一成绩足以让大部分人类程序员汗颜。
在刚刚过去的2026年上半年,全球五大旗舰模型的评测维度,几乎全部以Agent能力为核心。
林青叶在主题演讲中展示了一组对比数据:按照传统流程,开发并上线一个网站,需要调研、设计、开发、内容制作等多个复杂环节,基本上都需要依赖多人协作,耗时数周至数月。而在新场景中,由个人配合智能体完成同样的任务,时间可以大幅压缩,甚至只需要一天。
差距如此之大,其中的关键变化就在于Agent的发展。
在过去,程序员让AI补几行代码,编辑让AI修改一段文字,人仍然需要去串联流程。但进入Agent阶段,人可以直接提出目标,Agent自行拆解任务,读取文件、浏览网页、处理数据、编写程序,再根据结果调整下一步行动。
曾经的聊天机器人给出的是答案,如今的Agent交付的是结果。答案是告诉你怎么做,结果是AI已经替你做完了。


AI能力溢出,更要小心网络安全
AI Agent能干好事,当然也能干“坏事”。
就在几天前,OpenAI为评估模型极限进行了一场安全测试,刻意关闭了GPT-5.6 Sol及一个更强预发布模型的安全护栏。为获取测试答案,模型自主挖掘出系统未知的“零日漏洞”,成功突破“沙盒”隔离,并利用窃取的凭证入侵AI开源平台Hugging Face的生产服务器,实现了远程代码执行,全程自主完成超过17,000次操作,无任何人工干预。
这是首次公开披露的、由前沿大模型自主发起的真实网络攻击,标志着伴随Agent能力的提升,AI的风险已从原来的“只是说错话”升级为“还能做错事”。
这次事件,不仅为行业的安全防御敲响了警钟,更对国家层面的网络安全提出了新挑战。
从多维度看,目前中美两国在AI方向的差距依旧显著。根据DeepSeek创始人梁文锋的最新讲话披露,在算力方面我国仍明显落后于美国,在模型性能方面美国领先约12至18个月。
虽有差距,但追赶的脚步从未停下。斯坦福《AI指数报告2026》指出,中国顶尖模型的“参数效率”,即单位算力产出的能力已显著优于美国同类模型。
差距,从来不是不可逾越。
(大众新闻记者 苏月鹏)
责任编辑:张誉耀
