从 Token 到任务:智能体 AI 如何改变基础设施的关注焦点
2026-07-28 【 字体:大 中 小 】
- 首页 > 技术文库 > 从 Token 到任务:智能体 AI 如何改变基础设施的关注焦点
从 Token 到任务:智能体 AI 如何改变基础设施的关注焦点
关键词:智能体 AI 基础设施 Arm架构 算力
时间:2026-7-27 17:03:20 来源:网络
“
随着 AI 从响应提示词迈向完成任务,基础设施的优化重点也从模型本身扩展到整个工作流,涵盖规划、工具调用、结果验证与任务执行。
”
随着 AI 从响应提示词迈向完成任务,基础设施的优化重点也从模型本身扩展到整个工作流,涵盖规划、工具调用、结果验证与任务执行。

上午 8:42,一名开发者打开笔记本电脑,映入眼帘的是环境构建失败、测试报错,还有一条等待发布的代码分支。过去,她可能需要花费大量时间逐一排查日志、比对代码提交记录、追溯仓库历史;而如今,她只需向 AI 编码智能体下达一句简单指令:
'修复失败的测试。找出 bug、提交补丁、重跑测试并汇总改动内容。”
敲几下键盘,喝上一口茶的时间,智能体就返回了已通过测试的补丁,并附上简洁的说明。对用户而言,效果如同瞬时魔法:输入需求,输出结果。但在系统内部,实现这一结果的过程一点也不简单。
仅一条提示词就可以触发请求解析、任务创建、策略检查、代码库检索、上下文拼接、Token(词元)编码、模型调用、工具验证、沙箱路由、文件编辑、测试运行、遥测采集与最终结果核验。模型调用固然关键,但它只是工作负载的一环,真正体现工程能力的是对任务图的协调与编排。
智能体 AI 会进行规划、检索、执行、校验、重试和反馈。随着 AI 从孤立的提示-响应交互模式转向持续工作流模式,性能的衡量维度也从 Token 转向完整的任务交付。
模型调用已不再等同于全部工作负载
长期以来,AI 基础设施主要以模型执行为衡量标准:预填充 (prefill)、解码 (decode)、每秒生成 Token 数、首 Token 延迟、吞吐量、批处理效率、内存占用以及加速器利用率。这些指标依然重要,但随着智能体 AI 的兴起,系统的关键路径已不再局限于模型执行本身。
传统的推理请求有明确的边界:从提示词到结果输出。而智能体工作流可能涉及任务规划、上下文检索、状态管理、工具与 API 调用、沙箱运行、结果验证、遥测采集以及重试。最终输出可能是一个答案、一段代码变更、一条数据库查询、一次工具调用,或是一个搜集更多信息的决策。
简而言之,智能体 AI 让推理演变为一个分布式系统问题。GPU 对于高强度模型执行仍然不可或缺,但围绕 GPU 展开的工作正日益成为系统性能的决定性因素:哪些任务在运行、在哪里运行、伴随哪些上下文、允许使用哪些工具,结果是否满足用户需求。
这个周边的技术栈为模型增加了多个层级,其中大量协调工作都由 CPU 承担,包括编排、内存与检索、工具调用、运行时与沙箱、策略系统以及可观测性等。模型则提供智能、推理和生成能力,而外围系统能将这些能力转化为可执行的行动。
为什么传统推理基准已无法全面衡量系统性能
对于聊天机器人,Token 吞吐量可以体现出模型响应速度与生成效率,以及系统能服务多少用户。但对于智能体 AI,这个评判视角并不够全面。
开发者并不会以每秒多少原始 Token 来感知系统性能。她真正关注的是:bug 是否定位准确、补丁修复是否正确、测试是否全部通过、权限是否合规、结果是否可信且可验证。对于企业、科研、安全、运营以及物理世界的各类智能体而言,同样如此,用户关心的是最终成果。
这意味着,智能体 AI 时代需要采用工作流级别的性能指标,包括:单项任务完成成本、工具调用延迟、检索延迟、沙箱启动时间以及单节点智能体数量。核心评判标准从“模型生成得有多快?”转变为“系统完成任务的效率有多高?”
CPU 发挥决定性的作用
CPU 在智能体 AI 中的价值,体现在围绕模型调用的各环节中。模型运行前,系统解析请求、初始化运行环境、加载策略、读取工程文件、查询检索系统、排序上下文、统计 Token 数量并准备请求。模型调用期间,CPU 负责处理路由、Token 化、批处理、流式传输和 Schema 配置。调用完成后,CPU 验证输出、路由工具调用、管理沙箱与子进程、采集日志、归类故障、更新状态并整合遥测数据。
在编码智能体的例子中,一些最耗费 CPU 资源的工作往往发生在模型生成修复方案之后:运行测试、调用编译器、启动子进程、归类故障、自主选择重试逻辑。这些操作会对 CPU 核心、缓存、内存、存储和编排软件形成压力。
这正是智能体 AI 看似“瞬间完成任务”背后隐藏的关键计算工作。
头节点正演变为整个系统的控制中枢
随着智能体系统规模化,头节点 (head node) 的角色变得具有战略意义。AI 头节点不只是加速器旁边的一颗 CPU。它是核心控制中枢,负责让异构 AI 系统以统一、可靠的方式协同运作:路由请求、管理状态、准备上下文、协调加速器、调用管理 API 与工具、执行策略、采集遥测,并保持工作流的可观测性。
编排的本质,在于决定执行什么任务、在哪里执行、携带哪些上下文、允许调用哪些工具,以及如何判断任务已经完成。而头节点则是支撑这一能力的基础设施控制中枢,负责在 CPU、GPU、加速器、内存、存储、网络、运行时、数据库、规则管理系统以及可观测性工具之间协调资源,并将这些编排决策贯穿整个系统。
随着 AI 基础设施日益异构化,模型、工具、内存、加速器、API、沙箱、规则管理、追踪和评估循环都必须保持同步协作。而头节点正是这一协调能力得以统一执行和运转的控制中枢。
Arm 的机遇:全链路智能体工作流优化
对 Arm 而言,智能体 AI 代表着一次平台级机遇。其对基础设施的要求,正对应了云基础设施建设者最关心的关键能力:性能、能效、扩展性、软件成熟度以及选择自由度。行业评判标准不再局限于 Token 生成速度,而是平台能否在延迟、功耗、成本、资源利用率、稳定性、开发迭代效率等现实约束下,高效完成更多工作流。
Arm 提供了一个为异构基础设施打造的计算平台。在智能体时代,AI 系统由 CPU、GPU、加速器、内存、存储、网络、运行时、API、工具、可观测系统和规则控制协同组成。Arm 的核心价值,在于帮助整个系统实现更高效率、更强扩展能力,并使系统级优化更加容易。
这一价值始于 Arm 深厚的技术底座:基于灵活的 Arm Neoverse IP 与计算子系统 (CSS) 打造的计算平台、软件支持体系以及合作伙伴生态,为 AI 基础设施建设者提供了针对特定工作负载设计和部署基础设施的多元路径。智能体 AI 让这种选择灵活性变得更加重要,因为没有任何单一计算配置能够高效承载工作流的每一个环节。
这也是为什么 Arm 的价值应当从工作流层面来衡量。更优秀的智能体基础设施应当体现在这些成果上:更低的单项任务成本、更低的延迟、更高的资源利用率、更可预测的执行效果。这些关键指标能够直接体现 CPU 和头节点的价值,并将其与业务成果紧密关联起来。
Arm 将这一理念继续延伸,推出面向智能体 AI 基础设施的自研芯片 Arm AGI CPU,提供另一种部署 Arm 架构算力的选择。在这套方案中,CPU 协调围绕模型展开的工作:控制、内存、检索、工具、API、运行时、沙箱以及可观测性。
其目标并不是削弱 GPU 或其他加速器的作用,而是让整个异构系统更好地协同运作。智能体 AI 时代,真正占据优势的将是那些能够优化整个任务图 (Task Graph),而非仅仅优化 Token 流的基础设施。
下一代基准:以任务完成为核心
回到前文那位等待修复结果的开发者,她需要的不是 Token,而是问题修复 bug。这就是智能体 AI 带来的基础设施架构转变。在提示词驱动的传统问答时代,模型性能是显而易见的重心。在智能体时代,系统必须优化全链路闭环:模型智能、内存、工具、状态、规则管理、执行、验证与可观测性。
下一代 AI 基础设施的评判标准,将是它能否快速、准确、安全、可观测且高效地完成任务。在此背景下,Arm AGI CPU 为 AI 基础设施建设者提供了部署 Arm 架构算力的新选择,用于承载编排与任务执行等关键工作负载,帮助将模型输出转化为真正有价值的行动。
上一篇:【已经是第一篇了】
下一篇:【在LTspice仿真中对数字滤波器进行建模(第一部分)】
猜你喜欢
- 芯闻
- 芯品
- 方案
- 文章
- • 隆重推出 PcVue 17优化能源。提升性能。保障基础设施安全。
- • 全年 1900 亿美元资本支出预算仍不够:消息称微软面临整体算力吃紧
- • 英飞凌携系统级创新成果亮相2026慕尼黑上海电子展
- • 横店资本战略投资仁芯科技,布局智能汽车“芯”动脉
- • 神雲科技搭载第 6 代 AMD EPYC™ 服务器处理器,推进智能体 AI (Agentic AI) 基础设施
- • 东擎为边缘平台导入 Axelera AI Metis 加速器,至高扩充 214 TOPS 算力
- • Semtech SurgeSwitch®系列新器件为53 V USB-PD电源总线(VBus)提供完善的防护
- • Semtech SurgeSwitch®系列新器件为53 V USB-PD电源总线(VBus)提供完善的防护
- • 艾为AI手机方案助力全球首款AI智能体手机努比亚NaviX Ultra亮相WAIC 2026
- • “一心多用”:SMT技术成为智能体时代的效率提升密码
- • 当6 TOPS不再是极限:米尔RK3576 + Hailo-8,让高帧率摄像头真正“实时”
- • 德明利推出企业级存储解决方案,为AI数据中心提供国产化可靠支撑
- • 从 Token 到任务:智能体 AI 如何改变基础设施的关注焦点
- • AI算力互联“光”速起跑:中国MEMS公司映芯谐振切入全球算力基建光交换核心链路
- • “十五五”开局之年推进新一代通信网建设观察
- • 把算力中心搬上天
猜你喜欢
Bourns推出具有低 DCR 的薄型屏蔽功率电感器
第三代半导体2026上半年业绩深度复盘:繁荣表象下的分化暗流
Bourns 推出具有变革性 EdgMOV 压敏电阻系列 ,提供节省空间的浪涌保护解决方案
惠海推出H6338A 降压恒流IC,5-60V降压9V 12V 24V 36V PWM调光 模拟调光 无频闪
Coherent高意宣布100G ZR QSFP28-DCO收发器全面上市
把开源命脉装进芯片帝国:英伟达129亿美元收购Hugging Face,AI的“安卓时刻”来了?
7折,米尔-新唐MA35D1开发板正式开售!
英飞凌推出新型固态隔离器,交换速度更快,功耗降低高达70%
Nordic Semiconductor nPM2100 PMIC将助力开发人员提升非充电电池项目设计
噪音抑制片:TDK推出全新超薄、轻量型坡莫合金薄膜片,有效屏蔽低频带噪声
芯连青山绿水,智护万千生灵——宸芯MNet自组网技术助力野生动物保护
Eddie Ramirez:服务器市场Arm优势有三 多元化方案提供更多选择性
苹果首款折叠iPhone发布 果链迎来结构性重估:谁在受益,谁在承压?
前苹果NPU全建制高管团队押注端侧通用计算平台,成立一年已获三轮产业方领衔近10亿投资
服务器CPU生产挤占PC产能,英特尔是否该“外包解困”?
当“芯片底片”换成12英寸:全球光掩模重构中的国产机会
光博会观察: NPO,光互联的务实之路
人工智能行业亟需深度转型——算力涨价潮影响与应对
汽车电气系统的演进:从12V/24V架构到48V系统
当国内软件都在学 Palantir,真正的天花板在哪里?
芯连青山绿水,智护万千生灵——宸芯MNet自组网技术助力野生动物保护

Eddie Ramirez:服务器市场Arm优势有三 多元化方案提供更多选择性

苹果首款折叠iPhone发布 果链迎来结构性重估:谁在受益,谁在承压?

前苹果NPU全建制高管团队押注端侧通用计算平台,成立一年已获三轮产业方领衔近10亿投资

服务器CPU生产挤占PC产能,英特尔是否该“外包解困”?

当“芯片底片”换成12英寸:全球光掩模重构中的国产机会

光博会观察: NPO,光互联的务实之路

人工智能行业亟需深度转型——算力涨价潮影响与应对

汽车电气系统的演进:从12V/24V架构到48V系统

当国内软件都在学 Palantir,真正的天花板在哪里?
