- 上午 7:30 - 晚上 9:30
- (001) 25465 258 369
Token经济正蓬勃发展,尤其是在2026年,AI产业正经历从训练到推理的重心转移。根据国家数据局在3月国新办发布会上的数据,截至2026年3月,中国日均Token调用量已飙升至140万亿,较2024年初的1000亿增长了逾千倍,两年内增长了四个数量级。Token已不再是技术文档中的抽象概念,而是AI时代最基本的交易媒介,其增长速度远超历史上任何基础资源。
市场研究机构IDC预测,全球年度Token消耗量将从2025年的0.0005 Peta Token激增至2030年的15万Peta Token,年复合增长率高达3418%。到2031年,全球活跃智能体数量预计将达到3.5亿。这种爆发式增长的背后,是AI领域的结构性变革。
在2026年之前,AI产业的重点是训练,需要大量的GPU和参数。然而,2026年之后,推理正成为算力消耗的主要驱动力。IDC估计,2026年中国AI服务器市场规模将达到3500亿元,其需求结构已从“训练驱动”转变为“训练与推理并重”,推理服务器的出货量已接近训练机型。
除了不断增长的推理需求,智能体应用的兴起以及推理成本的显著下降,都在推动行业走向爆发。AI正从“回答问题”转向“执行任务”,智能体的自主规划、工具调用和多步骤执行能力,正在以指数级速度消耗Token。这种转变对算力基础设施带来了颠覆性的影响。
PPIO联合创始人兼CEO姚欣向36氪指出,传统云计算主要服务于人类用户,例如程序员租用虚拟机通常需要几天甚至数月;而Agent的调用任务则高度碎片化且频率极高。PPIO平台上的Sandbox最小结算单位已精确到秒。人类使用云服务存在使用高峰和低谷,但Agent的使用是全天候的。
在延迟方面,人类对延迟的容忍度为秒级,但Agent完成复杂任务可能需要反复调用数十甚至上百次,每次数百毫秒的延迟累积会显著影响任务执行效率。这些差异表明,为人类设计的云计算架构难以直接满足Agent的需求。
在此背景下,Token工厂成为调节算力运力的关键环节,并吸引了市场的广泛关注。根据灼识咨询的数据,按2025年及2026年第一季度平均每日Token消耗量计算,PPIO在中国独立AI云计算服务提供商中位居首位。2026年4月,平台日均Token消耗量已达1.03万亿次,到6月更是突破1.2万亿次,同比增长超过8倍。PPIO的AI云计算收入也从2024年的1038.7万元跃升至2025年的1.192亿元,同比增长超10倍。平台全球注册开发者数量从2024年末的12.5万人增长到2026年6月的超过66.6万人。
当推理成本每年下降10倍,单纯提供算力资源的商业模式正迅速失去价格优势。真正的价值在于以更高的效率、更低的成本和更优的体验来交付Token。PPIO所定义的“智能Token工厂”,是一套针对Token全生命周期进行优化的规模化生产与交付体系。
姚欣表示,尽管Token工厂概念在2026年3月的GTC大会上才被广泛提出,但PPIO自2023年起便已涉足推理服务,并在2024年推出了MaaS平台,在该领域积累了三年多的经验。他强调,当前更重要的是提升Token工厂的智能化水平,而非仅仅提供算力。PPIO提出了Agent时代的核心公式——Agent生产力=Token智能密度×Agent Loop时长。其中,Token智能密度决定了Agent每一步决策的质量上限,而Agent Loop时长则决定了Agent能够持续运行多久以及完成任务的复杂程度。
为此,PPIO在国内率先推出了智能模型网关,作为AI Agent的智能调度中心。该系统通过混合模型来优化关键决策,提升质量;并将简单任务自动分流到轻量模型,以最低的Token成本实现最高的智能性能,从而不断推高Token智能密度。
关于混合模型,姚欣透露,PPIO正在测试将两到三款不同模型组合使用,让它们进行相互比较和协作。内部测试显示,这种混合模型在某些任务执行上已超越GPT-5.6。这表明,模型的智能上限不仅存在于模型参数内部,还可以通过工程化手段从外部突破。智能模型网关通过提供混合推理系统,使得每一次模型调用都如同一次“专家会诊”。
PPIO通过从底层GPU集群到推理服务优化再到应用场景的深度理解,构建了全栈式AI云能力,体现了极致的效率。姚欣以人的对话交流、智能体调用和AI编程为例,说明了不同场景对性能参数的差异化需求:人类追求秒级响应,智能体要求毫秒级,而AI编程则对精度要求最高,以减少错误。PPIO基于不同场景进行定制化优化,这是其与其他平台公司的显著区别。
在产品能力方面,PPIO的差异化体现在快速集成、平台中立以及自研推理加速引擎。姚欣指出,开发者平均需要调用10到15款不同类型的模型,并可能每三个月就需根据模型迭代进行切换。PPIO平台支持接入200余款开源模型,用户只需修改一行代码即可切换模型,这种中立定位赢得了开发者信任。其自研推理加速引擎深度优化了Agent调用模式,适配了Agent负载的碎片化、高频化和连续性特征。
值得注意的是,行业GPU的平均利用率通常在40%到50%之间,而PPIO长期维持在75%以上。姚欣解释称,公司依靠其分布式算力调度能力,整合了全球六大洲5000余个算力节点,通过东西半球的时区错峰调度,将不同时间、空间和请求频率的负载有效融合,实现了近乎直线的利用率曲线。在算力成本不断上涨的当下,充分利用现有算力直接关系到企业的盈利能力,而PPIO在这方面的表现构成了其重要的竞争壁垒。
“Agentic Cloud”是下一波Token消耗的基建浪潮。它解决了“今天如何高效生产Token”的问题,并进一步探讨“未来Token将由谁、以何种方式消耗”这一宏大命题。2026年,全球云巨头纷纷发布Agentic Cloud战略,如谷歌的Agent Engine与Agentic Data Cloud,阿里云的全栈智能体化升级,亚马逊的AgentCore,以及微软Foundry Agent Service的商用,目标均是将Agent打造成云的核心用户。
在WAIC 2026上,PPIO正式发布“Agentic Cloud”的全新定位,姚欣认为,其核心逻辑是云的第一用户正从人类转向AI Agent。行业趋势也印证了这一点,AI智能体的自主推理、工具调用和多步骤工作流,具备持续、高频、密集的Token消耗特性,对云基础设施提出了新的要求。
姚欣分享的数据显示,尽管全球80亿人口中,仅有约20%使用了AI,真正付费的比例更低,但智能体调用正呈指数级增长。以PPIO自身为例,其近千个后台Agent正在承担开发、运维、客服等工作,且一个人可以拥有多个Agent,每个Agent都在7x24小时消耗Token。
基于这种多元需求,PPIO将Agentic Cloud的产品架构划分为基础设施层、模型服务层和Agent Harness平台层。Harness作为约束、指导、验证和纠错Agent执行的工程框架,包含了上下文构建、工具编排、验证循环、成本控制和可观测性等所有大模型之外的环节。
沙箱是Harness的核心组件之一。PPIO去年推出的国内首款兼容E2B接口的Agent沙箱,为Agent Harness提供了安全隔离的运行环境。姚欣提到,去年发布沙箱时,行业对智能体的理解尚停留在“模型调用的手和脑”,而随着OpenClaw等开源智能体的普及,人们才意识到长程任务和复杂任务的持续执行才是真正的痛点。PPIO Agent沙箱冷启动时延低于200 ms,采用系统级安全隔离,每个Agent任务运行在独立虚拟机环境,支持上万个沙箱并发创建,空闲时可自动暂停计费,综合使用成本较同类产品降低90%以上。其上线一年,业务规模已增长超120倍。
目前,Token的定价排序也反映了未来的消耗方向:编程最贵,其次是智能体,最便宜的是提供对话服务的Token。姚欣认为,PPIO的服务对象正从人转向Agent,甚至未来的机器人。这一转变正在重塑云计算的商业模式,从比拼功能数量和生态封闭程度,转变为比拼谁能让硅基生命运行得更快、更便宜、更稳定。PPIO选择拥抱开源,做AI时代的互补者,而非封闭花园或全栈替代者。
Token经济正在重新定义算力的价值尺度,在这场重构中,效率最高者将赢得未来。








世界杯赛程以世界杯直播为核心,带来高效便捷的体验。