Token原本只是大模型处理文本、图像、音频时使用的离散信息单元,如今却逐渐变成连接算力、模型、应用和收入的计量单位。换句话说,AI不再只是卖软件,而是在按智能服务被消耗的数量进行结算。
这件事情为什么重要?因为Token把过去看不见的AI成本,变成了一笔笔可以计算的账。一次问答需要多少Token,一段代码消耗多少Token,一个智能体完成任务需要调用多少次模型,这些都可以被量化。企业因此能够把AI从“技术部门的试验项目”,逐渐纳入成本、预算和经营核算。数据显示,Token已经同时承担成本单位、吞吐单位、预算单位和治理单位4种角色。
所以,Token经济并不是简单地把AI改成“按量收费”。它真正改变的是产业链的计价方式。过去互联网时代,流量是连接内容、广告和平台商业模式的重要尺度;到了AI时代,Token开始承担类似的价值标尺作用。谁生产Token,谁调度Token,谁消费Token,谁能够把Token转化成真实业务收入,产业链的利益分配就沿着这条线重新排列。
先看最上游。Token并不是凭空产生的,它背后首先是一套非常重的基础设施。芯片、服务器、数据中心、网络、存储、配电、制冷、电力和储能,共同组成所谓的“Token工厂”。文件将产业链划分为上游生产、中游调度、下游消费三层,上游负责把能源和硬件转化成计算能力,中游负责模型和Token分配,下游则把计算能力变成具体的业务价值。
这也意味着,AI看起来越聪明,背后的“电”和“机器”就越重要。调研显示,成本结构中,GPU及加速器硬件约占Token生产成本的50%,网络与冷却设施约占20%,软件栈与平台维护约占15%,人工及支持服务约占10%,其他成本约占5%。这个结构非常直观:今天讨论Token价格,不能只看模型公司怎么定价,还必须看上游一枚Token到底花了多少硬件和运营成本。
而数据中心本身,也不是一个简单的“买服务器、放机房”的生意。市场参与者分成基础电信运营商、超大规模云服务商和第三方中立服务商3类。前者依靠网络、土地和政企资源,后者依靠芯片、云平台和完整技术生态,第三方则更强调定制交付、机房运营和大客户绑定。不同模式决定了它们在Token产业链里赚的不是同一种钱。
真正值得注意的是电力。很多人看AI产业,只盯着GPU,却容易忽略一件最朴素的事情:芯片最终还是要吃电。调研将电力称为AI生产的底层成本锚点,并指出算力中心用电规模持续增长,电价、供电稳定性以及数据中心能效都会直接影响Token生产成本。PUE从1.5至1.6降低到1.1以下,甚至先进方案达到1.04,本质上就是让同样的电产生更多有效计算。
一度电能产生多少Token,逐渐比单纯拥有多少块GPU更值得关注。因为GPU可以买,服务器可以买,甚至数据中心也可以扩,但如果能源成本过高,算力最终还是会变成昂贵的Token。于是,电力、液冷、配电、储能这些过去容易被看作“配套设施”的东西,开始直接进入AI经济的核心成本表。
再往中游走,真正决定Token怎么流动的是大模型和分销平台。大模型厂商并不是简单把芯片算出来的结果卖掉,而是通过模型架构、推理能力、上下文处理、多模态能力以及软件优化,把底层算力加工成可以被调用的智能服务。商业模式也从单纯API调用,逐渐扩展到模型授权、行业解决方案和全生命周期增值服务,Token由此完成第一次价值加工。
这里最容易被忽视的是“中间商”。在传统产业里,很多人天然觉得中间环节会压缩利润,但Token经济里的分销平台并不只是倒卖接口。它们通过统一接口连接多个模型,通过动态路由把不同任务分配给不同模型,再利用批量采购获得价格优势。如果平台还能通过推理加速提高单GPU产出效率,那么它赚到的就不只是简单价差,而是“流量差”和“效率差”叠加后的利润。
这也是为什么Token产业链里的利润,并不会平均分配。上游芯片企业赚的是硬件溢价和技术代差,算力基础设施赚的是机柜、算力和资源服务费,中游模型厂商赚的是模型能力、生态和API收入,分销平台赚的是调度效率与服务差价,下游应用赚的则是业务结果。调研指出,垂直应用的高价值场景拥有更强的成本传导能力,而通用场景则更依赖规模效应。
Token产业链最核心的矛盾不是“谁拥有Token”,而是谁能把Token卖出更高的价值。假设同样消耗100万Token,一个应用只是生成一些普通内容,另一个应用却能帮助企业完成风险识别、研发辅助或者质量检测,那么两者能够承受的Token成本完全不同。前者必须拼价格,后者可以把AI成本嵌入整体服务价格里。这就是Token从“成本”走向“价值”的关键一步。
下游变化特别明显。Token最初主要对应一次问答,但现在消费方式已经从单一API调用,向智能体、业务系统集成和场景化服务延伸。智能体最大的变化,是它不再只回答一个问题,而是连续调用多个工具、模型和数据源去完成一项任务。于是,用户购买的东西也从“模型回答”变成“任务结果”,Token消耗自然从零散交互转向持续调用。
企业端的Token价值正在被重新估算。调研显示,2025年《财富》中国500强企业GenAI部署率达到74.6%,制造业、建筑业等行业也开始跟进。企业真正关心的已经不是“模型有多少参数”,而是它能不能进入办公、研发、生产、客服、决策等具体流程。一旦AI从员工偶尔使用的工具变成业务流程的一部分,Token就会从偶发费用变成持续运营成本。
中国市场的变化更加直接。数据显示,截至2026年3月,中国日均Token调用量已经突破文件所列规模,较2024年初增长超过1000倍;2025年中国智算算力规模达到1460 EFLOPS,资料预测2026年达到2020 EFLOPS。这里最值得关注的不是某一个绝对数字,而是Token调用量和底层智算基础设施同时放大的关系,说明AI消费正在从“尝鲜”变成高频使用。
市场规模也在发生变化。数据显示,中国通用及多模态大模型市场规模从2023年的141亿元和91亿元,增长至2025年的495亿元和237亿元,调研预计2026年两者分别达到738亿元和386亿元。多模态大模型占比也从2023年的39.2%左右提升至2026年的52.3%。这背后意味着,Token消费正在从文字问答向图像、音视频等更复杂的信息处理扩张。
当Token进入物理设备,产业链的想象空间又完全不同。语音交互硬件、智能座舱、机器人、物联网终端,都可能成为Token持续消费的入口。传统硬件卖出去之后,收入往往集中在销售时点,而智能硬件如果持续调用模型,就可能形成“硬件交付加持续智能服务”的收入结构。调研将其概括为“硬件即入口、Token即续费”,本质上是把一次性产品收入和持续计算消费连接起来。
一条非常清晰的价值链浮现出来:电力提供最底层能量,芯片把能源转成计算能力,数据中心把计算能力组织起来,模型把算力加工成智能服务,分销平台负责调度和匹配,最终由应用把Token转化成企业收入或用户体验。钱也沿着这条链条流动,但价值并不是平均分配。越靠近稀缺资源,越容易获得成本优势;越靠近高价值业务,越容易获得定价权。
因此,理解Token经济不能只看“Token价格涨不涨”。更应该看3个数字之间的关系:一是单位算力能产生多少Token,二是企业每消耗一单位Token能创造多少收入,三是应用最终能够留下多少利润。前两个决定产业效率,最后一个决定价值分配。资料提出将Token成本占营收控制在20%以内,并通过推理加速、上下文缓存等方式降低单位消耗,同时采用结果导向收费,本质上就是在解决“AI越用越赚钱还是越用越烧钱”这个最现实的问题。
从这个角度再看整个产业链,会发现Token真正改变的并不是某一个环节,而是一套经济账本。过去AI行业经常讨论模型能力、算力规模和用户数量,现在这些指标都开始被一个更具体的问题串起来:消耗了多少Token,又创造了多少价值。上游关心每度电能产出多少Token,中游关心每单位Token能卖多少钱,下游关心每单位Token究竟能带来多少业务结果。产业链的核心,也就从单纯堆资源,转向计算资源与商业价值之间的效率比拼。
关于报告的所有内容,公众号『行业报告智库』阅读原文或点击菜单获取报告下载查看。