中国政策档案 Governance Archive HOLDINGS 223,918 · FONDS 106
Record · 经济参考报 ACC. 900061505

AI Industry Chain Collaborates to Reduce Token Costs and Improve Efficiency

AI产业链携手推动词元降本增效

Issuer
经济参考报
Date
2026-07-20
Instrument
other
Cited by
0
This article reports on efforts across the AI industry chain to lower token costs and improve efficiency, as discussed at the 2026 World AI Conference. It covers developments in TPU chips, computing-electricity coordination, large model optimization, and intelligent model routing to reduce costs and enable broader AI commercialization.
Full text · 原文 1,586 字
&emsp;&emsp;记者在2026世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026)上采访发现,随着智能体让词元消耗大幅攀升,降本增效成为众多企业的发力点。从芯片到算电协同,从大模型到智能模型路由,每个环节都在为降低词元成本而发力。<br> &emsp;&emsp;当前,国内算力芯片创业市场上,张量处理单元(TPU)是热门赛道。在大规模纯张量AI训练或推理的场景下,最新代际TPU的能效、单位词元成本优于主流GPU产品。<br> &emsp;&emsp;TPU芯片企业中昊芯英创始人杨龚轶凡表示,百万词元成本降到最低是当前优化的方向,因为高额算力成本已经制约AI商业化落地。公司新一代芯片的目标就是大幅压低单位词元成本,比上一代成本直接减半,后续迭代有望降到原有的十分之一。只有成本下探,各类AI应用才能规模化普及。<br> &emsp;&emsp;算力中心的成本从源头决定词元成本。2026年政府工作报告中首次提及“算电协同”,对此,中科类脑董事长刘海峰告诉记者,算力基础设施全生命周期成本中,电力支出占比超20%,是决定算力产业核心竞争力的关键变量。以1000P标准算力集群为例,年度总耗电量约2000万度,依托平台优化可节约20%用电量,即每年减少400万度电力开支,节约成本直接转化为经营毛利,大幅提升价格竞争力。<br> &emsp;&emsp;对于算电协同降本增效的路径,刘海峰表示,目前算电协同更多依靠物理空间靠近,未来重点是实现算力、电力双向柔性联动调度。例如通过统筹风电、光伏、储能多类型供电来源,动态测算不同时段最优供电成本结构,最大化绿电使用比例;同时基于分时电价、风光发电实时波动,灵活迁移算力任务负载,主动错峰使用低价清洁能源,从源头压缩算力用电成本。<br> &emsp;&emsp;不少国产大模型在追求性能的同时,也在着力改善词元性价比。腾讯副总裁林松涛表示,混元HY3大模型以相对小的参数实现了比肩更大尺寸旗舰模型的能力,使用成本只有顶尖模型的百分之几,为企业的规模化应用提供了更加经济的选择。<br> &emsp;&emsp;美团LongCat-2.0(龙猫)大模型在业内首次提出输入命中缓存不收费的模式。对此,美团相关负责人透露,典型智能体使用场景中,用户输入和输出比例约为150比1。经测算,针对输入部分的缓存词元采用不计费规则,用户的综合成本有望降低一个数量级。<br> &emsp;&emsp;刚上线即引发关注的万亿参数旗舰模型Kimi K3,虽然单价不菲,却表现出了颇为不错的性价比。<br> &emsp;&emsp;大模型评测机构SuperCLUE发现,通过测算完成同样任务的成本开支,Kimi K3在任务得分比第二名高出18%的前提下,任务平均成本却低约16%。这意味着,国产旗舰模型的性价比在持续优化。<br> &emsp;&emsp;对此,SuperCLUE创始人徐亮认为,Kimi K3在处理多轮交互复杂任务时,依托更强底层能力减少迭代轮次,叠加优异的上下文缓存命中率,综合调用开销优于预期。<br> &emsp;&emsp;由于不同大模型的能力和价格差别较大,“智能模型路由”也成为WAIC的热点。<br> &emsp;&emsp;派欧云创始人姚欣介绍称,此前智能模型路线仅做简单“请求转发”,新的智能模型路由在处理高价值、高风险或结果不确定的关键步骤时,不是只问一个模型,而是将问题同时分发给多个擅长此道的专家模型,通过交叉验证和融合生成最终答案。同时智能路由会根据任务类型进行选择,比如简单问答用轻量模型,复杂推理用强模型,并压缩冗余上下文,复用之前的计算结果,设置预算护栏和失败回退机制。最终目标是用更经济的词元成本,完成同样质量的任务。<br> &emsp;&emsp;派欧云综合测算发现,其智能模型网关可以将智能水平提升20%,同时将成本降低50%到60%。(记者 叶健 袁小康)