中国政策档案 Governance Archive HOLDINGS 235,224 · FONDS 122
Record · qbitai ACC. 900073706

New AI Chip from Taalas Achieves 17,000 Tokens per Second

24人团队硬刚英伟达!AMD前高管梦之队出手,新芯片每秒17000个token

Issuer
Date
2026-02-21
Instrument
other
Cited by
0
This article reports on a new AI chip from startup Taalas that embeds large language models directly on silicon, achieving 17,000 tokens per second inference speed—ten times faster than current competitors—while reducing cost and power consumption. The chip is designed by a 24-person team including former AMD executives.
Full text · 原文 2,351 字
鹭羽 发自 凹非寺<br> 量子位 | 公众号 QbitAI<br> 造芯片的还有高手?<br> 刚刚推出的一款最新芯片,直接冲上硅谷热榜。<br> 峰值推理速度高达每秒17000个token。<br> 什么概念呢?当前公认最强的Cerebras,速度约为2000 token/s。<br> 速度直接快10倍,同时成本骤减20倍、功耗降低10倍。<br> 这就意味着,LLM真正来到了亚毫秒级的即时响应速度。实机效果be like:<br> 视频链接:https://mp.weixin.qq.com/s/1yO1wjv23ECvSxF66vEZcQ<br> 但这块一夜之间刷屏硅谷的芯片,并非出自英伟达、AMD之手,而是一家成立仅两年、团队仅有24人的初创公司——Taalas。<br> 芯片代号HC1,也是公司的首款产品。<br> 不同于所有竞争对手,Taalas选择了迄今为止最极端的技术方案——<br> 模型不再加载到内存里,而是直接刻在硅片上。换言之,芯片即模型。<br> 结果显而易见,Taalas撬动了芯片算力护城河:H100买不到,试试HC1又何妨?<br> 速度快10倍,功耗降至10分之一<br> HC1目前搭载Llama 3.1 8B模型,用户每秒最高可生成17000 token/s,远高于主流GPU/ASIC。<br> 其中,在同一模型下Cerebras接近每秒2000个token,SambaNova约为每秒900个token,Groq约为每秒600个,英伟达Blackwell架构的B200为每秒350个。<br> 具体来说,HC1采用台积电N6工艺,面积为815mm²,体积小巧而且开源,单颗芯片即可满足8B模型需求。<br> 每颗芯片典型功耗仅为250W,一个服务器如果同时装配10颗HC1,功耗也才2.5kW,可以直接使用常规空气冷却机架部署。<br> 那么是如何做到这么大的性能飞跃的呢?<br> 首先HC1借鉴了2000年代初期的结构化ASIC芯片理念。结构化ASIC芯片采用门阵列和固化IP,然后仅通过改变互连层就能使芯片适应特定的工作负载。<br> 这样下来,结构化ASIC芯片不仅比全定制ASIC更便宜,也比FPGA性能更优。<br> HC1则采用类似思路,不改变底层电路,只通过调整两层掩模,就能低成本快速做出专用AI推理芯片。<br> 它放弃了大多数可编程功能,将模型连同权重一起通过基于掩模ROM的调用架构存储在芯片上,并保留一个可编程SRAM,用于保存微调后的权重(如LoRA)和KV缓存。其余则全部通过掩模ROM固化执行。<br> 这一策略能在设计成本相对可控的前提下,实现模型到芯片的快速转化,将芯片生产周期从原先的六个月缩短到两个月。<br> 而如此激进的量化方式势必会影响性能,研究团队也意识到了这一点,所以可以通过LaRA适配器进行重新训练,以及可配置的上下文窗口,让芯片的最低限度灵活性得以保留。<br> 换句话说,就是将一个完整大模型通过物理硬连线进芯片中,省去了传统存算分离的成本,用灵活性换取极致的速度和效率。<br> 除了Llama 3.1,Taalas也尝试将其它模型集成到HC1上,例如对DeepSeekR1-671B的多芯片解决方案。<br> 将SRAM部分拆分到单独的芯片上,然后可以将每片HC1的存储密度提高到约20位参数,总计需要30个定制HC1。<br> 整体处理速度可达到每用户每秒12000个token,如果考虑到30颗芯片成本为每百万token是7.6美分,那么该方案成本也不到同等吞吐量的GPU方案的一半。<br> 假设GPU更新周期为四年,而HC1每年都需要重新更换,总成本也仍然具备优势。<br> AMD前高管梦之队<br> 其背后的公司Taalas成立于两年前,由AMD前集成电路设计总监Ljubiša Bajić、AMD/ATI/Altera前技术经理和工程师Leila Bajić、AMD前ASIC设计总监Drago Ignjatović共同创立,堪称AMD前高管梦之队。<br> 其中,Ljubiša Bajić不仅曾在AMD和英伟达担任高级职位,负责高性能GPU研发设计,还是Tenstorrent的创始人兼首任CEO。<br> 新公司致力于开发专为AI推理和训练设计的全新架构,强调分层设计和晶格网络,能够让芯片像大脑一样根据任务需求动态处理数据。<br> 在2020年,芯片教父Jim Keller也强势加入Tenstorrent,并接任CEO一职,而Ljubiša Bajić转任首席技术官CTO,专注于产品研发。<br> 随后,他又创立了Taalas,试图通过类似硅基编译器的方式,直接将AI模型转化为硅芯片。<br> 于是首战告捷,一个仅有24名成员的团队,产品投入仅3000万美元,就创造出比通用AI芯片高出几个数量级的能效比。<br> 目前Taalas已筹集2亿美元投资,预计将在春季基于HC1发布第二代变体,将集成一款中等规模的推理大模型。<br> 随后预计将在冬季部署上线HC2,HC2密度更高、运行速度也会更快。<br> 不过对于HC1,网友们的评价却是两极分化。<br> 一方面,网友认为HC1的超低延迟将有益于推动具身智能等领域发展。<br> 另一方面,也有网友实测过后发现,HC1高速推理的背后,却是糟糕的推理深度:<br> 以及对于迭代周期相当迅速的大模型来说,HC1的硬编码可能会使芯片很容易过时。<br> 这也是为什么当前芯片厂商都在普遍推出通用型芯片的原因之一。<br> 参考链接:[1]https://x.com/wildmindai/status/2024810128487096357?s=20[2]https://taalas.com/the-path-to-ubiquitous-ai/[3]https://chatjimmy.ai/[4]https://www.eetimes.com/taalas-specializes-to-extremes-for-extraordinary-token-speed