快科技10月2日消息,如今的大模型参数量已经突破5万亿规模,逼近10万亿,面临的挑战已经不是算力够不够,而是内存墙限制越来越多。
美国一家初创公司Volantis日前宣布获得了8800万美元的A轮融资,该公司正在构建一种全新的AI推理架构,旨在平衡内存容量与带宽,其首个系统A-1被设计用于超过20万亿参数的大模型,每个用户可以跑到10000Token/s的速度,同时还有更低的推理成本。
这个规模是什么概念呢?当前最强的Mythos/Fable大模型据说是5万亿参数级别的,但现在每个用户的速度不会超过100Token/s,A-1的规模是它的4倍,速度是100倍。
20万亿参数的大模型用FP16意味着40TB的内存,这样的需求即便是用上最强的Verra Rubin也很难满足,而且成本贵的要死,更别说提供10000Token/s的速度了。

A-1使用的方案是Volantis全新研发的架构,大量应用了光互连技术,将大量内存连接起来成为一个统一的内存池,单lane做到了24 Gb/s/lane,光互联带宽达到了250 TB/s以上(宣传材料数字,官网上是240TB/s),远高于内存的带宽,比HBM也要高10倍以上——公司的宣传材料说提升了两个量级,这有点夸张了。
除了带宽大幅提升,该公司的技术还可以做到体积小了2500倍,能效更高,单bit能耗远低于 1 pJ/bit(<<1 pJ/bit),而容量可以达到10TB,反正各项参数都是远超当前光互联技术水平的。
是真是假到明年就可以验证了,Volantis公司计划在2027年交付首批集成推理引擎给客户,到时候就能检验他们的新架构有没有水分了。

【本文结束】如需转载请务必注明出处:快科技
责任编辑:宪瑞
本文来自大风号,仅代表大风号自媒体观点。