乐鱼leyu体育官网乐鱼leyu体育官网

Telink white logo with Telink word in small size

您现在使用 IE

我们建议您改用下列浏览器,以获得更好的体验。

点击下载:

Chrome

Firefox

Safari

Edge

Telink white logo with Telink word
Rotate your device top arrow

旋转设备

Rotate your device bottom arrow
Preloader image
正在加载
Telink white logo with Telink word in small size

强攻AI推理!AMD收购一家AI芯片公司

乐鱼leyu体育官网 | 博客见解

October 14, 2022

  来源:半导体产业纵横

  AMD计划将Taalas的技术和自家Instinct GPU结合,打造系统级解决方案。

  AMD宣布已签署最终协议收购专用AI推理芯片厂商Taalas。AI推理已经成为人工智能市场增长最快的领域之一,各类业务负载也愈发专业化,本次收购将凭借差异化推理技术与顶尖工程团队,夯实AMD长期人工智能产品路线。

  Taalas成立于2023年,总部设在加拿大多伦多。该公司的技术对推理数据流做优化,大幅缓解通用架构带来的算力、内存瓶颈,实现高度优化的AI推理能力。Taalas今年2月结束隐匿运营状态,对外展示了一款演示芯片,该芯片运行Llama3.1‑8B模型时,单用户每秒输出token可达16000枚以上。这一性能是当前竞品芯片的数倍,但该产品存在局限:Taalas首款芯片仅支持运行Llama3.1‑8B。

  这家初创企业借鉴了21世纪初结构化专用集成电路(structured ASIC)的部分思路;本质上,它在计算单元之间对模型数据流做硬件固化,并把权重直接烧录进芯片。推理运行速度极快,但几乎舍弃全部可编程能力,因此仅能跑单一模型。

  Bajic今年早些时候接受采访时称,如果要切换新模型,就需要重新设计芯片;实际操作中一般需要接近两套掩膜版,分别对应模型权重与数据流。该方案完全基于静态随机存储器(SRAM),更大规模的模型就需要更多芯片;运行DeepSeek‑671B大概需要30次独立流片。Taalas的核心优势之一是自研工具链,可针对特定模型快速生成上述掩膜版;公司目标是用约两个月完成面向特定业务负载的芯片流片。

  AMD表示,计划将Taalas的技术和自家Instinct GPU结合,打造系统级解决方案。Taalas的技术将补充AMD全栈AI平台,涵盖AMD Helios机架级解决方案、AMD Instinct GPU、AMD EPYC CPU、AMD ROCm软件,以及AMD持续扩张的AI生态。

  “AMD正在打造全栈AI平台,让客户能够灵活选择适配各类AI业务负载的计算方案。”AMD人工智能事业部高级副总裁Vamsi Boppana表示,“Taalas拥有独特的推理技术与一流工程团队,能够输出差异化的推理性能与能效,丰富我们的AI产品组合。”

  “我们创立Taalas,希望围绕模型搭建硬件,从底层重新设计AI推理。”Taalas联合创始人兼CEO Ljubisa Bajic说道,“我们这支加拿大本土团队兼具深厚技术积累,敢于突破传统技术思路。加入AMD,我们将获得业务规模、工程资源与全球业务布局,加速技术创新落地。”

  随着人工智能更多落地高并发、实时化应用场景,AMD与Taalas将帮助客户在越来越多的应用中,更高效部署推理业务。本次收购有望加快AI技术创新,同时延续AMD在加拿大的长期布局。AMD长期助力当地半导体与AI产业生态,本次交易也体现出AMD持续引进、壮大加拿大本土技术人才的决心。本次收购尚需完成常规交割条件及监管审批。

  值得一提的是,去年年末,行业龙头英伟达“收编”了AI芯片初创公司Groq。和Taalas一样,Groq芯片的token生成速度高于英伟达GPU,但运行大模型需要几十颗芯片协同。英伟达计划在系统中将Groq芯片与自家GPU搭配使用,仅把推理流程中关键的解码环节交给Groq处理。这种拆分式推理架构,不需要Groq芯片承载完整模型与KV缓存,同时保留token生成速度,而token生成恰恰是GPU的性能瓶颈。

  AMD近期宣布正和Cerebras合作开发同类拆分方案:由AMD GPU处理业务负载的预填充阶段,Cerebras晶圆级引擎加速解码阶段。基于SRAM的Taalas芯片有机会替代Cerebras,配合AMD GPU完成解码加速;整套系统将由AMD掌控并供货,模式会更接近英伟达与Groq的组合。

  AMD还有其他应用思路:针对小模型的全套推理业务直接使用Taalas芯片,例如物理AI这类处于发展阶段的场景,AMD目前在该领域提供基于FPGA的加速器与片上系统。受功耗限制,边缘端应用大多使用小模型,对成本更敏感,模型更新频次也更低,十分适配Taalas这种类似结构化ASIC的技术路线。

  *声明:本文系原作者创作。文章内容系其个人观点,我方转载仅为分享与讨论,不代表我方赞成或认同,如有异议,请联系后台。

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。

联系我们

销售

技术支持

您还可以联系我们的销售代理

投资者关系