Hacker News Show8/10 19:5275 分精选
250美元FPGA上运行LLM,速度达2.1万tok/s
Show HN: A tiny LLM running at 21,000 tok/s on a $250 FPGA (Live Demo)
推荐理由:我认为这条值得关注:它用250美元FPGA跑出21k tok/s,证明低成本硬件也能做高速推理,对边缘AI和硬件选型有直接参考价值。
一位开发者展示了在售价250美元的FPGA(AMD Kria KV260)上运行微型LLM的实时演示,推理速度达到每秒21,000个token。该方案通过片上实现,将模型部署于FPGA逻辑中,实现低延迟和高吞吐。项目在Hacker News上获得23分,引发讨论。该演示展示了FPGA作为低成本、高效能AI推理硬件的潜力,尤其适合边缘计算和嵌入式场景。目前该项目处于早期阶段,但已证明在预算硬件上实现高速语言模型推理的可行性。