#人工智能 有开发者在本地部署 Kimi K3 模型,仅需 8.24GB 内存就可以实现运行,只是运行速度为 33 秒 / Token (注意看单位)。

如果将内存提升到 128GB 则可以实现 20 秒 / Token,不过这也基本是性能上限,继续堆内存无法继续提高效率。

目前开发者已经将基于 C99 开发的推理引擎开源,有兴趣的用户可以研究看看。

查看全文:https://ourl.co/114176?t

😁订阅 🤔解封 🥰推特 🎉CN2VPS
来自频道: @landiansub
Loading comments...