资讯动态

Kimi K3-in-C:8GB内存在CPU上运行2.78万亿参数模型的突破

2026-08-18
7285次

随着科技的发展,许多人长期以来认为,要运行参数量巨大的大模型,必须依赖更强大的硬件和更大的显存,这一认知被一个名为Kimi K3-in-C的开源项目颠覆了。完整的Kimi K3模型的磁盘权重文件大小达到1.56TB,总参数量高达2.78万亿,具有接近100万的token上下文窗口,属于当前顶尖的稀疏大模型(MoE)。让人惊讶的是,该项目使用C语言编写的推理引擎,在普通的CPU上运行时,最高内存占用仅为8.24GB。其核心理念在于不必将全部模型权重加载到内存中,而是通过硬盘流式读取,从而降低了硬件的要求。

这一先锋项目在发布后,受到了技术界的广泛关注,而其带来的挑战也十分明显:以往,想要调试这样庞大的模型,开发者必须面对严苛的硬件条件,而如今普通的消费级设备就可以进行架构验证和逻辑调试。尽管如此,仍需指出的是,这并不意味着能够实现顺畅的对话,实际上,它的生成速度仍然存在不足。由此,值得深入思考的是,评估大模型的部署能力究竟是看型号的总参数量,还是看运行时的内存使用情况?以往,行业普遍关注显存的数量,努力通过量化与分布式部署来压缩权重,但这一项目表明,对于MoE稀疏模型来说,磁盘模型的大小与运行时内存的占用可以有着巨大的差距。

about image

在核心技术拆解方面,Kimi K3是一种支持智能Agent功能的多模态稀疏混合专家模型。模型参数总量达2.78T,每个token的激活参数则为104B,网络层数达到93层,其中69层为KDA层,24层为门控MLA层。模型的每一层都有896个专家,而在运算时只会选中其中的16个专家,配合2个共享专家,以此来高效利用内存。与稠密模型的运算要求需加载全部权重矩阵不同,稀疏MoE模型仅需访问并读取少量被路由选中的专家权重。因此,“可访问性”和“驻留内存”的概念成为这一方案的核心创新所在。

about image

推理引擎将1.56TB的模型文件分为三类:路由专家库约1.45TB存放在NVMe硬盘上,根据需要读取而不常驻内存,主干网络约108.8GB,根据机器的内存情况尽量多驻留,剩余部分通过流式读取。而在内存方面的管理,越大的内存允许更多的主干网络驻留,会减少对硬盘的数据重复读取,从而降低推理延迟;反之,内存更小则会导致更多的磁盘读取次数,影响速度,但模型的输出结果始终保持不变。这一推理引擎的运行逻辑类似于数据库系统,在于如何高效地利用内存与存储。

about image

在部署流程方面,该项目仅支持Linux x86-64平台,并要求CPU支持AVX2和FMA指令集以及GCC9或Clang10以上的编译器。项目提供的测试工具无需下载完整的1.56TB权重文件,只需通过小型测试张量图来验证内核、路由和解码逻辑的正确性。测试完成后,用户可以查看不同的硬件预设方案,选择适合自己的内存分配策略。执行环境检测工具会自动评估硬件并提供推荐的预设设置,以确保高效运行。

全国咨询热线

13594780274

开云(kaiyun)官方网站 · 中文主页服务中心

联系电话:13594780274

联系人:李总

邮箱:collaborative@126.com

公司地址:安顺市菠愧坡196号


微信扫一扫

手机官网