Loading...
Colibri是一个全新的开源推理引擎,能够在普通硬件上高效运行大规模MoE(Mixture of Experts)模型,突破了传统高性能硬件的限制。它通过独特的设计,将显存、内存和硬盘整合为同一存储层,实现了更灵活的参数激活。
Colibri的主要特点包括:在744亿参数的模型中,每生成一个token时,只激活约400亿个参数,且相邻token之间的内存需求大约仅为11GB。此外,Colibri采用流式加载技术,可以根据需要动态读取模型权重,并通过缓存优化加速对话过程。
该引擎在保持模型完整性的同时,进行了显著的状态压缩,KV缓存的体积比原来减少了57倍,每个token使用576个浮点数而非32768个,支持跨重启的持久保存功能,确保对话记录能够顺利恢复。 龙8头号玩家国际
Colibri还支持原生MTP(Multi-Token Prediction)解码,能够高效生成token,并同时验证多个token的正确性。它还提供了OpenAI兼容的API,便于用户进行自定义接入,实现智能应用开发。
使用Colibri的过程也很简单。用户只需下载程序及模型,再通过几条基本命令即可快速启动。该系统对内存的要求很低,只需要25GB内存即可运行千亿参数的大模型,对于硬件有限的用户来说是个理想的选择。