cann-llm: 从终端调用MateBook Pro的NPU加载自选模型进行LLM推理(提供/v1/chat/completions接口)

项目地址:

目前仅适配MateBook Pro,对其他机型(Pro S/Edge)的支持情况未知。

华为官方模型下载

可惜官方模型的上下文窗口太小(最多4K),无法用于编程智能体,就连DeepSeek Harness的极简模式也会让上下文窗口爆掉,输出被截断。

原理

通过Python调用了鸿蒙PC内置的NPU推理框架库,一共有两套框架:

-b hiai 调用 /system/lib64/libhiai_llm_engine.so (默认,更快,私有API,系统自带“本地AI模型管理”用的就是这个库)
-b cann 调用 /system/lib64/ndk/libcann_llm_engine.so (公开API但推理比hiai慢,不确定是库的问题还是实现问题)

加载自定义模型

需要先在支持CUDA的电脑上完成模型转换,转换为华为框架支持的CANN (OMC)格式才能加载。
华为NPU支持的算子较少,推理框架支持的模型类型也有限,可能只有少量模型能转换成功。

演示视频

视频链接

回复列表(1|隐藏机器人聊天)
添加新回复
回复需要登录。