公司动态
RKNN-LLM 速览|跑在瑞芯微 NPU 上的大模型,完整上手路径
RKNN-LLM 速览跑在瑞芯微 NPU 上的大模型完整上手路径【免费下载链接】rknn-llm项目地址: https://gitcode.com/gh_mirrors/rk/rknn-llm想在没有 GPU 的板子上把大模型跑起来、让设备本地回答问题但不确定模型怎么转、板端怎么运行、示例在哪找RKNN-LLM 就是干这件事的官方工具栈这篇文章写给想 5 分钟上手的你。典型场景速查大模型边缘部署的三种卡点当你遇到嵌入式设备没有 GPU、却需要大模型本地应答的情况时它能把你熟悉的 Qwen、DeepSeek、Llama、Gemma 等开源模型在 PC 上转成 .rkllm 文件结果是整段推理跑在 RK3588 的 3 核 NPU 上数据不出设备离线环境照样稳定可用。当你遇到产品要加拍照问答能力、又不想依赖云端接口的情况时它能把视觉编码器单独转成 RKNN 模型再和 RKLLM 语言模型串起来结果是完全本地化的多模态问答图片理解到文字生成全在板上完成。当你需要给其他服务提供统一对话接口时它能用 Flask 或 Gradio 把模型包成服务暴露 OpenAI 风格的 API结果是你现有代码改个请求地址就能接入。最快部署方式五步跑通第一次本地推理拉代码clone 仓库地址https://gitcode.com/gh_mirrors/rk/rknn-llm示例、工具包、板端库一次到位。装转换工具按你的 Python 版本安装 packages 目录里现成的 wheel3.9 到 3.12 都有不用自己编译。转模型参考 examples/rkllm_api_demo/export 里的流程先生成量化校准数据再执行导出脚本产出面向目标芯片的 .rkllm 文件。推板端跑起来用 adb 把示例程序和模型推到设备设置 LD_LIBRARY_PATH 环境变量用 scripts 目录的 fix_freq 脚本锁定频率后启动演示程序。看数据设置环境变量 RKLLM_LOG_LEVEL1 即可打印推理性能和内存占用再配合性能监测脚本看 CPU 与 NPU 负载。核心模块速查遇到问题先看哪个目录模块作用你该看哪个路径rkllm-toolkitPC 端加载 HuggingFace 模型、量化并导出 .rkllmrkllm-toolkit/rkllm-runtime板端 C/C 推理接口与预编译库rkllm-runtime/examples/rkllm_api_demo最小完整示例转换 板端推理examples/rkllm_api_demo/examples/multimodal_model_demo视觉编码器 大模型的多模态全流程examples/multimodal_model_demo/常见报错排查新手最容易栽的三处⚠️版本不匹配toolkit 和 runtime 必须同版本新版工具转出的模型配旧板端库会直接报错确认两边都是 1.3.0 即可。⚠️缺 libomp.so板端运行提示找不到该库时去交叉编译工具链里找到它拷到和 librkllmrt.so 同级目录。⚠️图片 token 占位符写错多模态推理的三个占位参数要去模型的 modeling 源码里查猜错就会输出乱码README 里给了各模型的示例值。下一步先跑通示例建议先把 examples/rkllm_api_demo 的转换 板端推理流程完整跑一遍再对照 doc 目录下的中文 SDK 手册读细节之后你看多模态示例时基本不会有负担。【免费下载链接】rknn-llm项目地址: https://gitcode.com/gh_mirrors/rk/rknn-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考