产品简介
算能 BM1688 是国产边缘 TPU 里的高算力档。INT8 算力 32 TOPS,INT4 量化后可达 64 TOPS,功耗不超过 18W,可以被动散热运行。
它和瑞芯微 RK3588 形成差异化:RK3588 胜在全能与多媒体,BM1688 聚焦高算力与高并发推理。
核心功能
- 算力档位:INT8 算力 32 TOPS,INT4 量化可达 64 TOPS,对标 NVIDIA Jetson Orin NX 这一档。
- 端侧大模型支持:原生支持 Llama3、Qwen2 等 7B 级模型的端侧推理,INT4 量化效率较高。实测 7B 模型可达 60 到 65 tokens/秒,接近云端体验,并支持多模态图文输入。
- 视频并发能力:面向多路视频分析设计,可支持 32 路视频并行分析,图像分类任务在 ResNet18 上可达 1350 FPS。
- 功耗与散热:满载功耗不超过 18W,可无风扇被动散热,工业宽温版本覆盖 -20℃ 到 +60℃,适合户外与工业现场。
- 扩展与部署:提供 PCIe 扩展,支持多卡并联最高 4 卡,合计可到 128TOPS。工具链为 BMNNSDK2,支持主流框架,Docker 化部署。
适合谁用
以下类型的用户会特别受益于 算能 BM1688:
- 端侧大模型:本地对话与多模态推理,要求 7B 级模型可用
- 重度视频分析:16 路以上并发检测,需要单机扛住多路流
- 工业现场与户外部署,需要宽温、无风扇、可多卡扩展
- 对数据出内网有硬性要求的私有化推理场景
优点亮点
- 32 TOPS INT8 与 18W 功耗的组合,算力密度较高
- 支持 7B 级大模型端侧推理,INT4 量化效率突出
- 多卡并联可扩到 128TOPS,扩容路径明确
- 工业宽温加无风扇设计,现场适应性强
价格与方案
按芯片与整机销售。2026 年 BM1688 整机盒子价格区间大致 3000 到 5000 元,属旗舰定位,适合预算敏感、又需要一定算力并看重国产供应链的项目。
总结与建议
BM1688 适合的是「算力要够、又要便宜、还得国产」这三条同时成立的场景。7B 模型 60 tokens/秒 的端侧表现已经接近可用,多卡并联给了向上升级的空间。需要留意的是它的定位:CPU 为 8 核 Cortex-A53,走的是专用加速路线,通用计算并非主战场;如果项目里多媒体编解码的比重较高,建议把瑞芯微 RK3588 一并纳入选型比较,BM1688 更适合看重单位算力密度与多卡扩展的部署。
版本演进
- BM1688 量产应用 (2026):32 TOPS INT8 / 64 TOPS INT4,支持 7B 级模型端侧推理,最大 4 卡并联至 128TOPS