我的购物车
资讯分类
全部资讯
最新活动
商城公告
行业信息
新品推荐
元器件知识
资讯标签
iCEasy商城(182) 艾为awinic(159) 艾迈斯欧司朗(147) 英伟达NVIDIA(94) 萤火工场(62) 飞腾派V3(33) 兆易创新(31) 罗彻斯特电子(28) 赛昉科技(StarFive)(27) 灵动微电子(16) 小华半导体(15) 开源社区活动(14) 芯佰微(14) 日清纺微电子(13) 领麦微LEAMEMS(13) Seeed矽递科技(11) 上海雷卯Leiditech(8) 微源半导体 LPSemi(8) 极海半导体(8) 物奇WuQi(7) 航顺芯片(6) 高通Qualcomm(5) 沃虎WOHU(3) 沃虎VOOHU(3) 峰岹科技(3) BeagleBoard(3) 机器人(2) 芯查查(2) 开源社区(2) 英迪芯微(2) 博瑞集信(1) 中电港(1) 硅光电二极管BPW 34 S-Z(1) 蓝光激光二极管PLPT9 450MD_E(1) 绿色激光二极管PLT5 520HB_P(1) 红外传感发射器件SFH 4713B(1) 小华半导体HXSC(1) 阿加犀(1)

阿加犀完成LocateAnything-3B高通NPU端侧适配 解码速度突破100+token/s

发布时间:2026-08-10

近日,阿加犀已完成LocateAnything-3B视觉定位模型在高通NPU上的端侧适配,并通过Model Farm平台向开发者开放预编译模型资源与推理代码。

此次适配将LocateAnything-3B的并行框解码技术优势延伸至移动端与边缘设备,为具身智能、企业智能等场景的端侧落地提供高性能视觉感知基础设施。

单步并行解码解码速度提升最高2.5倍

LocateAnything-3B是一款用于快速且高质量视觉定位(Visual Grounding)的视觉语言模型,能够在企业智能(Enterprise Intelligence)和具身智能(Physical AI)的多样化领域中,实现精确的目标定位、密集检测以及基于点的定位。

该模型采用了通用型(Generalist)设计,支持指称语境定位(Referring Expression Grounding)、多目标检测、GUI(图形用户界面)元素定位以及文本定位等任务,在复杂和杂乱的场景中表现出强劲的性能。

其核心创新点——并行框解码(Parallel Box Decoding, PBD),通过单步并行预测完整的边界框坐标,而非传统的逐Token自回归解码。这在保持几何一致性的同时显著提升了效率,使其解码速度比以往的方法最高提升了 2.5 倍。


源模型评估结果

该模型在包含自然场景、机器人、自动驾驶、GUI 交互以及文档理解等多个领域的超大规模数据集(包含 1,200 万张图像、超过 1.38 亿个查询、7.85 亿个边界框)上进行了训练。它可作为通用多模态感知的基础设施,提供定位、GUI 理解以及多模态智能体(Agentic)能力的支持。


阿加犀做了什么?不是简单转换是系统性工程优化

将LocateAnything-3B模型迁移到搭载高通QCS8550的APLUX Rhino Pi X1设备上,LocateAnything以W4A16精度运行,首字响应时间为0.15秒,编码速度达1662 tokens/s,解码速度为110 tokens/s,上下文长度支持2048 tokens,模型文件大小1.83 GB。



达到这样的成就,阿加犀技术团队主要做了三件事:

01算子级深度适配LocateAnything-3B的并行框解码结构对算子兼容性要求极高。阿加犀没有采用QNN的“一键转换”,而是逐算子手工映射和编译,调整了部分算子融合策略与内存访问模式,避免了因算子不兼容导致的精度损失或推理失败。

02模型轻量化与资源精算利用AIMO工具对模型权重进行INT8/INT4混合精度量化,将模型体积压缩至原来的约四分之一,精度损失控制在1%以内,使其能稳定运行在犀牛派X1上。

03定制化异构推理流水线通过AidLite SDK和AidGen推理引擎,设计了一套并行预处理-推理-后处理流水线:视觉编码器跑在NPU、LLM解码器调度至CPU/GPU协同计算,同时避免数据在芯片单元之间来回搬运。


多场景落地LocateAnything-3B端侧能力应用方向

LocateAnything-3B在端侧部署后,视觉定位任务无需依赖云端即可完成。以下是几个典型的应用方向:


场景一:机器人与具身智能在机器人导航与操作中,LocateAnything-3B可实现本地化的物体定位与环境理解。开发者通过自然语言指令即可驱动机器人识别并定位目标物体,无需联网或云端计算。这一特性适用于家庭服务机器人、仓储AGV、巡检机器人等对响应速度和数据隐私有要求的场景。


场景二:企业智能与工业检测LocateAnything-3B的端侧适配使视觉检测能力可直接部署在产线边缘设备上。开发者无需搭建服务器集群或配备专业算法团队,即可快速集成目标定位、缺陷检测等功能到现有系统中,降低工业视觉方案的部署门槛。


场景三:智能终端与GUI自动化LocateAnything-3B支持GUI元素定位,适用于智能终端自动化场景。基于端侧模型,开发者可构建离线运行的智能助手,自动识别屏幕界面元素,实现语音控制操作、自动化测试等功能。


场景四:自动驾驶与移动设备LocateAnything-3B的端侧推理能力可为车辆提供实时目标定位。开发者可利用其低延迟特性构建视觉感知模块,作为轻量化辅助驾驶方案的一部分。


LocateAnything-3B在高通NPU上的成功适配,验证了阿加犀在端侧视觉语言模型部署上的系统性工程能力。从算子映射到精度校准,从模型轻量化到异构推理流水线设计,阿加犀正在将前沿模型的端侧落地门槛持续降低。

目前,LocateAnything-3B预编译模型及推理代码已通过Model Farm开放实测数据,点击【阅读全文】即可获取详细信息。