近日,阿加犀已完成LocateAnything-3B视觉定位模型在高通NPU上的端侧适配,并通过Model Farm平台向开发者开放预编译模型资源与推理代码。
此次适配将LocateAnything-3B的并行框解码技术优势延伸至移动端与边缘设备,为具身智能、企业智能等场景的端侧落地提供高性能视觉感知基础设施。

单步并行解码解码速度提升最高2.5倍
LocateAnything-3B是一款用于快速且高质量视觉定位(Visual Grounding)的视觉语言模型,能够在企业智能(Enterprise Intelligence)和具身智能(Physical AI)的多样化领域中,实现精确的目标定位、密集检测以及基于点的定位。
该模型采用了通用型(Generalist)设计,支持指称语境定位(Referring Expression Grounding)、多目标检测、GUI(图形用户界面)元素定位以及文本定位等任务,在复杂和杂乱的场景中表现出强劲的性能。
其核心创新点——并行框解码(Parallel Box Decoding, PBD),通过单步并行预测完整的边界框坐标,而非传统的逐Token自回归解码。这在保持几何一致性的同时显著提升了效率,使其解码速度比以往的方法最高提升了 2.5 倍。

源模型评估结果
该模型在包含自然场景、机器人、自动驾驶、GUI 交互以及文档理解等多个领域的超大规模数据集(包含 1,200 万张图像、超过 1.38 亿个查询、7.85 亿个边界框)上进行了训练。它可作为通用多模态感知的基础设施,提供定位、GUI 理解以及多模态智能体(Agentic)能力的支持。
阿加犀做了什么?不是简单转换是系统性工程优化
将LocateAnything-3B模型迁移到搭载高通QCS8550的APLUX Rhino Pi X1设备上,LocateAnything以W4A16精度运行,首字响应时间为0.15秒,编码速度达1662 tokens/s,解码速度为110 tokens/s,上下文长度支持2048 tokens,模型文件大小1.83 GB。

达到这样的成就,阿加犀技术团队主要做了三件事:
01算子级深度适配LocateAnything-3B的并行框解码结构对算子兼容性要求极高。阿加犀没有采用QNN的“一键转换”,而是逐算子手工映射和编译,调整了部分算子融合策略与内存访问模式,避免了因算子不兼容导致的精度损失或推理失败。
02模型轻量化与资源精算利用AIMO工具对模型权重进行INT8/INT4混合精度量化,将模型体积压缩至原来的约四分之一,精度损失控制在1%以内,使其能稳定运行在犀牛派X1上。
03定制化异构推理流水线通过AidLite SDK和AidGen推理引擎,设计了一套并行预处理-推理-后处理流水线:视觉编码器跑在NPU、LLM解码器调度至CPU/GPU协同计算,同时避免数据在芯片单元之间来回搬运。
多场景落地LocateAnything-3B端侧能力应用方向
LocateAnything-3B在端侧部署后,视觉定位任务无需依赖云端即可完成。以下是几个典型的应用方向:
场景一:机器人与具身智能在机器人导航与操作中,LocateAnything-3B可实现本地化的物体定位与环境理解。开发者通过自然语言指令即可驱动机器人识别并定位目标物体,无需联网或云端计算。这一特性适用于家庭服务机器人、仓储AGV、巡检机器人等对响应速度和数据隐私有要求的场景。
场景二:企业智能与工业检测LocateAnything-3B的端侧适配使视觉检测能力可直接部署在产线边缘设备上。开发者无需搭建服务器集群或配备专业算法团队,即可快速集成目标定位、缺陷检测等功能到现有系统中,降低工业视觉方案的部署门槛。
场景三:智能终端与GUI自动化LocateAnything-3B支持GUI元素定位,适用于智能终端自动化场景。基于端侧模型,开发者可构建离线运行的智能助手,自动识别屏幕界面元素,实现语音控制操作、自动化测试等功能。
场景四:自动驾驶与移动设备LocateAnything-3B的端侧推理能力可为车辆提供实时目标定位。开发者可利用其低延迟特性构建视觉感知模块,作为轻量化辅助驾驶方案的一部分。
LocateAnything-3B在高通NPU上的成功适配,验证了阿加犀在端侧视觉语言模型部署上的系统性工程能力。从算子映射到精度校准,从模型轻量化到异构推理流水线设计,阿加犀正在将前沿模型的端侧落地门槛持续降低。
目前,LocateAnything-3B预编译模型及推理代码已通过Model Farm开放实测数据,点击【阅读全文】即可获取详细信息。


