资讯详情

八界-科沃斯首款开源具身智能机器人:SDK 环境搭建、Demo 实测与开发者体验全记录

📅 2026/10/9 2:50:03 | 华诺云谱 👁 阅读
八界-科沃斯首款开源具身智能机器人:SDK 环境搭建、Demo 实测与开发者体验全记录
一、 什么是具身智能具身智能Embodied AI是人工智能的前沿方向也是大模型时代的下一个重要突破口。它让 AI 从虚拟世界走进物理世界——不再只是聊天对话、生成文本而是能够看、听、想、动在真实物理环境中自主感知、理解、决策和行动。简单来说传统 AI 是大脑只能思考和对话而具身智能是大脑 身体不仅能思考还能动手操作。1.1 具身智能 vs 传统 AI与传统 AI如 ChatGPT只能通过文字或语音进行对话不同具身智能让 AI 拥有了物理身体能够在真实环境中采取行动。传统 AI 的感知局限于文本和图像输入而具身智能配备了相机、雷达、触觉等多模态传感器不仅能理解语义还能感知空间结构和物理约束。在执行层面具身智能可以通过机械臂抓取、底盘移动、物体放置等方式直接作用于物理世界典型场景涵盖家庭服务、仓储物流、医疗辅助等。从技术栈来看一个完整的具身智能系统包含感知层计算机视觉、开放词检测、SLAM 建图、认知层视觉语言模型、大语言模型、场景理解、决策层任务规划、路径规划、运动规划和执行层机械臂控制、底盘导航、精准抓取与放置四个模块八界机器人正是集成了以上全部技术栈的完整具身智能平台。1.2 为什么具身智能重要具身智能被认为是 AI 的最后一公里。大语言模型解决了理解问题但物理世界中的大量工作仍然需要机器人来完成。具身智能将 AI 的认知能力转化为物理行动力有望在以下场景带来变革家庭服务整理房间、递送物品、照顾老人仓储物流分拣包裹、搬运货物、库存管理医疗辅助辅助康复、药品递送、手术室协作教育科研AI 教学平台、机器人算法验证二、八界-科沃斯首款开源机器人八界是科沃斯推出的首款面向开发者的开源具身智能机器人八界这个名字取自《西游记》中的猪八戒寓意聪明、勤劳、接地气。硬件方面八界配备了六自由度机械臂和二指灵巧夹爪最大臂展约 50cm、负载约 500g支持精准抓取和灵巧操作配合头部 RGB 双目相机和手臂 RGB 相机实现远近协同的双色视觉感知底盘采用差速驱动轮式结构搭载 2D 激光雷达用于 SLAM 建图和避障。在开发体验上八界提供了三种开发深度以适配不同开发者初学者可以直接运行官方 Demo 和 10 节入门课程快速上手进阶开发者可以基于 SDK 的 Python/C 接口进行二次开发高级用户可以深入 ROS 2 和板端计算进行底层定制。八界还集成了开源的 OpenClaw 智能体框架通过 OpenClaw Gateway 方便对接外部大模型服务让机器人具备更强的场景理解和任务规划能力。八界最大的差异化优势在于开源。科沃斯为开发者提供了完整的开发工具链SDKPython 和 C 双语言接口通过 WebSocket 远程控制可视化平台Web 端控制台包含建图、技能管理、文件管理、远程控制等功能官方 Demo玩具递送、玩具收纳、桌面整理、鞋履整理 4 个完整场景示例入门教程10 节 Jupyter Notebook 互动课程从零到一学会开发Skill Hub技能中心支持安装和自定义机器人技能OpenClaw GatewayAI 网关方便对接外部大模型服务这意味着开发者不需要从零造轮子可以基于官方 Demo 和 SDK 快速搭建自己的应用场景。三、科沃斯八界设备开箱开箱视频展示了八界机器人的外观、配件和首次开机流程。收到八界机器人后第一时间进行了开箱体验。包装箱体积不小整体重量适中包装内部有泡沫固定保护。打开包装后可以看到八界机器人的主体是一个圆柱形机身顶部安装有可升降的机械臂模块正面配备了头部双目相机底部是差速驱动轮式底盘。配件方面包装内附带了充电底座、电源适配器和一份快速入门指南。将机器人放在地面并长按电源键开机后底部屏幕会亮起并显示当前连接的 WiFi 信息和可视化平台地址这意味着可以立即通过浏览器访问控制台进行后续操作。整个开箱到开机的过程非常简洁大约 5 分钟即可完成。八界开箱四、前提准备在运行 Demo 之前需要完成以下准备工作1、进入八界可视化控制平台打开浏览器访问八界可视化控制平台。该平台是机器人的核心管理工具所有配置和调试都在这里完成2、查看可视化平台地址在八界设备屏幕上可以看到可视化平台的访问地址格式通常为 http://机器人IP:17890。确保 PC 和机器人连接在同一个 WiFi 网络下3、进入控制平台在浏览器中输入屏幕上显示的地址即可进入可视化控制平台。首次进入可能需要等待几秒钟加载4、开发控制台功能模块开发控制台包含多类功能模块覆盖了机器人开发的完整链路Agent 分区提供 OpenClaw Gateway 网关模块用于对接外部 AI 服务工作台分区语义地图管理建图/重定位、Skill Hub 技能中心查看和安装机器人技能、File Browser 文件浏览器管理机器人内部文件机器人与终端分区机器人远程控制手动操控移动和机械臂、CLI 命令行工具直接在浏览器中执行命令设备与业务配置分区设备参数配置、VLM API Key 设置视觉语言模型的密钥配置桌面整理等高级 Demo 需要通过控制台可以一站式完成机器人技能开发、设备调试、文件管理、地图构建与远程控制等具身智能开发工作。5、网络与硬件检查在开始开发之前请确认以下条件检查项要求说明网络PC 和机器人连接同一 WiFi/局域网确保能互相 ping 通电量机器人电量 30%低电量可能限制机械臂功率建图已完成 SLAM 语义建图在可视化平台语义地图模块操作语义区域在可视化平台标记了目标区域如桌子Demo 导航依赖语义区域名称VLM API Key已配置桌面整理 Demo 需要在设备配置中设置五、SDK 环境搭建1、系统要求项目要求操作系统Ubuntu 20.04 / 22.04 / 24.04 或 WSL2Python3.10SDK 强依赖此版本3.11/3.12 不兼容架构x86_64 或 aarch64磁盘空间≥ 2GBSDK 依赖2、安装 Python 3.10Ubuntu 22.04 默认 Python 版本为 3.12需手动安装 3.10# 添加 deadsnakes PPA 源sudoadd-apt-repository ppa:deadsnakes/ppasudoaptupdate# 安装 Python 3.10 及开发工具sudoaptinstallpython3.10 python3.10-venv python3.10-dev注意Windows 用户推荐使用 WSL2Windows Subsystem for Linux在 PowerShell 中执行 wsl --install 即可安装。3、创建虚拟环境并安装 SDK# 进入 SDK 目录cdbajie_sdk/python# 创建 Python 3.10 虚拟环境python3.10-mvenv .venv# 激活虚拟环境source.venv/bin/activate# 安装 SDKx86_64 架构pipinstall./bajie_sdk-3.0.0-cp310-cp310-linux_x86_64.whl# 验证安装python-cfrom bajie_sdk import BajieRobot; print(SDK 安装成功)提示下载慢时可添加阿里云镜像加速pip install ./bajie_sdk-3.0.0-cp310-cp310-linux_x86_64.whl -i https://mirrors.aliyun.com/pypi/simple/4、连接测试编写一个简单的测试脚本验证 SDK 能否正常连接机器人from bajie_sdkimportBajieRobot# 替换为你的机器人 IProbotBajieRobot(ws_urlws://192.168.2.90:9900/)ifrobot.Connect(timeout_sec15.0): print(连接成功)inforobot.eco_robotInfo()print(f电量: {info.battery.value}%)print(f工作状态: {info.workState.cmd})robot.Disconnect()else: print(连接失败请检查网络和 IP 地址)运行后如果看到连接成功和电量信息说明环境搭建完毕。六、玩具递送 Demo 实测玩具递送 Demo 是官方最完整的 Demo展示了机器人找→抓→导航→放的完整能力闭环。整个过程中机器人完全自主运行无需人工干预。1、场景说明任务目标在地面找到玩具 → 抓取 → 导航到桌子 → 放到桌面上前提条件已完成语义建图标记了桌子区域玩具在建图时已存在于场景中物品要求小型玩偶不易碎、不贵重放在机器人正前方 30-50cm 范围内2、执行流程Demo 的执行流程分为 11 个步骤涵盖了感知、决策、执行全链路步骤0: 重定位确定机器人在地图中的位置 步骤1: 原地寻找玩具 → eco_findObject语义地图搜索 步骤2: 手部观测 → eco_lookto手臂相机对准目标 步骤3: 手部拍照 → eco_captureImagesARM 相机采集图像 步骤4: OVD 识别 → eco_detect_objects开放词检测 步骤5: 精准抓取 → eco_pick6D 姿态抓取 步骤6: 语义导航 → eco_navigateToSemanticArea导航到桌子 步骤7: 升高机身 → eco_setRobotHeight调整到放置高度0.44m 步骤8: 头部拍照 → eco_captureImagesHEAD 相机采集 步骤9: PutWhere 推荐 → eco_put_where_summaryAI 规划放置位置 步骤10: 语义放置 → eco_place_with_view视觉引导放置其中步骤 1-5 为抓取阶段在原地完成步骤 6-10 为放置阶段导航到桌子后完成。如果抓取或放置失败Demo 内置了最多 3 次重试机制。3、运行命令cdbajie_sdk/python/delivery_demosource../.venv/bin/activate python delivery_demo.py --ws-url ws://192.168.2.90:9900/常用参数参数默认值说明–ws-url无必填机器人 WebSocket 地址–table-area-name桌子语义导航目标区域名–place-direction上放置方向–pick-index0OVD 结果中抓取目标的索引4、实测输出以下是实际运行的完整输出日志可以看到OVD 成功识别了玩偶并返回了边界框坐标机器人自主完成了抓取、导航和放置的完整流程。5、实测视频以下是玩具递送 Demo 的完整实测视频。从视频中可以看到机器人启动后先执行重定位确认自身在地图中的位置随后通过语义地图搜索到玩偶的位置。机械臂带动手臂相机转向目标方向完成观测和拍照OVD 在手臂相机图像中成功检测到玩偶并返回边界框坐标。接着机械臂执行精准抓取夹爪闭合后将玩偶稳稳抓起。抓取完成后机器人底盘启动自主导航前往桌子区域到达后升高机身至 0.44 米头部相机拍照并通过 PutWhere 服务规划放置位置最终机械臂将玩偶平稳放置在桌面上。整个流程约 2-3 分钟全程无需人工干预机器人语音播报任务完成后回到空闲状态。八界玩具递送从实测表现来看八界机器人在以下方面表现突出感知准确OVD 一次即识别到玩偶边界框定位精准抓取稳定机械臂抓取动作流畅夹爪力度适中未出现物体掉落导航可靠语义导航一次成功路径规划合理避障及时放置智能PutWhere 推荐的放置位置合理视觉引导放置精度高整体体验令人印象深刻从代码调用到物理执行的全链路打通展示了具身智能机器人从理解指令到完成任务的完整能力。七、玩具收纳与鞋履整理玩具递送 Demo 展示了找→抓→导航→放的基础闭环而玩具收纳和鞋履整理则在此基础上进一步挑战了容器感知和物体配对等更复杂的能力。两个 Demo 的共同点是都需要机器人理解把东西放到指定容器里的概念但各自的技术侧重点不同。玩具收纳的核心在于容器过滤与语义放置。机器人首先需要搜索收纳筐的位置然后在搜索玩具时使用收纳筐的位姿作为 filter_boxes 参数过滤掉已经在筐内的玩具避免重复抓取。抓取完成后机器人通过头部相机观测收纳筐调用 eco_put_where_summary 获取放置规划最后通过 eco_place_in 执行语义放置。整个流程支持多轮循环直到场景中不再有可抓取的玩具为止。# workflow.py — 玩具收纳核心流程defrun_one_round(robot:BajieRobot,cfg:ToyStorageConfig)-bool:print(步骤1: 搜索收纳筐)basket_posesearch_pose(robot,item收纳筐,area_namecfg.area_name,search_pose_indexcfg.search_pose_index,)print(步骤2: 搜索玩具过滤筐内)try:toy_posesearch_pose(robot,item玩具,area_namecfg.area_name,filter_boxes[to_filter_box(basket_pose)],search_pose_indexcfg.search_pose_index,)exceptToyStorageErrorasexc:ifis_no_object_error(str(exc)):print(未搜索到玩具执行结束姿态 eco_finishRobotPose)_finish_pose(robot)returnFalseraise_grab_with_retries(robot,cfg,toy_pose)_place_with_retries(robot,cfg,basket_pose)returnTrue八界玩具收纳鞋履整理的核心在于跨视角匹配与精准放置。与玩具收纳的单物体抓取不同鞋履整理需要机器人理解一双鞋的概念——从散落的鞋子中识别出哪两只是一对然后抓取并整齐地摆放到指定区域还要保证放置方向一致。配对逻辑采用标签优先 pairwise 兜底策略先按 OVD 返回的 name 字段分组同组恰好两只则直接配对剩余未配对的鞋子调用 eco_pairwise 服务通过视觉特征相似度进行跨视角匹配。# pairing.py — 鞋子配对核心逻辑defpair_shoes(robot:BajieRobot,image:RGBDViewWithPose,shoe_items:Sequence[ObjectDetection])-Dict[str,int]:标签优先配对 → pairwise 兜底uuid→pair_id含未配对鞋各自独立 id.groups:Dict[str,List[ObjectDetection]]defaultdict(list)leftovers:List[ObjectDetection][]foritinshoe_items:label(it.nameor).strip()iflabel:groups[label].append(it)else:leftovers.append(it)pairs:List[List[str]][]foritemsingroups.values():iflen(items)2:pairs.append([items[0].uuid,items[1].uuid])else:leftovers.extend(items)ifleftovers:pair_map:Dict[str,List[str]]defaultdict(list)try:forpair_id,item_idinrobot.eco_pairwise([(image.rgb_image.img,list(leftovers))]):pair_map[pair_id].append(item_id)forgroupinpair_map.values():iflen(group)2:pairs.append(group)exceptException:passnext_id1mapping:Dict[str,int]{}forpairinpairs:foruuidinpair:mapping[uuid]next_id next_id1foritinshoe_items:ifit.uuidnotinmapping:mapping[it.uuid]next_id next_id1returnmapping配对完成后get_shoe_move_steps() 函数根据配对结果和收纳区域信息生成搬运步骤每一步包含起始位置、目标位置和放置朝向。放置朝向通过 front_edge 计算确保所有鞋子朝同一方向整齐摆放。执行阶段机械臂先对准目标鞋子手臂相机拍照后调用 eco_match_obj_views 进行头部图像与手臂图像的跨视图匹配确定精确抓取位置然后执行 eco_AccurateGrab 抓取最后通过 eco_place_3D 按指定朝向放置。八界鞋子整理实测中鞋履整理 Demo 成功整理了 2 只鞋子共完成 2 次搬运抓取环节有 1 次跨视图匹配失败后重试成功整体耗时约 5 分钟。玩具收纳 Demo 成功完成了搜索收纳筐、搜索玩具、抓取等步骤但在语义放置环节因 PutWhere 服务返回的 carrier_bbox 数据不完整而失败属于服务端稳定性问题。两个 Demo 的技术亮点在于玩具收纳展示了容器过滤和多轮循环的能力鞋履整理展示了跨视角匹配和 6D 精准放置的能力都体现了八界 SDK 在复杂场景下的开发潜力。八、语义地图能力与 OpenClaw 智能体八界机器人的聪明离不开两大核心能力支撑语义地图和 OpenClaw 智能体。语义地图是八界理解物理世界的基础。与传统机器人只能看到一堆点云不同八界通过 2D 激光雷达 SLAM 建图后可以在可视化平台上为地图中的区域标注语义标签比如桌子“沙发”“厨房”“鞋子整理区等。这些语义区域不仅包含位置坐标content还包含朝向信息direction让机器人真正理解桌子在哪里、桌子朝哪个方向”。基于语义地图八界实现了语义导航eco_navigateToSemanticArea——开发者只需告诉机器人去桌子它就能自动规划路径并导航到目标区域无需手动指定坐标。语义地图还支持动态管理可以通过 eco_manageSemanticMap 接口增删改查语义区域鞋履整理 Demo 就利用了这个能力在未指定区域时自动创建临时整理区域。实测中只要语义地图质量可靠语义导航的成功率接近 100%。OpenClaw 智能体是八界的AI 大脑。OpenClaw 是一个开源的具身智能体框架八界通过 OpenClaw GatewayAI 网关将其集成到机器人系统中。OpenClaw Gateway 的核心作用是方便对接外部大模型服务包括 VLM视觉语言模型、LLM大语言模型等。在桌面整理 Demo 中OpenClaw 承担了关键角色机器人拍照后通过 eco_vlm_perception 调用 VLM 识别桌面上的物体再通过 eco_vlm_desk_sort_plan 调用 VLM 规划整理步骤最后通过 eco_vlm_judge 调用 VLM 评判整理效果。整个感知→规划→执行→评判的闭环都依赖 OpenClaw Gateway 对接的 VLM 服务。开发者可以在可视化平台的设备配置中设置 VLM API Key将不同的模型服务接入 OpenClaw Gateway灵活选择 Qwen、GPT 等模型作为机器人的大脑。语义地图让八界知道自己在哪、要去哪OpenClaw 让八界知道该做什么、怎么做。两者结合构成了八界从感知到决策到执行的完整智能链路。九、FAQ 常见问题以下问题均来自实际开发和运行过程中的真实踩坑经历。Q1pip install SDK 时报错 No matching distribution found原因Python 版本不是 3.10。SDK 的 wheel 包文件名中包含 cp310表示仅支持 Python 3.10。使用 3.11 或 3.12 会找不到匹配版本。解决安装 Python 3.10 并使用虚拟环境python3.10-mvenv .venvsource.venv/bin/activateQ2pip install 下载非常慢甚至超时原因SDK 依赖 opencv-python约 73MB从默认 PyPI 源下载速度可能很慢。解决使用阿里云镜像加速pipinstall./bajie_sdk-3.0.0-cp310-cp310-linux_x86_64.whl-ihttps://mirrors.aliyun.com/pypi/simple/注意清华镜像源tuna在某些网络环境下可能返回 403 Forbidden建议优先使用阿里云镜像。Q3在 Windows PowerShell 中运行 Python 脚本报 ModuleNotFoundError: No module named ‘bajie_sdk’原因SDK 安装在 WSL 的虚拟环境中Windows 的 Python 环境没有安装 SDK。直接在 PowerShell 中运行 python xxx.py 会使用 Windows 的 Python找不到 SDK。解决通过 WSL 命令执行wsl-dUbuntu-24.04 --bash-csource /home/weishuo/bajie_sdk/python/.venv/bin/activate python your_script.pyQ4运行 Demo 时报 code8197, 任务已在运行原因上一个 Demo 异常退出后机器人端的任务没有被正确清理仍处于运行中状态。新任务无法启动。解决调用取消所有任务接口robot.eco_cancelAllMissions()或者直接重启机器人。Q5OVD 检测不到目标物体报 OVD did not find toy bbox原因OVD 的识别标签与实际物体不一致。例如语义地图中搜索到的是玩具但 OVD 在手臂相机图像中识别出的名称是玩偶。这是最常见的失败原因之一。解决尝试不同的检测标签组合labels[玩偶,玩具,毛绒玩具,公仔]也可以先不指定 labels让 OVD 返回所有检测结果观察实际返回的名称。Q6机械臂报 code57346, 找不到可达自适应抓取点物体放的太靠里面原因物体超出了机械臂的可达范围。八界机械臂最大臂展约 50cm物体放得太远或太低都会导致够不着。解决将目标物体放在机器人正前方 30-50cm 范围内的地面上避免放在角落或过远位置。Q7语义导航报 code9984, 语义查询返回结果无效原因语义地图中没有标记指定的区域名称。例如代码中指定 --area-name 书桌但地图中只标记了桌子。解决在可视化平台的语义地图模块确认已标记的区域名称确保代码中的区域名称与地图中完全一致包括空格、数字等注意如果使用 Qwen 系列模型可能会在区域名称中插入空格如房间 0的桌子 1需要手动在可视化平台修改为不含空格的名称Q8语义导航报 code131072, 区域导航点生成失败请排查正向边是否对、地图是否干净原因语义地图质量不佳。可能是建图时环境中有移动物体干扰或者地图中存在大量噪声点。解决在可视化平台重新构建语义地图建图时确保环境中没有移动物体保持地图整洁。十、开发者体验总结从开箱到 Demo 跑通八界给我最大的感受是完成度高。作为科沃斯首款开源具身智能机器人八界不是只给了一个 SDK 就完事而是提供了一整套开发工具链可视化平台让建图和调试全部在 Web 端完成10 节 Jupyter 课程让零基础开发者也能快速上手4 个官方 Demo 覆盖了递送、收纳、整理等典型场景代码分层清晰非常适合学习和二次开发。实测中最让我印象深刻的是语义导航的稳定性和鞋履整理的精准度。语义导航只要地图正确成功率接近 100%几乎不需要反复调试。鞋履整理 Demo 的跨视图匹配和 6D 放置令人惊艳——机器人能从散落的鞋子中配对出一双抓取后整齐摆放且朝向一致这背后是头部相机与手臂相机的精确协同。OpenClaw Gateway 的集成也很方便开发者可以灵活接入不同的 VLM 模型让机器人具备场景理解和任务规划能力。当然也有可以改进的地方。运行时长偏长是最直观的感受鞋履整理 2 只鞋子耗时约 5 分钟跨视图匹配的重试等待环节效率还有提升空间。抓取成功率受物体形态和位置影响较大对语义地图质量的依赖也比较高。这些也是当前具身智能行业共同面临的挑战相信随着算法迭代和生态完善会逐步优化。总的来说八界是一个诚意十足的开源具身智能平台。从 SDK 设计到可视化平台从官方 Demo 到入门教程每个环节都能感受到对开发者的用心。如果你是具身智能方向的开发者、研究者或教育工作者八界值得你投入——它会让你真切地感受到AI 走进物理世界的第一步已经开始了。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑