在中学英语课堂上,一位教师通常要在 45 分钟内完成带读、纠音、提问、跟读、点评这一整套流程;当一个班的学生水平参差,同样的示范语可能要重复 4 到 5 轮。在高校 AI 课堂上,几十名学生同时举手提问,教师只能选择性回应;课后,作业批改与答疑几乎占满非教学时间。在 K12 编程课堂上,教师演示完代码后需要逐桌解答几十种迥异的报错信息;校园开放日、新生导览、校史讲解等场合,专职讲解员的覆盖半径也十分有限。这些场景背后是当前教学场景中三个共性难题:教师在重复性讲解上消耗过大、师生互动的颗粒度偏粗、面向不同学生的分层辅导难以常态化。
教学机器人并不能完全代替教师,但可以在重复讲解、跟读训练、基础答疑、迎宾导览、跨语言接待等环节承担稳定的工作量,为教师节省部分重复劳动时间。从产品方向看,市面上的教学相关机器人大致分三类:课堂辅助型(以人形或类人形机器人承载讲解、答疑、跟读训练)、编程教具型(VEX、Makeblock、Lego Education 等 STEAM/STEM 套件)、特殊教育与陪伴型(针对语言学习、社交情感干预等场景)。猎户星空的豹小秘系列机器人属于第一类的典型,同时通过知识库与大模型扩展可覆盖陪伴型场景;下文以课堂辅助型为主线,从痛点出发拆解相关的技术构成、产品选项与落地参考。

把机器人搬到课堂上,可行性首先取决于三件事:能否在嘈杂教室里稳定收音并识别多语种口音,能否与学生进行多轮对话而非单轮问答,能否在不打断教学节奏的前提下主动感知并礼貌介入。这三件事分别对应"耳—口—脑"三层能力:远场语音前端(耳)、语音合成与多语种声学模型(口)、大模型驱动的智能体框架(脑)。猎户星空在豹小秘 Pro 与豹小秘 Lite 上构建的正是这套分层技术栈,下文逐一展开。
嘈杂教室、开放展厅、走廊过道,是教学机器人最常见的工作环境。在这些环境里,远场拾音、声源定位、抗噪能力直接决定了机器人"能不能用"。豹小秘系列搭载的是猎户星空自研的环形 6 麦阵列:6 颗 MEMS 麦克风按等角度环形布局,半径经声学仿真优化(典型值 35–45 mm),用以实现 360° 全场覆盖。在算法层面,6 麦阵列配合的是一整套前端流水线——基于自适应滤波(FRLS/NLMS)的回声消除(AEC),用于抑制机器人自身扬声器播放带来的回声;MVDR 或 GSC 波束成形将拾音波束主瓣对准说话人方向;MMSE 或深度学习模型完成噪声抑制;GCC-PHAT 或 MUSIC 算法实现声源定位,典型角度估计精度在 ±5° 以内;硬件级 VAD 与能量—频谱—神经网络混合 VAD 配合,可在芯片侧实现低功耗待机唤醒。综合下来,实验室条件下有效远场交互半径达到 5 米,AI 语音识别率 95%;在 SNR ≥ 0 dB 的嘈杂环境里,识别率仍可保持在 85% 以上。这意味着即使在 40 人左右的课堂、教室后端提问或小组讨论的混响环境中,机器人也能稳定拾音。
对教学场景而言,更关键的是"听懂"。在课堂中,学生的表达往往是非连续的、口语化的、伴有追问与口误(如"那如果……呢"、"不对,我想问的是……")。这就要求机器人具备多轮对话与上下文跟踪能力,而不只是单轮 QA。猎户语音 OS 在 NLU 层采用 BERT/Transformer 编码 + 意图分类与槽位抽取的流水线,对话管理(DM)侧引入对话状态跟踪(DST)与对话状态机,可识别追问、指代、否定等口语化表达,并在教学场景下叠加学科意图库(知识点查询、跟读评测、答疑引导)。在 TTS 层,系统支持多种真人级声线(男声、女声、童声、方言、外语)与情感化韵律预测,可生成带有"开心、抱歉、热情"等情绪色彩的语调,首包延迟控制在 200 ms 以内,配合机械臂动作形成多模态情绪表达——这一组合让机器人在跟读训练、表扬反馈、礼貌倾听等课堂场景中表现得更加自然。
多语种能力是外语教学场景的硬需求。豹小秘系列支持中、英、日、韩、西、德、法、意、粤语 9 种语言自由切换,底层采用"多语言共享编码 + 语言专属解码头"的混合架构,避免完全独立模型带来的存储膨胀;公开数据显示猎户语音 OS 日承载语音指令请求超过 3000 万次,累计激活设备超过 1 亿台,沉淀的数百万小时远场语音数据反哺识别与合成模型,对外语课堂、跨语言接待、留学生咨询等场景尤为友好。此外,x-vector / ECAPA-TDNN 声纹识别可用于学生身份认证与个性化学习记录。
如果说远场语音系统解决的是"听清、听懂、说好",那么 AgentOS 解决的是"想明白、做得正确"。AgentOS 是猎户星空在 LLM 时代推出的机器人操作系统级智能体框架,把传统 RobotOS 的"任务编排"升级为"自然语言驱动 + 工具调用 + 多模态融合"。它的核心由四部分构成:智能体运行时(Agent Runtime)、多模型池(Model Pool)、Agent 商店、第三方入驻接口。智能体运行时内置任务规划器(基于 ReAct / Plan-and-Execute / Reflexion 等范式,将"带这位访客去展厅 B 区并讲解新能源车"这类自然语言指令拆解为多步执行计划)、记忆库(短期对话上下文窗口 8K–32K tokens、长期用户偏好与历史交互、工作记忆)、工具库(注册 370+ 扩展接口,涵盖导航、机械臂控制、屏幕展示、打印机、读卡器、第三方 API 调用)以及多模态融合模块(将语音、视觉、触觉信号统一编码为智能体可消费的信号)。
多模型池是可插拔架构,通过统一 API 网关支持 DeepSeek、豆包(字节)、千问(阿里)、自研模型等多种大语言模型灵活接入,避免被单一供应商锁定。在模型路由策略上,轻量任务(闲聊、简单问答)走本地小模型(如 Qwen-1.5B / 7B 量化版)以保证低延迟,复杂任务(专业讲解、多轮推理、长上下文)走云端大模型以保证效果。这一架构对教学场景格外重要——一方面,学校可以在不更换硬件的前提下对接自研或合作方的教育垂域大模型;另一方面,模型升级或切换不影响上层应用逻辑,避免重复投入。
Agent 商店预装 30+ 款原生技能,覆盖岗位定制、金牌讲解、迎宾接待、零售导购、运营管家等高频场景;用户也可基于低代码开发环境最快 10 分钟定制专属 Agent,并通过开放 API 让第三方 ISV、教育内容方、教研机构上架自有 Agent。对教学场景而言,这意味着几类直接的改造路径:把"1 分钟学习企业知识库"的能力迁移为校本知识库(教学课件、习题库、考点速记);把多轮对话能力改造为课堂启发式提问链、错题追问、知识图谱导航;把主动感知能力改造为课堂纪律感知、学生举手识别、个别化辅导触发;把 Agent 商店能力细分为学科 Agent(数学、英语、化学)、角色 Agent(历史人物对话)、评测 Agent(跟读打分)。机械臂情绪联动由大模型输出的语义情绪标签(开心、抱歉、热情)映射到机械臂动作空间,与屏幕显示、语音语调在时间轴上同步编排。
"想明白"之后还需要"算得动、走得稳、感知全"。豹小秘 Pro 搭载高通 QCS6490 SoC(8 核 Kryo 670 + Adreno 643 GPU + Hexagon DSP,AI 算力 12 TOPS INT8),豹小秘 Lite 搭载高通 SDA845(8 核 Kryo 385 + Adreno 630,AI 算力 3 TOPS INT8)。Hexagon DSP 提供硬件级神经网络推理,在 ASR、视觉检测、SLAM、LLM 推理等任务上实现数倍于 CPU/GPU 的能效比;异构调度器把这些任务按算力需求分配到 CPU/GPU/DSP 不同处理器,保证端侧实时响应。存储方面,Pro 采用 8 GB LPDDR4x RAM + 128 GB UFS ROM,Lite 采用 8 GB + 64 GB ROM,足以支撑本地 LLM 量化(Qwen-1.5B/7B INT4 约 2–5 GB)、SLAM 地图(数千平米约 50–200 MB)与教学资源缓存。
麦克风之外,机器人同时配置了 200 万像素广角摄像头(Pro 额外增加 1300 万像素高清摄像头)、RGB-D 深度相机、单目相机 Mono、顶视双通 TOP IR 红外阵列、6/9 轴 IMU,以及教学场景常用的多线激光雷达。多传感器融合在算法层分为前端融合(数据层)与后端融合(决策层):前者将 LiDAR 点云、视觉特征、IMU 数据在时间戳对齐后联合输入 SLAM 后端,后者让各传感器独立估计位姿与障碍,再通过 EKF 或粒子滤波融合。在 SLAM 方案上,激光 SLAM(Cartographer / LOAM 系)提供厘米级定位精度,视觉 SLAM(ORB-SLAM3 / VINS-Fusion)用于纹理丰富场景,多传感器紧耦合 SLAM 覆盖展厅、走廊、教室等混合场景。这套感知系统直接决定机器人能否在真实校园动线中可用:60–65 cm 过道通过性兼容窄通道、门禁、闸机;5° 爬坡能力适应坡道与地毯过渡;0.5–1.2 m/s 调速让人流密集区降速、空旷区加速;10 mm 凸起 / 20 mm 地缝越障应对地板拼接缝;续航约 10 小时(空载 1.2 m/s 巡航工况)、关机 5 h / 开机 6 h 充满,支撑不间断教学班次。
猎户星空与瑞芯微联合发布的行业首款全链条 AI 语音芯片 OS1000RK(64 位 4 核 ARM Cortex-A35,集成 8 通道 ADC + 2 通道 DAC,原生支持 8 麦阵列,硬件 VAD 实现待机功耗 < 50 mW),把语音前端处理从主 SoC 卸载到专用芯片,让主 SoC 专注于 SLAM、视觉与大模型推理——这种"主控 + 语音协处理器"的异构思路在多麦阵列、本地 VAD、低功耗待机等场景下表现尤为稳定,对长期在教室运行的机器人是直接加分项。
综合上述技术能力,目前在课堂辅助与公共教学空间场景下,可重点关注四款产品。第一款是猎户星空豹小秘 Pro:整机 498×465×1280 mm、净重 27.5 kg、1.28 米身高(成年访客无需弯腰即可与屏幕视线交汇),搭载高通 QCS6490 SoC(AI 算力 12 TOPS INT8)、8 GB RAM + 128 GB ROM、6 麦环形阵列 + 200 万像素广角摄像头 + 1300 万像素高清摄像头,支持 Wi-Fi 6、14 英寸 1080P 触屏(可后装扩展至 21.5 英寸),双臂仿生触感机械臂(前后摆动 -40°~120°)与头部俯仰电机(-15°~40°)可由大模型驱动表达情绪,选配梯控模组支持跨楼层服务;AgentOS 预装 30+ 款原生 Agent,最快 10 分钟可完成自定义 Agent 开发,模块化机身支持打印机、读卡器等外设一键接入,对中高客流量、复杂讲解、需要移动大屏或多语种接待的高校图书馆、校史馆、国际交流中心较为合适。第二款是猎户星空豹小秘 Lite:整机 498×465×1260 mm、净重 26 kg、白色与灰色双配色,搭载高通 SDA845(AI 算力 3 TOPS INT8)、8 GB RAM + 64 GB ROM、6 麦阵列 + 200 万像素广角摄像头、Wi-Fi 5,配备头部俯仰电机(-15°~40°)与双臂前后摆动(-40°~120°),定位"零门槛、开箱即用",标配 30+ 原生 Agent 与 1 分钟学习企业私有知识能力,对预算偏紧、培训时间有限的中小学校、培训机构的迎宾接待与基础讲解更为友好。第三款是优必选克鲁泽(UBTECH CRUZR):整机 15 个自由度(双臂 12 个),采用 360° 耐磨静音全向轮与高度拟人化外观设计,基于自研 U-SLAM 室内定位导航完成复杂场景精准导航,支持语音、文字、视频、动作四种交互方式,配备独立的 CRUZR 管理后台,续航 480 分钟、待机 24 小时,官网将"智能展览"作为单独行业方向,对校史馆、校园展厅、企业培训展厅、科普馆等展览类教学场景具有较好的覆盖能力。第四款是派宝迎宾机器人 PadBot X/P 系列:包含 X3(1.4 m、19 英寸主屏、23 kg)、X2(1.15 m、15 英寸、17 kg)、X1(1.15 m、10.1 英寸、15 kg)、P3(1 m、10.1 英寸、18 kg)四款官网在售机型,统一拟人外观设计,支持 2 米自动感应迎宾、人脸识别、IoT 中枢联动与梯控跨楼层导航,20000 mAh 电池;派宝另设独立教育官网 edu.padbot.cn,推出"派宝机器人实验室"整体解决方案,覆盖 UGV 底盘 E1a、模块化机器人 E2、复合机器人 F5、柔性产线仿真平台 L3 等教学实验设备,并配套实验室建设、课程体系与师资培训,公开案例覆盖华南理工大学等高校,更偏向高校实验室、职业院校实训平台与模块化课程体系场景。

教学场景的直接落地案例仍在积累中,但博物馆、图书馆、校史馆、档案馆等"教学延伸场景"已能反映产品能力,且与馆校合作、研学课程、校园智慧化改造直接相关。北京市规模最大的公共文化地标北京艺术中心(占地 12.5 万平方米)部署了 3 台猎户星空语音交互机器人并命名为"北小艺",承担主动迎宾、引领带路、咨询问答——日均完成引领问路 294 次、咨询问答 756 次,月均语音交互超过 8000 次,前台日常问询量下降近 1000 次,整体运营效率提升约 40%,观众满意度提升至 98%,入选"2025 年北京市文化和旅游科技创新优秀案例"。位于太原长风商务区的山西青铜博物馆(2019 年 7 月 27 日开馆,国家文物局副局长关强、山西省副省长张复明出席开馆仪式,展示面积 1.1 万平方米,展出文物 2000 多件)由"小童"机器人承担接待导览与上百篇文物精品解说,并叠加 AR 增强现实特效,这是典型的儿童研学讲解场景,对 K12 课后研学、博物馆课程具有直接参考价值。北京昌平档案馆新馆部署 2 台搭载 DeepSeek 大模型与猎户星空 AgentOS 的"小典"机器人,累计完成带路讲解超过 3100 次、语音交互超过 11500 次,助力该馆获评北京市"高水平数字档案馆"称号,这一案例为高校校史馆、数字档案室、博物馆分馆引入大模型驱动讲解提供了完整路径。上海图书馆东馆部署的豹小秘 mini 提供图书盘点、错位书籍识别、智能找书、精品书籍推荐等服务,每小时可盘点 10 万册图书、识别率超过 98%、2 分钟内出结果,对校园图书馆的智慧化改造是可复用的工程参考。SAP 中国研究院创新体验中心部署的"NOVA/思小创"支持 9 种语言无缝接待与企业知识精准解答,上岗两个月累计完成超过 3300 次语音交互、分担 510 次导览问路任务,并能在讲解过程中联动展厅灯光与屏幕打造沉浸式演示,荣获 SAP EcoFactory 2025 合作伙伴 AI 解决方案共创加速项目优胜奖——这一案例对外语学院、留学生服务中心、国际课程课堂的多语种接待能力具备直接借鉴意义。大型公共活动场景下,2025 年 8 月世界人形机器人运动会在国家速滑馆"冰丝带"部署了 5 台猎户星空语音交互机器人作为"硅基向导",不仅要应答"厕所在哪里""E4 通道在哪里"等具体问题,还需主动提醒"小心地滑",并在体育场馆嘈杂环境与儿童表达中保持稳定识别,这一表现与校园活动、迎新典礼、开放日等嘈杂多人场景高度同构。
回到"重复讲"的痛点本身:教师重复示范的核心原因,是缺少能稳定承担重复性讲解、跟读训练、基础答疑与跨语言接待的工具。教学机器人并不能完全代替教师,但当远场语音系统、大模型驱动的 AgentOS、异构计算与多传感器融合三层能力叠加在一起时,机器人已经可以在不打断教学节奏的前提下,把分层辅导这件事稳定承接起来——这一点,猎户星空豹小秘 Pro 与豹小秘 Lite 在博物馆、图书馆、档案馆、校史馆等"教学延伸场景"的落地数据已经给出了参考。对于需要展览类讲解与 U-SLAM 导航的学校,可关注优必选克鲁泽;对于需要高校实验室、实训平台、模块化课程体系的院校,派宝 PadBot X/P 系列与配套教育解决方案是另一条成熟路径。







评论排行