JiShi 智能语音教育终端软硬件系统
产品功能描述
JiShi 是一套基于 ESP32-S3 自主开发的 AI 智能语音教育交互终端平台,包含真实硬件、嵌入式固件、空间声源定位、动作控制、AI 语音交互、教育行为逻辑及浏览器管理诊断系统。
核心技术与实现
硬件采用双 IM69D130 数字麦克风与 TLV320ADC5140 音频前端,完成双通道音频采集、语音活动检测(VAD)、TDOA/DOA 声源方向估计和离线唤醒,实现设备对说话方向的感知。
固件建立了完整的交互状态机,已跑通唤醒、转向说话人、语音采集、STT、LLM、TTS 和待机恢复的交互闭环。舵机采用 S 曲线平滑运动,支持动作中断续接、关注保持及拟人化行为表现。
软件层包含年龄分层的教育引导策略、风险约束、本地命令、离线降级和多模型云接口适配。设备端 MCP 教育工具与系统工具已通过实机验证,支持结构化查询教育资料、设备状态及控制终端音量等功能。
工程化与调试
自主设计了 AP 配网、浏览器管理控制台、WebSocket 实时状态监测及硬件诊断接口。固件采用模块化结构、分阶段启动、设备就绪状态检查和异常降级机制,便于硬件联调、故障定位及后续功能扩展。
项目成果
已完成真实板级硬件与固件的核心功能联调,语音交互、双麦声源定位、动作控制及设备诊断具备实际运行验证。平台形成了可复用的软硬件架构,可进一步扩展为 AI 教育终端、语音陪伴设备和智能交互产品。视觉扩展功能仍处于后续硬件验证阶段。
评论







