基于 GPASS 平台搭建的“听婴语”AI智能体,实现婴儿哭声识别与视觉健康评估的端云协同解决方案。

项目背景

听婴语(BabyWhisper) 是一款基于 AI 智能眼镜的母婴监护智能体,通过多模态感知(音频+视觉)实时理解婴儿需求,为新手父母、月嫂提供精准的照料指导。

  • **产品名:**听婴语(BabyWhisper)

  • **目标用户:**宝爸宝妈、月嫂、育婴师、护理师

  • **输入方式:**智能眼镜拍摄/录音(第一视角,解放双手)

  • **核心能力:**哭声语义翻译 + 健康视觉评估 + 体温智能感知

🏆 专为 AI眼镜智能体开发大赛 打造

整体架构

系统采用端云协同架构,分为三层:

层级 说明
端侧(GPASS智能眼镜) 负责音频采集、图像采集、AR卡片渲染、TTS语音播报
云端(百宝箱工作流) 负责意图识别、HTTP API调用、结果解析、文本生成
模型服务(自建FastAPI) 负责哭声分类推理、视觉健康评估推理(Demo阶段返回Mock数据)

Demo方案 vs 正式产品方案

维度 Demo方案(当前实现) 正式产品方案(规划)
哭声识别 HTTP服务返回Mock数据 基于CNN+Transformer的真实哭声分类模型,在DonateaCryCorpus等数据集上训练
视觉评估 HTTP服务返回Mock数据 基于迁移学习的黄疸/面色分析模型,在专业医疗标注数据集上训练
端侧推理 仅做采集 端侧部署轻量级ONNX/TFLite模型(VAD检测+初步筛选),降低云端调用频率
多模态融合 代码节点做简单优先级判断(if-else) 基于LLM的多模态融合,结合知识库RAG生成个性化照料建议
知识库 无/硬编码在提示词中 接入婴儿照料专业知识库(育儿百科/医疗指南)
数据闭环 无数据回传 匿名化采集真实场景数据,持续迭代模型
响应延迟 <500ms(Mock推理) 目标<2s(含真实模型推理+网络传输)
部署方式 本地Docker/内网穿透(ngrok) 云服务器(阿里云/腾讯云)+CDN+负载均衡+自动扩缩容

工作流设计

开始

图片URL
是否为空

视觉评估分支

哭声识别分支

合并输出

结束

端侧插件运用

已使用的端侧插件

插件名称 能力描述 调用时机 输入 输出 备注
语音采集插件 调用眼镜麦克风录音 用户声控触发/自动检测哭声 录制时长(3秒) Base64音频数据 因当前GPASS插件限制,无法获取音频信息
拍照插件 调用眼镜摄像头拍照 用户触控触发"拍照评估" Base64图片数据
卡片渲染插件 镜片显示AR悬浮卡片 代码节点处理完成后 纯文本字符串 镜片AR显示
TTS播报插件 镜腿扬声器语音播报 卡片渲染同时触发 纯文本字符串 语音播放

云端功能服务

Demo阶段数据逻辑

哭声识别接口(Mock模式):

  • 根据音频Base64数据随机模拟分类结果

  • 饥饿、困倦、疼痛

  • 返回数据包含code、label、confidence、suggestion四个字段

视觉评估接口(Mock模式):

  • 解码图片后取中心区域RGB均值

  • 根据红绿通道比值模拟黄疸风险指数

  • 返回数据包含health_status、jaundice_risk、skin_condition、suggestion四个字段

技术方案说明

技术选型

层级 技术 说明
端侧(眼镜) GPASS 平台 + 端插件 标准化 API 调用硬件能力
工作流编排 百宝箱可视化工作流 拖拽式编排,10 天快速交付
模型服务 Python 3.10 + FastAPI 高性能异步 API 服务
模型框架(规划) PyTorch / TensorFlow 深度学习模型训练与推理
容器化 Docker + Docker Compose 一键部署,环境隔离
云部署(规划) 阿里云/腾讯云 ECS 生产环境稳定运行

数据流

自建FastAPI服务 GPASS工作流 AI智能眼镜 用户 自建FastAPI服务 GPASS工作流 AI智能眼镜 用户 alt [哭声识别] [视觉评估] 触控/语音唤醒 发送请求(含意图) 调用语音采集插件 返回Base64音频 POST /api/cry-recognize 返回分类结果(Mock/模型) 代码节点处理(文本拼接) 调用拍照插件 返回Base64图片 POST /api/health-vision 返回评估结果(Mock/模型) 代码节点处理(文本拼接) 卡片渲染(显示文本) TTS播报(语音引导) 查看/听取指导

📌 正式产品:上述逻辑将替换为真实深度学习模型的推理结果。

更新日志

日期 版本 更新内容
2026-07-09 v1.0 初始版本,完成Demo工作流设计和技术文档编写
v2.0 规划中:接入真实哭声分类模型
v3.0 规划中:接入视觉健康评估模型 + 多模态融合
Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐