听婴语 · GPASS工作流技术文档
·
听婴语 · GPASS工作流技术文档
基于 GPASS 平台搭建的“听婴语”AI智能体,实现婴儿哭声识别与视觉健康评估的端云协同解决方案。
项目背景
听婴语(BabyWhisper) 是一款基于 AI 智能眼镜的母婴监护智能体,通过多模态感知(音频+视觉)实时理解婴儿需求,为新手父母、月嫂提供精准的照料指导。
-
**产品名:**听婴语(BabyWhisper)
-
**目标用户:**宝爸宝妈、月嫂、育婴师、护理师
-
**输入方式:**智能眼镜拍摄/录音(第一视角,解放双手)
-
**核心能力:**哭声语义翻译 + 健康视觉评估 + 体温智能感知
🏆 专为 AI眼镜智能体开发大赛 打造
整体架构
系统采用端云协同架构,分为三层:
| 层级 | 说明 |
|---|---|
| 端侧(GPASS智能眼镜) | 负责音频采集、图像采集、AR卡片渲染、TTS语音播报 |
| 云端(百宝箱工作流) | 负责意图识别、HTTP API调用、结果解析、文本生成 |
| 模型服务(自建FastAPI) | 负责哭声分类推理、视觉健康评估推理(Demo阶段返回Mock数据) |
Demo方案 vs 正式产品方案
| 维度 | Demo方案(当前实现) | 正式产品方案(规划) |
|---|---|---|
| 哭声识别 | HTTP服务返回Mock数据 | 基于CNN+Transformer的真实哭声分类模型,在DonateaCryCorpus等数据集上训练 |
| 视觉评估 | HTTP服务返回Mock数据 | 基于迁移学习的黄疸/面色分析模型,在专业医疗标注数据集上训练 |
| 端侧推理 | 仅做采集 | 端侧部署轻量级ONNX/TFLite模型(VAD检测+初步筛选),降低云端调用频率 |
| 多模态融合 | 代码节点做简单优先级判断(if-else) | 基于LLM的多模态融合,结合知识库RAG生成个性化照料建议 |
| 知识库 | 无/硬编码在提示词中 | 接入婴儿照料专业知识库(育儿百科/医疗指南) |
| 数据闭环 | 无数据回传 | 匿名化采集真实场景数据,持续迭代模型 |
| 响应延迟 | <500ms(Mock推理) | 目标<2s(含真实模型推理+网络传输) |
| 部署方式 | 本地Docker/内网穿透(ngrok) | 云服务器(阿里云/腾讯云)+CDN+负载均衡+自动扩缩容 |
工作流设计
端侧插件运用
已使用的端侧插件
| 插件名称 | 能力描述 | 调用时机 | 输入 | 输出 | 备注 |
|---|---|---|---|---|---|
| 语音采集插件 | 调用眼镜麦克风录音 | 用户声控触发/自动检测哭声 | 录制时长(3秒) | Base64音频数据 | 因当前GPASS插件限制,无法获取音频信息 |
| 拍照插件 | 调用眼镜摄像头拍照 | 用户触控触发"拍照评估" | 无 | Base64图片数据 | |
| 卡片渲染插件 | 镜片显示AR悬浮卡片 | 代码节点处理完成后 | 纯文本字符串 | 镜片AR显示 | |
| TTS播报插件 | 镜腿扬声器语音播报 | 卡片渲染同时触发 | 纯文本字符串 | 语音播放 |
云端功能服务
Demo阶段数据逻辑
哭声识别接口(Mock模式):
-
根据音频Base64数据随机模拟分类结果
-
饥饿、困倦、疼痛
-
返回数据包含code、label、confidence、suggestion四个字段
视觉评估接口(Mock模式):
-
解码图片后取中心区域RGB均值
-
根据红绿通道比值模拟黄疸风险指数
-
返回数据包含health_status、jaundice_risk、skin_condition、suggestion四个字段
技术方案说明
技术选型
| 层级 | 技术 | 说明 |
|---|---|---|
| 端侧(眼镜) | GPASS 平台 + 端插件 | 标准化 API 调用硬件能力 |
| 工作流编排 | 百宝箱可视化工作流 | 拖拽式编排,10 天快速交付 |
| 模型服务 | Python 3.10 + FastAPI | 高性能异步 API 服务 |
| 模型框架(规划) | PyTorch / TensorFlow | 深度学习模型训练与推理 |
| 容器化 | Docker + Docker Compose | 一键部署,环境隔离 |
| 云部署(规划) | 阿里云/腾讯云 ECS | 生产环境稳定运行 |
数据流
📌 正式产品:上述逻辑将替换为真实深度学习模型的推理结果。
更新日志
| 日期 | 版本 | 更新内容 |
|---|---|---|
| 2026-07-09 | v1.0 | 初始版本,完成Demo工作流设计和技术文档编写 |
| — | v2.0 | 规划中:接入真实哭声分类模型 |
| — | v3.0 | 规划中:接入视觉健康评估模型 + 多模态融合 |
更多推荐


所有评论(0)