# 中国儿童 AI 玩具市场与产品可行性调研报告

**研究日期：2026 年 10 月 10 日**  
**适用范围：中国大陆，儿童陪伴与教育产品立项决策**  
**重点对象：Fuzozo 芙崽、WIKO 智能憨憨，以及面向儿童的直接竞品与替代产品**
**定价约束：零售价约 100 元，以 99 元作为主力测算；本版已按低价策略重做产品与财务建议。**

**项目已有资源：用户确认已有工厂、供应链或成熟方案合作。具体制造报价、合作范围、最低订单量、认证覆盖与渠道资源尚待核实；不将其自动等同于已有低成本获客能力。**

## 1 核心结论与建议

**这一市场值得小规模验证，但不宜仅凭“接入大模型”和低价硬件直接投入量产。** 对儿童产品而言，持续竞争力来自孩子愿意开口、家长认可内容、设备在家庭环境中可靠运行，以及厂商能长期兑现服务。文字 token 已经可以很便宜，语音、内容、安全、售后和获客更可能决定盈亏。

按用户明确的低价策略，首款以 **99 元左右、6—9 岁儿童的故事与表达玩伴**为立项方向。采用无屏、Wi-Fi、单麦克风、按键说话、小体积外壳或简化毛绒挂件；优先复用成熟 ODM 方案和已审核内容。离线基础功能长期可用，云互动优先研究“每天有免费时长、当天不累积”，额外时长由家长按需购买，不自动续费；长期服务责任另行预算。制造成本先以 **32—35 元/台作为询价目标**，不是已经取得的报价。以 100—300 个家庭验证需求、童声与低价体验，并在 89/99/109 元附近做价格实验；99 元是主力目标，不能靠高价升级款补回主力产品的亏损。

**从价格入手具有可验证的商业逻辑，前提是供应链优势能够形成较低的总交付成本，并找到可负担的获客渠道。** 项目已有工厂合作，因此值得继续验证百元路线。价格本身容易被模仿；制造稳定性、供货、合规内容、渠道关系和真实使用体验需要持续积累。第4.4节针对“99元产品卖不过399元品牌”的访谈观点，给出适用于本项目的条件、获客边界和验证方式。每天2分钟只是费用测算候选，尚未证明能形成家长认可的AI价值，不应为了满足预算直接定为产品权益。

最重要的六个判断如下。

| 决策问题 | 结论 | 对项目的意义 |
|---|---|---|
| 竞品是不是都必须订阅 | 并非如此。芙崽海外官网已有终身免费基础额度；Haivivi 创始人曾披露由赠送三年会员改为终身免费 | 不能把免订阅当成独占卖点，必须明确服务边界与保障期限 |
| token 是否是最大成本 | 在本文低价文字模型情景下，每天 20 分钟的文字模型约 0.31 元/月；语音识别和合成约 7.78 元/月 | 优先优化语音、内容复用和实际计费时长 |
| 约 100 元＋每日免费怎样成立 | 以每日2分钟作为候选，按原会话口径，优化年度情景可留约17.66元/台，公开价年度情景约－1.34元/台；不扣停顿时需更多预算 | 优化效果和长期使用须实测；不能把未验证降本当作已实现 |
| 能否直接复刻芙崽或憨憨 | 不适合原样迁移。成人陪伴、潮玩社交与儿童教育的使用和风险结构不同 | 借鉴触摸与养成体验，重新设计儿童内容与家长端 |
| 市场是否已经很大 | 有可核对的增长证据，但不同机构的 AI 玩具定义差异很大 | 用细分用户和可触达渠道估算收入，不用宏观预测直接推销量 |
| 最容易被忽视的风险 | 儿童不当内容、家庭音频隐私、重度用户费用、服务停运、退货和渠道成本 | 在原型期就纳入架构、现金流和发布条件 |

上述竞品事实见 [芙崽官网](https://fuzozo.net/)及[Haivivi 创始人访谈](https://finance.sina.com.cn/jjxw/2025-09-06/doc-infppxve1324706.shtml)；费用为本文第 5 节的情景计算。

### 1.1 研究方法和证据边界

本报告依据产品官网、开发者发布的应用商店信息、云服务官方价格、政府法规、市场监测报告和创始人访谈整理。优先使用一手资料；访谈中的销量、退货率、成本与盈利表述属于企业自述，不能视作经审计业绩。

**已核实事实、企业宣传、测算假设、产品建议在文中分别注明。** 硬件 BOM、获客费用、未来留存和供应商折扣没有真实询价或项目运营数据，全部作为预算情景。未购买实机，未完成儿童家庭测试，也未进入各竞品登录后的会员购买页面。官网功能存在不代表实际体验达到宣传水平。

信息截至研究日。官网预售价格、App 内购买项目与模型别名均可能变化；实际成交和权益以对应 SKU、地区、账户及购买合同为准。历史市场数据不等于 2026 年全年数据。

## 2 市场空间与增长质量

### 2.1 可以核对的市场证据

魔镜洞察《2025 年 AI 玩具市场机会洞察》披露，在其筛选的京东、淘系和抖音类目中，**2025 年 1—10 月销售额为 5.2 亿元，同比增长 394.9%；销量 122.5 万件，同比增长 960.5%**。这属于特定平台与商品筛选口径的监测，不覆盖全部线下、全部电商或所有智能儿童硬件。报告中的同期 AI 教辅益智销售额份额为 46.2%，支持把儿童成长相关场景作为重要细分方向，但不能把该类目全部等同于本项目。[来源：魔镜洞察报告，第 5—6 页](https://pdf.dfcfw.com/pdf/H3_AP202601071816825695_1.pdf)

由上述总额和销量计算，监测样本的平均销售单价约 **424.5 元**。销量增速显著高于销售额增速，反映价格或产品结构向更低价变化的可能性；仅凭这两个增速无法区分促销、品类变化和真正的技术降本。

这组数据足以说明市场在增长，但平均价格不代表约 100 元细分市场的规模。百元产品是否打开新增需求、是否主要替代传统故事机，仍需价格实验；不能把全市场增速直接当作本产品销量预测。它也说明“市场很热”并不必然带来高利润。对初创项目而言，更有价值的证据是某个价格、内容和渠道组合能否持续产生订单、留存和正贡献利润。

### 2.2 如何理解机构预测中的大市场

京东与深圳市玩具行业协会的 2025 年白皮书提出较高的长期增长预期，并说明其 AI 玩具统计口径侧重搭载大模型的产品，排除部分其他智能玩具。另一些报告涵盖机器人、机器狗、教辅设备或传统智能玩具，全球与国内、人民币与美元也常在转述中混用。[来源：京东 AI 玩具白皮书，行业规模与数据口径章节](https://pdf.dfcfw.com/pdf/H3_AP202508051721756227_1.pdf)

**本报告不采用一个统一的“千亿市场”数字作为销售预测。** 应建立三层空间：

| 层级 | 本项目建议口径 | 使用方式 |
|---|---|---|
| 总体潜在市场 TAM | 中国大陆有儿童陪伴、语言互动或家庭启蒙需求的家庭年度相关支出 | 说明方向，不直接拿全部儿童人数乘售价 |
| 可服务市场 SAM | 产品年龄范围、约 100 元预算、家庭网络条件、监护人认可服务额度同时满足的家庭 | 随家长访谈、渠道调查逐步收窄 |
| 可获取市场 SOM | 团队未来 12—24 个月能实际触达并成交的家庭 | 用流量、转化率、渠道数和供货能力预测 |

国家统计公报显示 2025 年出生人口为 792 万。儿童消费存在庞大存量，但人口变化也意味着不应依赖出生人数持续增长支持需求。6—9 岁市场应依据对应年龄队列和家庭消费能力估算，不能使用当年出生人口代表该年龄人群。[来源：2025 年国民经济和社会发展统计公报](https://big5.www.gov.cn/gate/big5/www.gov.cn/lianbo/202602/content_7059980.htm)

### 2.3 百元产品的可获取市场与首年收入

下面是**渠道计划情景，非市场预测**。以 99 元主力售价计算，需去除重复归因，退货后按有效成交计。

| 情景 | 年度有效产品页访问量 | 有效购买转化率 | 有效成交量 | 含税硬件销售额 |
|---|---:|---:|---:|---:|
| 小规模验证 | 10 万 | 1% | 1,000 台 | 9.9 万元 |
| 基准渠道计划 | 50 万 | 2% | 10,000 台 | 99 万元 |
| 较强渠道执行 | 100 万 | 3% | 30,000 台 | 297 万元 |

这里的访问量是有购买意图的产品页访问，不是短视频曝光。低价可能降低购买门槛，但转化率和目标家庭数需要实测，不能把价格降幅换算成确定的销量倍数。

100 万个可触达目标家庭、年度购买率 1%—3%的假设，对应 1—3 万台和 99—297 万元硬件流水。**家庭数和购买率均待验证。** 若优化年度情景每台贡献约 17.66 元，卖出 1 万台只贡献约 17.7 万元，尚未覆盖固定团队费用；百元策略更依赖销量、复购和已有供应链。

渠道优先试验现有玩具品牌合作、社群自然成交、老客推荐、低获客成本的内容展示，以及按工厂出货价核算的批发。零售获客预算先以 5—10 元/台为目标；不能沿用高价产品每单几十元的广告费用。批发路线必须用实际出厂收入重算，不可把 99 元零售价当作厂商收入。

### 2.4 购买者和使用者需要分别研究

孩子决定产品是否被持续使用，家长决定是否购买、续费、推荐和退货。

| 家庭任务 | 孩子需要 | 家长需要 | 可形成的产品机会 |
|---|---|---|---|
| 亲子共读和故事 | 参与剧情、被回应、能打断 | 故事安全、适龄、有清晰结束 | 受控故事共创和主题卡 |
| 日常表达 | 分享学校生活，获得鼓励 | 孩子愿意表达，与真人交流增加 | 复述、轮流讲话和亲子问题 |
| 英语启蒙 | 游戏化角色、敢开口 | 难度可理解，发音与内容可靠 | 限定主题英语互动 |
| 礼赠 | 可爱外观、开箱乐趣 | 上手简单，后续费用清楚 | 预配基础内容与服务说明 |
| 家庭陪伴 | 稳定的互动习惯 | 隐私、静音、时间管理 | 每次 5—10 分钟的活动 |

“更长的对话时间”不是儿童产品的默认成功指标。更合适的指标是完成互动任务、孩子主动表达、家长愿意继续使用，以及设备没有挤占真人交往。现有资料不足以证明 AI 玩具能提升成绩或改善临床心理问题，不应以此进行销售承诺。

### 2.5 价格带和渠道判断

以下为产品定位建议，价格边界是便于立项比较的划分，并非全市场价格统计。

| 价格区间 | 常见购买考虑 | 新项目的难点 |
|---|---|---|
| 200 元以下 | 尝鲜、礼品、基础语音 | 服务和安全预算薄，容易同质化 |
| 200—500 元 | 主流故事机、AI 挂件、陪伴玩具 | 竞争密集，上手和后续费用影响口碑 |
| 500—1,000 元 | 品牌、授权角色、内容和体验 | 必须解释与低价产品的差异 |
| 1,000 元以上 | 机器人、较复杂动作或学习功能 | 质量、效果、退货和售后要求更高 |

百元产品的核心渠道问题是单笔服务与获客费用。建议先通过现有玩具商、家长社群、内容自然成交和少量线下体验测试；京东、天猫、抖音等渠道分别计算佣金、广告、退货和客服。规模较小且没有低成本渠道的纯自营品牌，可能无法覆盖固定开支。学校渠道存在采购周期、准入和教育应用规范，不宜计入首年必达收入。

## 3 竞品分析

### 3.1 竞品与替代品总览

| 产品或产品群 | 主要定位 | 价格与服务证据 | 优势线索 | 与本项目的关系 |
|---|---|---|---|---|
| Fuzozo 芙崽国内版 | 养成系潮玩、情绪陪伴 | 历史报道 399 元；国内 App 有 19.9、29.9 元等内购项目，项目名称不能直接还原套餐权益 | 外观、人设、养成、随身社交 | 体验标杆，不能当成已验证的儿童教育方案 |
| Fuzozo 海外官网版本 | 成人 AI 宠物 | 当前 Basic 预售 149 美元，Plus 一年组合 248 美元；官网标示 Basic 终身免费 | 额度清楚，基础免费与进阶权益分层 | 商业模式参考，价格及权益不可平移到国内 |
| WIKO 智能憨憨 | 情绪陪伴电子宠物 | 普通版上市价 399 元，蜂窝版预售价 499 元；当前官网赠送 5 个月 SVIP | 小艺模型、触摸、性格、鸿蒙及移动网络 | 成人陪伴和渠道标杆，儿童课程能力待实测 |
| Babycare AI天才小丑鸭 | 儿童AI毛绒互动、故事与角色活动 | 用户反馈补贴后249元、不限对话时长；本次未独立核实当前不限时合同。展商与品牌访谈可核实产品定位 | 成熟母婴品牌、内容与多模型调用的产品自述 | 应加入低价免订阅模式的重点实购竞品 |
| Haivivi BubblePal | 儿童玩偶互动挂件 | 2025 年创始人访谈称售价 499 元，服务改为终身免费；当期具体购买权益仍需确认 | 为既有玩偶增加互动、角色和故事 | 更直接的儿童竞品 |
| Haivivi CocoMate | 端到端语音互动玩具 | 官网核实 Wi-Fi＋4G、主题卡、语音与摇晃唤醒；当前成交价和服务上限未核实 | 自然互动、移动使用、主题触发 | 必须购买测试的直接竞品 |
| FoloToy Fofo 等 | 现有玩具增加 AI 对话 | 官方产品页可核实产品形态；国内当前售价和权益未核实 | 改造传统形态，技术集成思路 | 供应链和技术路线参考 |
| 火火兔等传统故事机 | 婴幼儿与儿童内容播放 | 官网介绍早教、故事机等产品；不同型号差异大 | 成熟内容、品牌和离线播放 | 用户预算和家庭任务的替代品 |
| 智能音箱、点读笔、手机语音应用 | 内容、启蒙、助手 | 不用一个统一价格比较不同型号 | 家庭可能已拥有，新增成本低 | AI 玩具需要证明实体互动的额外价值 |

价格与功能来源：[芙崽海外官网](https://fuzozo.net/)、[芙崽国内 App Store](https://apps.apple.com/cn/app/fuzozo%E8%8A%99%E5%B4%BD/id6746146243)、[憨憨上市报道](https://www.ithome.com/0/941/360.htm)、[WIKO 官网](https://www.wiko.com/ai_toys/hanhan)、[Haivivi 访谈](https://finance.sina.com.cn/jjxw/2025-09-06/doc-infppxve1324706.shtml)、[CocoMate 官网](https://www.haivivi.cn/product/cocomate)、[FoloToy 官网](https://www.folotoy.com/zh/products/fofo/)、[火火兔官网](https://www.alilo.com.cn/)。表格中历史价格不是研究日实时成交价。

### 3.2 芙崽的产品和商业逻辑

芙崽官网强调不同角色性格、触摸反馈、共同记忆和养成，把设备与配饰、日常携带结合。**企业宣传**的已找到主人数量为 30 万以上，不等于独立核实的活跃用户、儿童用户或付费订阅数。官网写明面向 18 岁以上，未成年人应在监护人陪同下使用。[来源：芙崽官网](https://fuzozo.net/)

从产品逻辑推断，其价值在于用户把角色当作有持续经历的对象。外观促成购买，稳定人设、记忆和互动支撑继续使用；配饰可以产生额外收入。模仿外观并接一个通用模型，很难获得同样的角色一致性和品牌认知。这是分析判断，而非已经测出的技术壁垒。

**国内外模式必须分开看。** 海外官网当前 Basic 每天最多 20 分钟、每月 0.5GB 4G；Plus 总权益为每天最多 60 分钟、每月 1.5GB，激活后一年，不自动续费。官网当前为美国地址发货，英文对话设计，不能把这一套餐当作国内版权益。[来源：芙崽官方 FAQ](https://fuzozo.net/pages/faq)

国内开发者 App Store 页面展示“一点灵光”等内购价格；精力值、优惠、设备代际与账户可能影响权益。**29.9 元内购项目不等于已核实的“无限语音畅聊月费”**。应购买国内实机并记录会员页、免费额度、到期表现和退款条款。

2026 年虎嗅访谈中，创始人称芙崽当时推理全部在云端，日常对话与性格等任务使用不同模型，并用长期记忆降低历史内容重复输入。这支持低价硬件＋云端编排的可行路线；具体模型、每台成本与盈利仍未公开验证。[来源：虎嗅创始人访谈](https://m.huxiu.com/article/4873536.html)

对儿童项目的启示：保留触摸、明确角色性格、可解释的成长和小段互动；把真人关系、适龄内容、受控记忆和家长参与放在优先位置。成人产品的社交、玄学性格或情绪黏性设计不能直接作为儿童教育价值。

### 3.3 憨憨的优势和未解决问题

WIKO 当前页面是**智能憨憨蜂窝版**，而非只能按早期普通版参数理解。官网列出小艺大模型、触摸与摇晃、MBTI 性格养成、日记、碰一碰、Wi-Fi＋4G，并展示约 140g、1800mAh；公布 Android 10 以上和 iOS 15 以上等适配信息。购机赠 5 个月无限精力值，4G 可能收费。[来源：WIKO 官网](https://www.wiko.com/ai_toys/hanhan)

普通版 399 元与蜂窝版 499 元是上市报道价格。**本次没有核实 SVIP 续费价格、到期后的免费额度、精力值与分钟换算或 4G 续费合同**，因此不填写一个推测的月费。[来源：2026 年 4 月 20 日蜂窝版上市报道](https://www.ithome.com/0/941/360.htm)

推断优势是成熟终端品牌、渠道信任和系统适配。小艺大模型品牌能降低消费者理解门槛，但不自动证明童声识别、课程准确性和儿童保护优于其他产品。尽调时应验证 API 服务由谁提供、谁承担儿童数据处理责任，以及渠道促销服务是否由厂商补贴。

官网明确产品不防水。儿童场景应单独考察清洗、拉扯、口水、跌落和充电体验。对新项目而言，可拆洗外套往往比额外模型参数更容易形成清楚、可信的差异。

### 3.4 Haivivi 是必须加入的直接竞品

BubblePal 官方介绍角色、故事共创、长期记忆和家长成长报告，早期版本需要 2.4GHz Wi-Fi。CocoMate 官网则强调端到端互动、Wi-Fi＋大陆 4G、主题卡、语音和摇晃唤醒，展示 3000mAh 电池与可清洗设计。这些是官网功能陈述，清洗方式应按实物说明确认，不能理解为整个电子机芯可以水洗。[来源：BubblePal 产品页](https://www.haivivi.cn/zh/product)、[CocoMate 产品页](https://www.haivivi.cn/product/cocomate)

2025 年 9 月访谈中，创始人表示服务已从“送三年会员”调整为终身免费。这是重要的模式证据，也表明儿童 AI 玩具的竞争已经包括买断方案；不能据此证明每个 SKU 都无限对话、4G 永久免费，或终身服务准备金足够。[来源：Haivivi 创始人访谈](https://finance.sina.com.cn/jjxw/2025-09-06/doc-infppxve1324706.shtml)

与芙崽相比，Haivivi 的儿童角色、内容入口和家长功能更接近本项目。其主题卡解决“孩子不知道聊什么”的问题，值得借鉴。新项目需要找到一个更窄、可测量的任务，例如共读后的表达练习，避免在形象、IP、语音和内容上同时正面竞争。

### 3.5 需要实测的比较项目

公开资料不能支持给各品牌打精确体验分。建议购买至少 4 台设备，采用相同问题、家庭噪声和时间条件评测：

1. 首次开机至可用的时间、监护人同意流程、弱网及断网表现。
2. 6—9 岁童声、普通话口音、兄弟姐妹抢话和电视背景声下的任务完成率。
3. 用户说完至首个**有意义**回应的时延，包含内容安全处理。
4. 故事中打断、控制音量后继续、问题改变后的上下文处理。
5. 第 1、7、30 天的可验证记忆准确率，修改和删除是否有效。
6. 数学、科学、语言和故事任务的内容准确性与适龄性。
7. 长对话、角色扮演、诱导、谐音和敏感问题下的内容边界。
8. 免费额度到达、会员到期、退款、解绑与服务停运说明。

孩子参与之前先由成年人完成安全测试；家庭试用取得监护人同意，采集最少的数据。

### 3.6 百元策略下怎样重新看竞品

芙崽、憨憨与 Haivivi 仍适合学习语音、人设和家长体验，但本项目不追求在 99 元复刻其全套配置。主要比较项变为：**孩子能否完成一个有趣互动、家长是否理解后续费用、按键语音是否稳定，以及无网/额度用完后还有什么价值**。

同时将 100 元附近的传统故事机、可录音玩偶、电子宠物及白牌语音玩具列为实购对象。不能因为商品标题写“AI”“智能对话”，就认为它使用大模型；需验证是否只能播放固定回复、是否依赖手机、云服务合同与实际售后。**本次尚未核实一个能直接作为同规格 99 元大模型竞品标杆的国内 SKU，低价市场不等于没有竞争。**

首轮实购建议增加 5—10 个低价样本，记录实际成交价、运费、附送云权益与一年总费用；再与高价标杆比较完成相同任务的体验。由此决定百元款能删哪些功能，以及哪些最低体验家长不接受削弱。

### 3.7 Babycare小丑鸭：首月销售、免订阅与成本机制

本次用户提供“补贴后249元、无对话时长限制”这一重要线索。公开资料名称为 **AI天才小丑鸭**。展商产品介绍列出故事内容、对话、记忆与情绪互动，定位3—6岁；这是企业产品展示，不能据此证明教育效果。[来源：CKE展商产品页](https://www.china-kids-fair.com/product/-_en-28394)

**首月销售证据：** 中国日报网2025年12月1日报道，小丑鸭上市首月销售额超过200万元，并曾出现售罄。它为儿童AI玩具的单品需求提供了具体案例；报道未披露销量、平均成交价、首月起止日期，以及销售额是否包含补贴、退款或属于GMV。本文将其标为“媒体报道的销售表现”，不作为经审计财务数据。[来源：中国日报网报道](https://cn.chinadaily.com.cn/a/202512/01/WS692d4d00a310942cc4994480.html)

**首月约1万台可以作为待验证的量级假设。** 以下以200万元为计算基准，用“销售额÷同口径平均单价”展示价格对销量推算的影响。249元是用户提供的当前补贴价，其他价格也是情景假设，均不代表已经核实的上市平均成交价。

| 假设平均单价 | 以200万元为基准推算的台数 | 1万台对应销售额 |
|---|---:|---:|
| 200元 | 10,000台 | 200万元 |
| 249元 | 约8,032台 | 249万元 |
| 399元 | 约5,013台 | 399万元 |
| 499元 | 约4,008台 | 499万元 |

报道说的是“超过200万元”，不是恰好200万元。因此，按249元计算约8,032台只是参考值，不能据此否定1万台；1万台×249元＝249万元同样符合报道。但当前补贴价也不能替代2025年上市首月的实际平均成交价。正式竞品表宜写：**“首月销售额超过200万元；数千至万台级销量情景，具体销量未披露”**，不把“首月1万台”写成已确认事实。

**对百元策略的意义：** 这一案例支持将儿童AI玩具视为已有实际消费需求的品类，同时应研究Babycare的品牌信任、既有渠道和产品内容对转化的贡献。不能把成熟品牌的首月表现直接用作本项目99元产品的销量预测。即使销量达到1万台，也不能仅靠销售额判断免订阅是否盈利：还需激活率、30/90天留存、每台及重度用户对话用量、退货率、渠道净结算和云服务账单。尤其是售出设备数不等于每月活跃设备数，长期服务准备金应按每批用户的真实使用曲线计算。

品牌玩具负责人访谈提到按需求调用不同模型，家长端有使用时间设置；属于企业自述。**家长设置健康时限与厂商收费额度不同，不能用前者反驳“不限对话额度”。** 本次没有取得当前SKU合同、软件付费页、实际云账单或拆机BOM，尚未独立确认免费期限、公平使用/异常调用条件与是否所有功能均免费。[来源：品牌负责人访谈](https://finance.sina.com.cn/wm/2026-03-26/doc-inhsikav8949298.shtml)

对于成本，合理的解释是下列机制的组合，而不是已查明其内部商业账。

| 机制 | 为什么可降低承担成本 | 当前证据边界 |
|---|---|---|
| 多模型调用 | 日常互动与较复杂任务使用不同模型 | 品牌访谈支持多模型；具体模型、分流比例、合同价未知 |
| 按所有售出设备的真实使用预算 | 不限时不意味着每台每天长聊；未激活、闲置、轻度使用影响总账 | 合理财务机制；该产品激活率、留存和用量没有公开验证 |
| 语音与内容复用 | 预录故事/儿歌、常用回应、缓存可减少每次TTS与生成 | 产品展示支持有内容；是否采用缓存及比例未确认 |
| 硬件收入预留服务预算 | 249元比99元有更高收入空间，但须扣除其更复杂硬件与渠道 | 249元为用户反馈；具体毛利与准备金未知 |
| 合同折扣/自有部署 | 有规模时可能低于公开API价，语音与连接账可整体优化 | 采购与部署数据未公开，不计入确定结果 |
| 已有品牌与渠道/跨品类价值 | 既有客服和用户触达可降低新增固定成本，玩具也可能承担品牌获客任务 | 商业推断；不证明该SKU盈利，更不依赖儿童数据变现 |

补贴后的消费者付款不是厂商实际净结算额。平台补贴、品牌优惠或混合补贴的分担不同，需看订单与结算；不能假设厂商仍收原价，也不能把全部补贴都当厂商亏损。

**成本量级示例，不是小丑鸭实际账单：** 按本文均衡非思考模型与标准语音价格，实际每日5分钟、累计6个活跃月，在线费用加30%缓冲约32.91元；实际每日20分钟、同样6个活跃月则约119.93元。前一种使用结构可以被几十元的服务预算覆盖，后一种明显更难。用便宜模型、内容复用或更优合同会改变结果，长历史和重试也可能提高成本。

阶段促销价格不等于品牌长期常态售价或该批设备的实际毛利。249元除以1.13约为220.35元，而99元对应87.61元，两者净收入差约132.74元；仅用于比较同税率收入空间，**不能直接当作服务补贴差额**，因为其硬件、动作、结构、渠道和版权成本也不同。即使卖249元，不限时也需看重度用户与长期服务准备金。

结论：小丑鸭值得优先实购；若其不限时权益得到合同确认，将是重要的免订阅直接竞品。**不能由249元不限时推出99元也应不限时，更不能推出对话成本为零**。本项目应先验证每日基础免费，再用真正的用户生命周期数据判断是否扩额度。

## 4 产品切入与差异化

### 4.1 百元首款产品：按键语音故事与表达玩伴

建议定位为 **99 元左右、家长可参与的故事与表达玩伴**。孩子按键提问或选择主题，设备再回应，优先采用轮流说话。离线故事、分支选择与预录提示承担日常活动，云端负责少量真实提问、剧情共创与表达反馈。每次活动约 5—10 分钟，但不能把全部活动时间都包装成免费开放 AI 对话。

首发比较两种形态：**小型塑胶或硅胶外壳的语音玩具、可放入既有玩偶的小机芯**。若选择毛绒，使用小尺寸原创角色和简单结构；两种方案按相同安全与声音要求询价。成品外观是否受欢迎要测试，不把“低价”自动等同于儿童愿意使用。

| 首发保留 | 为百元价格简化 | 验证后再考虑 |
|---|---|---|
| 受控内容、Wi-Fi、单麦克风、按键说话与停止、静音开关、家长授权、离线播放、明确云额度 | 无屏、单角色、短回答、少量离线内容、简单包装，复用成熟板卡与结构 | 双麦阵列、触摸和运动养成、多音色、4G、全双工、更多英语主题 |

按键说话可以减少环境噪声误触发、待机监听和音频计费，代价是互动更像轮流讲话。按键松开、停止播放和网络失败必须清楚反馈。取消全双工后，能否在儿童实际使用中减少误识别与返工要通过测试确认。

**安全内容、数据保护、可靠电池、充电保护和必要认证仍是底线。** 约 100 元只改变功能与商业边界，不能把这些预算删除。它仍可能包含拟人化情感互动，需按实际功能评估监管适用范围。

### 4.2 能建立壁垒的资产

值得积累的资产包括经过审核的活动脚本、童声与家庭噪声下的匿名化评测集、儿童表达任务的评价规则、产品交互稳定性、家长信任和品牌角色。采集儿童数据不是天然壁垒，必须符合目的限定和保护要求。

IP 的外观与声音要分别授权，生成互动、数字形象、角色设定、衍生音频和服务期限也要写入合同。首期可以选择原创角色和少量授权内容，减少最低保底金和授权终止后服务改变的压力。

### 4.3 教育价值要用对照验证

对于“表达练习”，比较玩具活动、家长共读和普通音频故事三个条件下的完成度、儿童主动表达和家长接受度。不要把对话次数或自动生成的“成长分数”直接当作学习提升。

如要进入英语学习，应对具体目标做独立验证，如完成限定主题交流、理解常用句或愿意模仿发音。英语发音评价需要童声专门验证，不能仅凭通用转写结果惩罚孩子“说错了”。正式学科辅导、心理干预和特殊需要儿童服务应另行设计专业验证及监管评估。

### 4.4 从价格入手：工厂资源怎样形成可持续的百元策略

**本项目可以继续以99元为入口，但要验证“低价是否带来足够多的低成本成交”。** 用户已确认有工厂、供应链或成熟方案合作，这有助于降低制造成本、缩短交付周期和复用研发。优势大小仍需实际报价、良率、返修、订单条件与可售产品验证。它尚不能证明家长愿意购买，也不能证明广告、渠道和长期服务费用能被覆盖。

**如何看待李勇的观点。** 2025年9月的访谈强调，品牌与营销需要利润支持，并称部分99元产品的销量远低于其产品。这是经营者对自身路线与竞争的观察；访谈没有给出可比SKU、统计期间、投放规模、销量明细或对照样本。因此不能把它写成“99元产品销量必然只有399元产品的十分之一”，也不能从中推出低价路线必然失败。可以采纳的提醒是：制造可行性与获客可行性需要分别验证。[来源：Haivivi创始人访谈](https://finance.sina.com.cn/jjxw/2025-09-06/doc-infppxve1324706.shtml)

**百元价格对应的需求假设：** 希望低成本试用AI玩具、尚不愿为强IP或复杂交互支付数百元的家庭。首款用一个明确任务证明价值，例如孩子听故事后主动续编、选择剧情或回答开放问题。是否存在足够多这类家庭、是否愿意接受按键说话与每日云额度，必须实测。不能把消费者简单按城市等级或收入贴标签，也不能假定所有家长都会优先选择最低价。

| 要形成的优势 | 工厂合作可能帮助什么 | 还需要验证什么 |
|---|---|---|
| 更低的总交付成本 | 复用板卡、模具与采购，减少重复开发 | 含装配测试与良率的完整报价；返修、库存、云服务及供应商软件费 |
| 可清楚展示的核心体验 | 精简功能后优化声音、按键反馈和结构 | 真实童声和家庭噪声；家长能否迅速理解并愿意付款 |
| 可负担的渠道 | 若合作方已有客户，可洽谈联合销售 | 工厂是否真的有消费端渠道；采购价、抽成、退货和服务责任 |
| 家长信任 | 稳定出货、质量记录与明确售后 | 成品认证与适龄要求、内容表现、配网和售后体验；不能仅靠供应商资质替代 |
| 持续经营能力 | 成熟方案降低固定投入和维护难度 | 核心软件控制权、迁移能力、授权期限、长期服务准备金 |

**用本报告的账看获客空间。** 按99元、制造32元、平台5%、履约6元、售后4元、按台内容2元，采用“每日2分钟有效语音、不扣停顿”的计量；优化年度云准备金取整16元。扣获客前贡献约为22.66元/台。该优化方案假设80%语音缓存、模型分流与较低设施费用，尚未实现；并且只预留一年服务，不覆盖无限期承诺。

| 每台实际获客成本 | 优化年度情景的剩余贡献 | 意义 |
|---|---:|---|
| 5元 | 17.66元 | 有一定固定费用空间，仍须验证长期服务 |
| 8元 | 14.66元 | 接近、但未达到本文15元初始放量门槛 |
| 15元 | 7.66元 | 对固定研发与运营的覆盖能力明显下降 |
| 25元 | −2.34元 | 单台亏损，增加销量扩大亏损 |
| 40元 | −17.34元 | 此成本结构下不具备放量条件 |

上述5/8/15/25/40元是敏感性情景，**不是已经查明的行业获客均值**。目标若是每台至少留15元，优化年度情景可承受的获客成本约为7.66元；只求单位不亏时约为22.66元，但没有预算覆盖固定开支。公开价年度方案同口径需37元准备金，扣获客前仅约1.66元，因此即使获客很便宜也难成立。若制造、退货或免费时长增加，边界还会下移。

低价只有提高转化，才可能降低获客费用。假设同一渠道每次有效访问成本为V、最终保留订单转化率为p，则每个保留订单的媒体获客成本为V÷p。在访问成本不变时，转化率提高一倍可使媒体获客成本减半；降价是否会提高转化、提高多少，不能预设。计算应以退款后保留的订单为分母，把按单达人佣金、赠品和可归因推广成本纳入；已经包含在售价或渠道费里的折扣、佣金不能重复扣除。内容制作、人工与品牌建设即使不按点击付费，也有成本，分别计入获客或固定运营，不能默认“自然流量免费”。

**优先路径：保留99元目标，先借合作资源验证成交。** 向现有工厂询问其是否具备玩具品牌客户、门店或销售合作方，尝试联合展示与小批订单；如没有，就按新品牌从零获客测算。品牌方或经销商承担零售时，必须按本项目的实际采购结算收入算账。第8.3节的批发模型表明，59/69元含税采购价下，扣除制造、批量履约、质量与内容后，云前贡献约14.21/23.06元；若由本项目再承担16元优化年度服务准备金，剩余约−1.79/7.06元，尚未扣固定销售费用。渠道合作可能降低获客，但会让出零售收入；不能视为天然盈利捷径。

**避免用过少免费时长破坏价格优势。** 99元买到可独立使用的完整活动，才有机会产生推荐。每天2分钟云互动只是财务候选；若家长试用后感到“刚开口就用完”，低价可能仍不值得购买。可以用原创预录故事、分支游戏和常用回应承担5—10分钟活动，把每日云分钟数、计量方式和用完后的行为在购买前讲清楚；也要对基础活动本身是否有趣做测试。若合格体验必须更长云额度，就重新计算成本并继续降本，不通过隐藏额度或依赖后续充值弥补。按需时长包、配件和内容复购应作为另行验证的收入，不用于证明首单亏损合理。

**下一轮验证：** 在实际适用的安全与认证要求落实后，以100—300个家庭取得需求与用量的初步信号。价格实验保持功能、品牌呈现、免费权益和投放素材一致，在89/99/109元附近观察付款、退款后保留订单及30天使用；小样本用于筛选方向，不声称已证明全市场价格弹性。渠道分别测算每单净结算、获客、退货和服务准备金，确认哪些订单真实盈利，再扩大。供应链询价需区分500—1,000台试产与1万台量产，不用量产目标价冒充首批成本。

就规模而言，14.66元年度剩余贡献对应每1万台约14.66万元；覆盖50万元固定开支需约3.41万台，且仍未覆盖一年后的免费责任。这比“首月卖1万台”更能说明百元创业所需条件。**当前建议是继续验证百元路线，将供应链优势、核心体验和渠道贡献一起作为立项依据；若只能靠高费用广告获得订单，99元方案需要重新设计渠道或交付成本。**

## 5 持续成本与 token 测算

### 5.1 先建立正确的费用结构

用户与玩具进行语音互动时，通常包含：语音识别 ASR、文字模型 LLM、语音合成 TTS、内容审核、记忆与检索、设备连接、存储、运维和可选蜂窝流量。另有内容编辑、人工审核、客服与研发等固定开支。

因此，“每百万 token 很便宜”只能解释一部分成本。本文使用 **人民币、国内部署、公开标准按量价**。不把新用户免费额度或未签约的大客户折扣计入长期预算，不使用海外低价替代国内儿童数据处理方案。

### 5.2 官方价格基准

| 组件 | 模型或服务 | 研究日公开价格 | 备注 |
|---|---|---:|---|
| 低价文字模型 | qwen-flash，北京、输入不超过 128K | 输入 0.15 元/百万 token；输出 1.5 元/百万 token | 本文主情景；不预设儿童效果合格 |
| 较强文字模型 | qwen-plus，北京、非思考、输入不超过 128K | 输入 0.8 元/百万 token；输出 2 元/百万 token | 思考输出另计，不能混用 |
| 流式语音识别 | paraformer-realtime-v2，北京 | 0.00024 元/秒，即 0.864 元/小时 | 按送入并计费的音频时长 |
| 文件语音识别 | paraformer-v2，北京 | 0.00008 元/秒，即 0.288 元/小时 | 不等于具有相同流式体验 |
| 语音合成 | cosyvoice-v3-flash，北京 | 1 元/万字符 | 主情景音色质量待实测 |
| 语音合成 | cosyvoice-v2，北京 | 2 元/万字符 | 作为音色费用敏感性比较 |
| 端到端音频模型 | qwen-audio-3.0-realtime-flash，北京 | 音频输入 6、输出 12 元/百万 token | 文本输入 1.5、输出 4.5 元/百万 token |
| 端到端音频模型 | qwen-audio-3.0-realtime-plus，北京 | 音频输入 40、输出 150 元/百万 token | 文本输入 5、输出 40 元/百万 token |

来源：[qwen-flash 官方模型信息](https://help.aliyun.com/zh/model-studio/qwen-flash)、[qwen-plus 官方模型信息](https://help.aliyun.com/zh/model-studio/qwen-plus)、[百炼语音与实时音频官方价格](https://help.aliyun.com/zh/model-studio/model-pricing)。官方页面同时包含不同地区、版本与价格阶梯；生产合同应固定具体模型版本与计费项。

### 5.3 测算假设

以下假设用于可复算预算，**不是竞品实际用量**。

| 参数 | 主情景假设 | 需要实际测量的原因 |
|---|---:|---|
| 每月使用天数 | 30 天 | 高频情景，不代表平均用户 |
| 每日互动会话时间 | 5、10、20、60 分钟分别计算 | 会话包含双方说话和停顿 |
| 孩子音频占会话时长 | 40% | 只有这部分进入 ASR 计费是工程前提 |
| 玩具输出语音占会话时长 | 40% | 其余 20% 为停顿等 |
| 模型轮数 | 每分钟 2 轮 | 长故事与短问答会有明显差异 |
| 每轮输入 | 1,000 token | 包含安全规则、人设、少量上下文与检索；须控制长度 |
| 每轮输出 | 70 token | 包含文本及控制字段的预算估计 |
| 中文语音速度 | 180 字符/分钟 | 每轮约 36 个发声字符；英语与标点计数需另测 |
| API 使用裕量 | API 费用增加 20% | 覆盖重试、误触发、额外调用的情景预留 |
| 其他在线可变费用 | 每会话分钟 0.003 元 | 云连接、存储、检索与自动审核的预算占位 |
| 活跃设备基础费用 | 0.50 元/月 | 预算占位，不是云厂商报价 |

尤其注意：若云端实际持续接收完整会话音频，ASR 不能按 40% 计费；每次调用最低时长、取整、并发、连接收费、标点计数和失败请求规则都需核对。固定安全运营人力没有包含在这张按设备测算表中。

### 5.4 计算公式

设月会话分钟数为 M，轮数 R＝2M，输入 I＝1,000，输出 O＝70：

```text
月 ASR 费用 = M × 40% × 60 × 0.00024
月 TTS 费用 = M × 40% × 180 ÷ 10,000 × 1
月文字模型费用 = R × (I × 0.15 + O × 1.5) ÷ 1,000,000
月在线服务预算 = (ASR + TTS + 文字模型) × 1.20 + 0.50 + M × 0.003
```

**最后一项是预算，不是已实测的完全成本；不含 4G、客服、内容和团队固定费用。**

### 5.5 不同使用强度的结果

| 每日会话时间 | 每月会话时间 | ASR | TTS | 文字 token | API 合计 | 在线服务预算 |
|---:|---:|---:|---:|---:|---:|---:|
| 5 分钟 | 150 分钟 | 0.86 元 | 1.08 元 | 0.08 元 | 2.02 元 | **3.37 元/月** |
| 10 分钟 | 300 分钟 | 1.73 元 | 2.16 元 | 0.15 元 | 4.04 元 | **6.25 元/月** |
| 20 分钟 | 600 分钟 | 3.46 元 | 4.32 元 | 0.31 元 | 8.08 元 | **12.00 元/月** |
| 60 分钟 | 1,800 分钟 | 10.37 元 | 12.96 元 | 0.92 元 | 24.25 元 | **35.00 元/月** |

主情景的 20 分钟用户，文字模型约占原始 API 费用的 3.8%。若只降低文字 token 一半，原始 API 账单仅减少约 0.15 元/月。这个比例不能外推到长上下文、多工具或高价推理模型产品。

### 5.6 哪些参数最容易使成本失控

| 改动，每天仍为 20 分钟 | 月在线服务预算 | 相对主情景 | 判断 |
|---|---:|---:|---|
| 主情景 | 12.00 元 | 基准 | 有效语音截取、短回答 |
| 文字模型全部换 qwen-plus 非思考 | 约 12.98 元 | ＋0.99 元 | 文字模型升级未必很昂贵，应看效果 |
| 每轮输入增加至 10,000 token，仍用 qwen-flash | 约 13.94 元 | ＋1.94 元 | 便宜模型下影响有限，高价模型会放大 |
| ASR 按整个会话计费 | 约 18.22 元 | ＋6.22 元 | 检查 VAD 和接口是否真正减少计费 |
| TTS 改为 2 元/万字符 | 约 17.18 元 | ＋5.18 元 | 音色和情绪表现可能比 token 更昂贵 |
| TTS 改为 3.5 元/万字符情景价 | 约 24.96 元 | ＋12.96 元 | 仅用于敏感性比较，不代表选定供应商 |

孩子的重复提问、误识别后重说、设备把电视声当作提问、长篇故事和输出被打断后重生成，都会增加付费调用。20% 裕量是否够用要通过真实账单验证；不能用理想演示推全年预算。

### 5.7 端到端语音可能更便宜，但要计算历史上下文

官方实时语音价格说明音频折算为每秒 12.5 token，且用户音频历史可能继续作为后续输入计费。以主情景孩子和玩具各说 240 分钟/月计算，仅首次音频输入和一次音频输出：

| 端到端模型 | 新输入音频费用 | 新输出音频费用 | 新音频合计 |
|---|---:|---:|---:|
| realtime-flash | 1.08 元 | 2.16 元 | **3.24 元/月** |
| realtime-plus | 7.20 元 | 27.00 元 | **34.20 元/月** |

**该表不是完整账单，也不能直接与 12 元在线预算比较。** 还需加文本指令、文本输出、历史音频再次输入、重试、安全和云服务。它说明低价端到端方案值得测试，不能简单认定端到端一定更贵。

举例：一次会话 40 轮、每轮孩子说 12 秒，每段 150 音频 token，若每轮把此前所有孩子音频按未缓存原价重计，输入音频累计为 150×40×41÷2＝123,000 token，而新音频总量仅为 6,000 token。按 flash 音频输入价格，单次会话分别约 0.738 元和 0.036 元；每天这样使用、一个月约 22.14 元与 1.08 元。此为按公开规则构造的**未缓存上行情景**，实际会话裁剪、缓存、供应商实现会改变费用。[来源：百炼实时语音计费说明](https://help.aliyun.com/zh/model-studio/model-pricing)

儿童产品还需验证是否能在音频播出前完成审核、是否可留存必要的审核文本，以及出现风险时能否立即中止。选择端到端架构应基于相同家庭任务、相同保护条件下的总成本和体验测试。

### 5.8 4G 和传输费用

若上下行语音均以 24kbps 编码、双方合计发声占 80%，每天 20 分钟、30 天的音频净载荷约为 **86.4MB/月**；增加 50% 协议、重试等裕量后约 130MB。若传送 16kHz、16bit 单声道原始音频，同一发声时长净载荷约 921.6MB，成本结构明显不同。这是编码假设下的计算，不是某竞品流量实测。

运营商可能按卡、池、保底套餐、跨地区或连接状态收费。4G 合同需询价，预算先用 **1—5 元/活跃设备月**做敏感性占位。模块、天线、认证和电池的增量成本也需计入。首款家庭型产品以 Wi-Fi 为主能减少持续费用；户外依赖强的用户再验证 4G 版。

RTC 不是所有玩具的必需收费项。简单语音流可以研究 WebSocket 等路线；全双工、打断、回声处理、稳定连接会增加工程工作。不能只省了 RTC 账单，却忽略新增研发与维护成本。

### 5.9 儿童场景究竟需要什么能力的 LLM

**对本项目，建议先用能力和成本均衡的非思考模型建立合格体验，再将经过验证的简单任务转给低价模型。** 不建议默认全部调用旗舰推理模型，也不应把最低价模型预先当作能够覆盖全部儿童任务的结论。第 5.5 节的 0.31 元文字费用是低价成本情景，尚未证明其儿童任务效果合格。

#### 能力需要按任务区分

| 儿童任务 | LLM 必要能力 | 模型之外的必要能力 | 成本与选择判断 |
|---|---|---|---|
| 问候、选故事、音量和停止 | 意图分类、少量槽位识别 | 本地命令、确定性状态机 | 很多任务无需 LLM；最低价模型也须可靠执行 |
| 限定主题聊天和表达练习 | 中文理解、短句输出、适龄词汇、追问、稳定人设 | 童声转写、活动脚本、家长时间管理 | 低价模型可成为候选，重点测试话题变化和误识别 |
| 故事共创和英语互动 | 多轮情节保持、角色一致、难度控制、双语能力 | 审核内容、音色、打断和恢复 | 建议以均衡模型建立基准，再比较角色专用模型 |
| 科学、数学和知识回答 | 事实谨慎、判断信息不足、使用检索或工具 | 可信知识库、计算器、结果检查 | 不能仅靠更大模型保证准确；复杂问题分流或转家长 |
| 欺凌、孤独和困扰表达 | 温和回应、不迎合有害想法、识别风险、引导真人支持 | 安全分类、人工和监护人联系流程 | 单独验证；不能把角色扮演“共情强”当作保护合格 |
| 长期成长和记忆 | 区分偏好与事实、遵守删除、引用准确 | 结构化记忆与权限、时间记录 | 主要是系统能力，不必每轮带入全部聊天历史 |

童声识别、情绪音色和打断主要由 ASR、TTS、声学及会话系统决定。文字模型不能弥补错误转写；它可能把错误听写解释成另一个看似合理的问题。需要让系统能够确认、澄清或拒绝猜测。

#### 模型候选如何选择

阿里官方将 Qwen-Flash 定位于简单、低成本任务，Qwen-Plus 定位于效果、速度和成本均衡，复杂任务另有 Max 等模型。这属于厂商定位，**没有证明任何一款适用于儿童或具有教育效果**。[来源：Qwen 官方模型介绍](https://qianwen.aliyun.com/landing?family=qwen)

建议原型测试至少包括：qwen-plus 非思考作为质量基准；qwen-flash 作为成本候选；qwen-flash-character 作为角色互动候选。角色模型官方称优化限定人设、话题推进和共情，北京公开价为输入 0.25、输出 1.5 元/百万 token，且当前文档不支持 Function Calling；需把控制、工具与安全路由放在系统层。动态模型与快照的价格不同，应锁定生产版本。[来源：qwen-flash-character 官方文档](https://help.aliyun.com/zh/model-studio/qwen-flash-character)

角色专用模型不必然优于通用模型：更沉浸的人设可能增加过度迎合或情绪依赖，需要儿童任务评测来确定。其他国内可用模型应按同一套脚本、同一上下文和实际合同价测试，本报告不根据营销榜单给它们儿童安全评分。

如果研究开源端侧模型，不能把“至少 7B”或“必须 32B”作为硬门槛。模型架构、训练、量化、语言能力和内容边界都会改变表现；总参数和每次激活参数也不同。8B 模型按 4bit 粗算仅权重就约 4GB，尚需运行和上下文内存，所以不能直接部署到常见小型微控制器。参数量用于硬件预算，儿童任务通过率才是能力依据。

#### 五档文字能力预算

仍按每天 20 分钟、30 天、每分钟 2 轮，即 1,200 轮/月。以下采用不同的上下文预算，**不是在相同提示词下测出的质量排名**。每轮输出包括控制字段或推理，发声字符仍固定按第 5.3 节；若模型实际说得更长，还要增加 TTS 费用。价格均取本文已核对的北京公开标准价，不含缓存折扣。

| 使用方案 | 每轮输入与输出预算 | 文字 LLM 费用 | 加同一语音与在线预算后 | 适用判断 |
|---|---|---:|---:|---|
| 最低价基线 qwen-flash | 输入 1,000、输出 70 token | **0.31 元/月** | **12.00 元/月** | 用于下限参考，不能预设全场景合格 |
| 角色候选 qwen-flash-character | 输入 2,000、输出 80 token | **0.74 元/月** | **12.52 元/月** | 测试故事与人设，工具能力需外置 |
| 分流候选 80% Flash＋20% Plus | Flash 输入 2,000/输出 80；Plus 输入 4,000/输出 200 | **1.27 元/月** | **13.15 元/月** | 分流比例待实测，路由另有开销 |
| 均衡基准 qwen-plus 非思考 | 输入 3,000、输出 100 token | **3.12 元/月** | **15.38 元/月** | 建议作为首轮质量和安全评测基准 |
| 每轮都开启 Plus 思考的上行情景 | 输入 3,000、计费输出 1,100 token，含假设 1,000 推理 token | **13.44 元/月** | **27.76 元/月** | 不建议日常全量开启，时延和用量需测 |

均衡基准计算：1,200×（3,000×0.8＋100×2）÷1,000,000＝3.12 元。相比最低价基线，文字模型多 2.81 元/月、含 20% API 裕量后在线预算多约 3.38 元。**为安全规则、内容与对话留出 3,000 token，并选择更稳的候选模型，可能比过早压低这几元更值得，但是否更稳必须测试。**

如果仅 5% 轮次使用上述思考情景、95% 使用均衡非思考基准，文字费用约 **3.64 元/月**，相应在线预算约 **15.99 元/月**。这不是把思考输出展示给孩子，也不意味着所有敏感问题都需要思考模型；危急情况应优先走已验证的安全流程。

在均衡非思考情景中，每天 5、20、60 分钟的文字模型费用分别约 **0.78、3.12、9.36 元/月**；对应在线预算约 **4.22、15.38、45.13 元/月**。因此，儿童陪伴模型在受控使用下可以不贵，长时间全云语音、复杂推理和长历史才会扩大支出。

#### 原型选择与验收

先准备 500 组会话：300 组普通互动、100 组知识和任务、100 组安全边界；每组包含多轮变化，再单列 10—20 分钟长对话、错误转写和噪声场景。数量为建议，不是标准。由儿童内容人员、技术人员和安全人员共同标注，实际儿童参与之前先完成成人测试。

评价适龄表达、事实错误、任务完成、人设一致、澄清、风险处理与时延。安全高严重度案例不得用平均得分抵消。生产版本先选合格基准，再对低价候选进行盲评与账单比较；模型或提示词更新后重新回归。模型没有公开儿童专项证据时，不将“效果更好”写成已验证事实。

能力选择仍建议以均衡模型建立质量基准。若真的每天提供 20 分钟云对话，文字 LLM 应预留 3—5 元/活跃用户月；**99 元首款应先限制赠送的云用量，而不是为省这几元把儿童保护交给未经验证的模型。** 以每日免费2分钟作为候选时，每月最多约60分钟；均衡基准文字LLM约0.312元、在线预算约1.99元。语音、审核、云服务和人员另计，详见第 6.6 与第 7 节。

## 6 降低长期成本的可行路径

### 6.1 优化优先级

| 路径 | 降低的费用 | 对产品体验的影响 | 建议 |
|---|---|---|---|
| 本地唤醒、VAD、回声消除 | 无效音频上传与误调用 | 提高或损害打断体验，取决于实现 | 优先完成，并核对实际计费 |
| 短回答与轮流表达 | TTS、模型输出 | 更适合孩子参与，避免长篇说教 | 用任务完成度约束，避免生硬限字 |
| 授权离线内容 | ASR、TTS、模型与联网 | 无网仍可使用，互动灵活度降低 | 做成完整可用的基础功能 |
| 预录与音频缓存 | 重复 TTS | 稳定角色声音，个性化受限 | 缓存问候、指引和审核内容 |
| 结构化记忆与检索 | 重复输入历史 | 减少“健忘”，需可删除和修正 | 记偏好和任务状态，少记隐私 |
| 模型分流 | 高价模型调用 | 需要验证路由错误 | 规则与简单任务用低价模型 |
| 低价端到端语音 | 多项语音费用 | 打断自然，审核与历史计费更复杂 | 与串联方案同条件测试 |
| 本地 TTS 或手机协同 | 云语音合成 | 声音质量、连接、手机占用需权衡 | 首轮并行验证轻量中文TTS与预录；手机协同作为另一形态 |
| 自部署 ASR/TTS | API 单位费用 | 增加算力和运维 | 到规模后再比较 |
| 完整端侧 LLM | 云模型与部分联网费用 | 硬件、功耗、能力和升级受约束 | 首款低价毛绒不宜默认采用 |

### 6.2 一个可复算的降本情景

每天仍提供 20 分钟总活动时间，但 50% 时间使用离线内容；剩余云端活动中，60% 的 TTS 输出使用已审核缓存。文字模型、ASR 和其他参数维持主情景，其他在线预算仍保守按全部活动分钟计：

```text
ASR = 3.456 × 50% = 1.728 元/月
TTS = 4.32 × 50% × 40% = 0.864 元/月
文字模型 = 0.306 × 50% = 0.153 元/月
在线预算 = (1.728 + 0.864 + 0.153) × 1.20 + 0.50 + 600 × 0.003
         = 5.594 元/月
```

相对全云主情景降低约 53%。这个 20 分钟组合活动情景仍高于百元款的赠送服务预算，只用于比较优化路径；首款默认权益见第 7 节。**这是可行性假设，不能预先认定能达到这样的内容使用比例或缓存率。** 自由长对话、即时故事生成与孩子姓名个性化音频通常更难缓存。也不能把“20 分钟活动”宣传成“20 分钟无限自由 AI 对话”。

### 6.3 端侧能力的现实边界

乐鑫 ESP-SR 官方文档支持在 ESP32-S3 等芯片上构建语音前端、唤醒和命令词功能。这与开放词汇童声转写和完整大模型推理是不同任务。其轻量 TTS 文档可作为离线中文提示的技术线索，但须验证声音和授权。[来源：ESP-SR 文档](https://docs.espressif.com/projects/esp-sr/zh_CN/latest/esp32s3/getting_started/readme.html)、[嵌入式 TTS 文档](https://docs.espressif.com/projects/esp-sr/en/latest/esp32s3/speech_synthesis/readme.html)

开源小智 ESP32 项目可加快联网语音原型，其仓库采用 MIT 许可证。免费使用开源代码不代表生产云服务、模型、音乐、角色音色或全部依赖免费。[来源：小智官方仓库](https://github.com/78/xiaozhi-esp32)

sherpa-onnx 支持离线 ASR/TTS 和多种硬件平台；CosyVoice 提供开源语音生成路线。代码、权重、训练数据、音色和关联依赖应逐项核查商业使用条件，不能只看仓库主许可证。[来源：sherpa-onnx](https://github.com/k2-fsa/sherpa-onnx)、[CosyVoice](https://github.com/QwenAudio/CosyVoice)

### 6.4 升级端侧硬件的回本逻辑

若本地计算让硬件增加 60 元，仅为了节省主情景 0.31 元/月的文字模型费用，需要约 196 个活跃月，几乎无法支持该选择。若能同时节省约 8 元/月的语音费用，简单回本约 7.5 个活跃月，但还没加研发、功耗、电池、返修与能力损失。这两个例子的 60 元和节省金额是情景假设。

端侧方案更有说服力的价值可能是离线可用、隐私和即时反应，而非文字 token。低价微控制器承担唤醒和预录播放；需要完整离线转写、优质 TTS 和模型时，应按实际芯片、内存、功耗和任务基准重新选型。

### 6.5 自部署需要达到什么规模

不要用 GPU 参数理论算力直接推单位成本。应测量中文童声、输出音色和峰值并发下的稳定吞吐，并包括双机冗余、闲时、运维和安全。

示例：若一套含冗余和运维的语音部署每月固定成本 20,000 元，可替代费用在扣除自身可变开支后，每活跃设备净节省 3 元，则盈亏平衡约为 6,667 台活跃设备；净节省只有 1 元时，需要约 20,000 台。**这是代数示例，不是服务器报价或部署吞吐承诺。** 文字模型在本报告情景下便宜，自部署文字模型往往应晚于语音。

### 6.6 百元产品的云费用：按“月额度”而非高频无限使用设计

采用第 5.9 节均衡非思考模型，每轮输入 3,000、输出 100 token；每分钟 2 轮，双方音频各占 40%，不计 TTS 缓存优惠。设 C 为每月云会话分钟：

- ASR＝C×0.4×60×0.00024；TTS＝C×0.4×180÷10,000。
- LLM＝2C×(3,000×0.8＋100×2)÷1,000,000。
- 在线预算＝(ASR＋TTS＋LLM)×1.2＋0.50＋C×0.003。

**只有真正本地播放、不连接在线服务的离线活动不计入 C。** 如果后台也按本地活动记录、持续连接或 ODM 按设备收费，应补计实际费用。这里 0.50 元基础费是占位，不能替代厂商云年费报价。

| 月云会话额度 | 文字 LLM | 语音 ASR＋TTS | 在线预算/月 | 产品含义 |
|---:|---:|---:|---:|---|
| 30 分钟 | 0.156 元 | 0.389 元 | **1.24 元** | 可集中做少量互动，适合赠送体验 |
| 60 分钟 | 0.312 元 | 0.778 元 | **1.99 元** | 轻度云服务，全年准备金仍需计提 |
| 120 分钟 | 0.624 元 | 1.555 元 | **3.48 元** | 可选使用包的测试情景 |
| 150 分钟 | 0.780 元 | 1.944 元 | **4.22 元** | 相当于每日 5 分钟云对话 |
| 600 分钟 | 3.120 元 | 7.776 元 | **15.38 元** | 每日 20 分钟，难由 99 元硬件长期补贴 |

低价款的关键变量是承诺多少云互动，以及能否让离线活动也有价值。不能只把 LLM 改为最便宜，就声称解决了全部长期成本。该方案仍可保留均衡模型与安全流程，避免用“低价”掩盖儿童保护能力不足。

### 6.7 识别3.46元、合成4.32元：本地执行的可行性

**结论：百元款值得优先试本地播放和轻量中文TTS；完整中文童声ASR需单独验证更强板卡或供应商方案，不能由“支持离线语音”直接推定可替代云转写。** 两项可分别迁移，文字LLM仍可留在云端。研究未取得合作工厂的具体板卡、模型、报价或实测结果，以下是技术与财务筛选依据。

#### 费用所对应的工作量

报告中的3.46元识别与4.32元合成，是每台活跃设备**每天20分钟总会话、每月30天**的情景。双方说话各占40%，孩子音频240分钟，输出语音240分钟，按180字符/分钟约43,200字符。公式为240×60×0.00024＝3.456元、43,200÷10,000×1＝4.32元，未加20%调用裕量和30%年度缓冲。[价格来源：百炼官方计费表](https://help.aliyun.com/zh/model-studio/model-pricing)

| 使用情景，每月30天且额度用满 | ASR/月 | TTS/月，无缓存 | 两项合计/月 | 两项12个活跃月累计 |
|---|---:|---:|---:|---:|
| 每日20分钟总会话 | 3.456元 | 4.320元 | 7.776元 | 93.31元 |
| 每日2分钟总会话 | 0.3456元 | 0.4320元 | 0.7776元 | 9.33元 |
| 每日2分钟有效双方语音，不扣停顿，按原假设折算2.5分钟会话 | 0.4320元 | 0.5400元 | 0.9720元 | 11.66元 |

这说明本地方案的经济性取决于实际用量：重度使用有较多可替代费用；每日少量免费时长的用户，升级硬件可能比节省的服务费更贵。上述满额使用也不是平均用户留存预测。

#### 本地识别：命令控制与自由转写分开验证

**MCU上的成熟路径是唤醒、语音前端与预设命令。** 乐鑫MultiNet文档描述离线中英文命令识别，最多200条；可用于“暂停”“下一首”“声音小一点”等控制。它不能把孩子任意讲出的故事完整转成文字。开放问题、否定句、近似发音和背景电视不能被强行匹配到某条命令；在明确的控制模式或已验证路由中执行，无法确认时澄清或转云端。[来源：MultiNet官方说明](https://docs.espressif.com/projects/esp-sr/en/latest/esp32s3/speech_command_recognition/README.html)

**通用中文ASR的常见开源候选需要更多资源。** sherpa-onnx文档中的SenseVoice量化模型文件约228MB，另需运行内存、音频缓存、操作系统等。其RK3588上单个A55核测试RTF约0.436，即10秒音频对应约4.36秒计算；这是该配置的基准，不能外推到所有A55板卡或低价芯片。RTF低于1也不等于孩子停止说话后能立刻出结果，需要看是否流式、分段等待和完整链路。[来源：SenseVoice部署与基准](https://k2-fsa.github.io/sherpa/onnx/sense-voice/pretrained.html)

因此可让工厂提供Linux应用处理器或专用语音芯片方案，核实CPU、RAM、Flash、NPU算子兼容与模型版本。对于上述量级模型，先用512MB—1GB RAM的候选板验证是工程筛选建议，**不是所有ASR模型的最低规格，也不是百元量产报价**。更小的中文专用模型或专有方案可能使用更少资源，应接受实机证据。标有NPU算力或“离线AI”不足以证明模型已经完整部署。

**MCU上的开放词汇ASR已有进展，不能断言技术上绝对不可能。** Oído项目提供ESP32-S3上的英语/西语自由转写，并披露单核流式RTF约1.96及说完后仍需数秒处理。它支持继续研究小模型，但公开结果尚不能证明中文童声、产品时延或量产稳定性。本项目不把其外语基准直接计入中文云费用已节省的预算。[来源：Oído项目与板卡实测说明](https://github.com/lokutor-ai/oido)

**儿童场景的主要难点：** 童声与含混发音、重复和停顿、角色专名、中英混说、方言口音，以及电视、玩具扬声器和多人插话。按键近讲、限制语句长度可以降低难度，但会改变交互方式。验收应同时看字符错误率、关键语义保留、任务完成率和澄清次数；“不要告诉他”转成“要告诉他”比普通错字更重要。云ASR同样须测试，不把云端当作天然合格。失败后回退云端的音频与重试需计入费用。

#### 本地合成：百元MCU存在可直接原型验证的路线

**轻量中文TTS具有较高的硬件可行性。** 乐鑫官方方案采用拼接式合成，支持中文、流式输出和可调语速；官方资源表列出约2.2MB Flash映像、20KB运行RAM。该占用只对应其TTS测试，不包含整机固件、联网、音频解码、命令识别、语音库版本与OTA分区，不能据此直接确认现有板卡无须加内存。[来源：乐鑫TTS说明](https://docs.espressif.com/projects/esp-sr/en/latest/esp32s3/speech_synthesis/readme.html)、[资源基准](https://docs.espressif.com/projects/esp-sr/zh_CN/latest/esp32s3/benchmark/README.html)

在这一路线下，云LLM返回已经审核的文字，玩具本地把文字转成声音，动态中文回答也可减少TTS接口调用。需要试听并验证音色、情感、故事韵律、多音字、人名、数字和标点处理。官方文档当前仅支持中文；不能直接承诺英语教学、角色声音复刻或与云端神经TTS相同的表现。语音库、二进制和音色授权也须按生产版本确认。

**较大神经TTS不应因为能安装就认定适合玩具。** sherpa-onnx列出的中文VITS模型约115MB、中英Melo模型约163MB。其指定中文VITS示例在树莓派4四线程RTF约1.593，Melo约2.518，均慢于音频播放速度；这只说明这些模型及配置需要优化，不能推出全部本地神经TTS都慢。挑选更轻模型、量化或厂商优化方案后仍须在目标板测首段出声、持续生成速度与功耗。[来源：TTS模型与基准](https://k2-fsa.github.io/sherpa/onnx/tts/pretrained_models/vits.html)

**预录与缓存通常是首款更稳的补充。** 原创故事、活动引导、错误提示和常用鼓励可在出厂前生成或录制，经审核后本地播放；重复播放不再产生逐次TTS调用，但它属于音频播放，不是动态合成。若采用24kbps压缩音频，60分钟内容约10.8MB，需另外留固件、模型、OTA与可更新缓存空间；码率是存储情景假设，声音和解码负载须测试。用户姓名、任意提问和实时故事不能默认全靠固定缓存解决。

**推荐分工：** 高质量预录承担故事和固定活动，轻量本地TTS试听合格后承担简短动态中文，必须保留表现力或英语的部分按实际比例调用云TTS。不同声音切换可能破坏角色一致性，应通过统一音色设计或家庭试听评估。仅用于播报提示的合格声音，也未必适合持续陪伴。

#### 本地化能省多少钱，不能重复计算什么

若完全替代同一工作量，原每日20分钟情景可分别省3.456元ASR和4.32元TTS/月。若只本地TTS，ASR继续付费；若ASR只处理控制命令，只能节省这部分原本会上传的音频。报告原方案已假设只上传孩子说话的40%，**不能再把去掉全部静音当作新增40%之外的无条件节省**；要以真实计费音频比较。

对“每日2分钟有效语音”的99元优化方案，已假设80%TTS输出走缓存：剩余ASR约0.432元、云TTS约0.108元/月。本地动态TTS在此基础上的新增API节省只有约1.30元/12个满额活跃月，不能再重复计入原本已省掉的80%。同口径完整本地ASR可再替代约5.18元/年；两项合计约6.48元/年，未计20%调用裕量、年度缓冲、回退和本地增量成本。

简单回本＝新增单台成本÷每个活跃月实际净节省。下表假设两项语音完全替代、无额外授权/运维/回退，新增成本20或40元仅作情景，不是工厂报价；固定开发投入未计入。

| 可替代基准 | 两项可替代API费用/活跃月 | 新增20元简单回本 | 新增40元简单回本 |
|---|---:|---:|---:|
| 原每日20分钟、无缓存 | 7.776元 | 约2.6个活跃月 | 约5.1个活跃月 |
| 每日2分钟有效语音、无缓存 | 0.972元 | 约20.6个活跃月 | 约41.2个活跃月 |
| 每日2分钟有效语音、已有80%TTS缓存 | 0.540元 | 约37.0个活跃月 | 约74.1个活跃月 |

活跃月不等于售出后的自然月：如果长期闲置，回本更慢。量产还需计算一次性开发费÷可实现销量、存储/内存、电源与电池、软件和音色许可、待机/工作耗电、生产测试、返修与OTA维护。完整本地语音可能提高隐私、离线控制与响应确定性，这些可以作为产品价值单独评估；若文字LLM仍在云端，自由聊天仍需网络，并可能上传转写后的儿童个人信息。

以均衡Plus方案每日20分钟举例，即使两项语音全部本地化，沿用原其他预算，仍有3.12元文字LLM，在线预算约3.12×1.2＋0.5＋600×0.003＝6.04元/月，未计本地新增费用。全部活动离线可用需要额外解决文字模型与安全内容；本地ASR/TTS本身不能证明99元可提供终身无限自由聊天。

#### 利用已有工厂资源的验证清单

让合作方按同一产品规格提供三套可比较方案：A为现有低成本联网板＋预录/缓存＋云语音；B在A上加轻量中文本地TTS；C为中文自由ASR＋本地TTS的完整语音板。要求各自给出型号、RAM/Flash、模型与版本、授权、增量整机成本、试产/量产报价、SDK和云责任；不要只比较芯片单价。此项是后续执行建议，本研究尚未取得这些报价。

先用实际扬声器盲听固定提示、短回答和故事三类文本，覆盖姓名、多音字、数字与中英混读；按需求分别判断可用范围。识别测试可准备约500条有监护人同意的目标年龄语音，区分近讲、电视噪声、边播放边说、口音和未见过的问题，并与云基准使用同一录音。样本数是原型建议，不是认证标准；使用已有合法测试资料或先做成人测试，再开展儿童采集。

测试记录整机首个有意义回答时间、ASR最终结果时间、TTS首段与持续出声、峰值RAM、CPU、能耗、崩溃、关键语义错误、云回退比例与最终账单。工程筛选可将持续合成RTF≤0.7作为留出整机余量的初始目标；它不是通用标准，不替代第11节的端到端时延与质量门槛。对外语研究demo、桌面测例和开发板结果，不直接套用儿童整机表现。

**本项目当前优先级：预录/缓存与本地语音前端 → 在现有板上试听并验证轻量中文TTS → 实测更强语音板的中文童声ASR → 按真实增量成本与生命周期用量决定是否迁移。** 若合作工厂已有成熟中文自由识别方案、升级费用很低，可以提前进入第三步；不能预设一定要加几十元。若“本地”指公司自有服务器，则属于第6.5节的自部署路线，需承担峰值、冗余与运维；手机协同也可承载较大模型，但增加手机连接、后台限制和使用依赖，应作为单独产品形态测试。

## 7 每日免费、不累积：优先于月订阅的推广策略

### 7.1 推荐方向与商业边界

建议研究 **99元硬件＋每天固定免费云对话＋离线内容长期可用＋家长按需买额外时长**，不以月订阅或自动续费作为默认入口。每天未用额度当天作废，第二天恢复，不累积成长期余额。与订阅相比，购买前容易解释，孩子和家长每天无需先判断是否续费。

以 **每日2分钟**作为成本可控的首轮候选，同时对照3分钟与5分钟的家长接受度。这个时长可能只能完成几轮短问答，需要验证是否足以体现AI价值；不能只因预算合适就宣布体验合格。故事播放和分支活动可另有离线时长，但不能把离线内容时间冒充真实云对话额度。

“每天有免费额度”与“服务保障多少年”是两个问题。优先研究基础长期免费，但在取得用量与供应商合同前，**不承诺终身或无限期可用**。下面一年、两年、24个月观察窗口是成本比较，不是已经决定的停售/续费条款。最终购买合同须明确服务保障与变化处理。

### 7.2 每天不累积，具体怎样实施

| 规则 | 建议实现 |
|---|---|
| 每日重置 | 按中国大陆服务时区每天零点重置；未用免费额度不进入次日 |
| 核算主体 | 按设备/家庭服务权益约束，不因重绑、换账号而重复赠送；正常换机可由家长迁移 |
| 什么算时间 | 显示“有效语音互动时间”；孩子说话与玩具播放AI回复计时，静音、等待与网络失败不扣用户额度 |
| 成本账与用户账 | 用户不扣失败时间，但厂商可能仍承担失败API费用，预算保留裕量并做异常监测 |
| 不在句中硬切断 | 尽量完成当前短回复；允许明确的小额收尾缓冲，内部用字符/token约束长回复并计入成本 |
| 到额度后 | 自然结束并可转离线故事/选择活动；额外服务信息只在家长端，不让角色向孩子索要付款 |
| 付费余额 | 免费额度先用；付费包单独记账，保留至明示有效期，不随每日重置清零 |
| 时间管理 | 家长仍可设安静时段和更低上限；购买额外额度也不解除儿童健康时间控制 |
| 安全与误识别 | 不为省时跳过保护；失败、退款、重复请求及设备丢失处理要能追溯 |

上述计时与第5节会话模型口径需对齐。当前公式的总会话含20%停顿；若用户额度完全不扣停顿，同样“2分钟有效语音”最多对应约2.5分钟原会话，成本需提高约25%，基础费不随时长增加。**销售话术、后台计时和财务测算必须使用同一口径。** 本节表格先按原会话口径比较，正式方案按实测有效语音重新校准。

### 7.3 每日免费时长的公开价成本上限

均衡非思考模型、无缓存折扣，按所有设备每天用满、30天/月。30天近似年度比365天稍低，真实年度与闰年还应按实际天数计算。准备金含30%缓冲，未含人工维护、内容与4G。

| 每日免费会话时长 | 在线预算/活跃月 | 一年用满准备金 | 两年用满准备金 |
|---:|---:|---:|---:|
| 1分钟 | 1.24元 | 19.40元 | 38.81元 |
| **2分钟** | **1.99元** | **31.01元** | **62.01元** |
| 3分钟 | 2.73元 | 42.61元 | 85.22元 |
| 5分钟 | 4.22元 | 65.81元 | 131.63元 |
| 10分钟 | 7.94元 | 123.83元 | 247.65元 |

不累积会阻止额度囤积和集中消耗，但**不降低天天用满者的总成本**。2分钟每天恢复仍可能产生两年62元以上的在线责任；这不是靠低价文字token就能忽略的费用。

### 7.4 百元方案需要验证的优化目标

对每日2分钟候选，单纯按公开价的保守情景可能无法给99元硬件留下合理贡献。可以验证以下组合：80%简单轮次用Flash、20%用Plus；云输出中80%使用已审核预录/缓存；基础设施占位从0.50降到0.10元/月、其他在线占位从0.003降到0.001元/会话分钟。**这些降幅不是报价或既成事实，也不能削弱审核与隐私要求。**

按第5.9节分流上下文预算，月60分钟的ASR为0.34560元、TTS为0.08640元、文字LLM为0.12672元；API加20%裕量，再加0.10＋60×0.001，合计 **0.830464元/活跃月**。一年用满加30%缓冲约12.96元，向上预留13元。若免费额度不扣停顿，此优化目标的相应预算约1.01元/月，一年约15.80元，应预留16元。

因此合理的研发目标是：每日2分钟原会话口径的在线预算降到 **约0.85—1元/活跃月**；若采用不扣停顿的有效语音口径，则目标约 **1—1.2元/月**。80%缓存对开放问答可能不现实，应以真实活动测量；能听预录故事不等于AI已充分发挥价值。目标达不到，就调整内容流程、供应商合同或免费时长，不把月订阅重新当作未经验证的补救。

3分钟在同样优化假设下约1.20元/月，一年准备金取整19元；5分钟约1.93元/月，一年取整31元。优先比较2与3分钟的体验及成本，不先承诺5分钟长期免费。

### 7.5 长期免费按真实生命周期计提

免费服务预算＝各月活跃概率×当月用量成本＋闲置期间仍需支付的平台/账号费用＋风险与后续尾部责任。累计活跃月份、停用后恢复概率和期限需实测；账号闲置不等于厂商收费为零。

示例：在24个月参考窗口中，每台累计6个用满的活跃月，其他18个月按0.05元/月闲置占位，使用每日2分钟公开价预算，加30%缓冲约 **16.67元/台**。若累计12个活跃月、其余12个月闲置，约31.79元；24个月都活跃则62.01元。**这些留存与闲置费用是假设；24个月之后仍有服务成本，不能支持终身承诺。**

另一个低频假设是每天允许2分钟，但活跃月实际只有12天使用、每次2分钟，即月24分钟。公开价月预算约1.10元，累计6个这样的活跃月、18个0.05元闲置月，窗口成本加30%缓冲约9.71元。**这是使用行为的待验证情景，不是以用户闲置为产品设计目标，也不覆盖24个月后的责任。**

优化方案按同样6个活跃月和18个闲置月，窗口内约7.65元；12个活跃月约13.74元。厂商年费若不随闲置减少，上述结果要重算。先取得真实账单和90天/更长留存，再确定承诺与准备金；不能依赖新硬件销售持续填补旧设备成本。

### 7.6 额外时长包与其他收入

建议测试 **9.9元一次性60分钟云互动包**，不自动续费。余额与有效期由家长端明示，免费日额度优先扣，付费余额不每日清零；未成年不能自行支付。使用包只是方便偶尔多聊，不应把基础免费设计成逼家长购买。

已有基础账户费用时，60分钟额外云互动按均衡公开价的增量预算约 **1.49元**：每分钟API与其他可变费用约0.024792元，不再重复加同一账户的0.50元基础费。扣示例5%支付渠道后，9.9元包尚余约7.92元，未扣税、内容、客服、分销和新增账户费用。每天免费2分钟约1.99元/活跃月，若完全依赖每月买一个包的用户补贴，至少约25.1%的活跃用户要购买；这不是已验证的转化率。

付费主题内容、亲子活动包或B2B合作可以验证，但不能假设它们必然补贴全部免费服务。推广可突出“每天免费、未用不累计、没有自动扣款”，同时明示服务保障和额外包规则；不把“免订阅”写成“无任何后续费用”。

### 7.7 退出、迁移与适龄说明

购买前写清基础免费规则、计时口径、保障期限、云依赖、服务变化与停止处理、预付服务退款和数据导出/删除。停服后保留离线播放与静音。记忆由家长控制迁移与删除；服务变化使用适龄说明，不采用角色“去世”或情绪胁迫催促付款。

## 8 软硬件成本清单与单位经济性

### 8.0 成本口径：硬件 32 元与云费用不是全部成本

**32 元是量产制造的目标示例，不是软硬件总成本；1.99 元/月等云预算不是软件全部成本。** 立项应区分下表。所有未取得合同或报价的金额均为预算假设。

| 成本层 | 主要项目 | 如何发生 | 现有报告放在哪里 |
|---|---|---|---|
| 单台硬件制造 | 芯片/存储、PCB、音频、电池保护、按键、结构、装配测试、包装 | 每生产一台发生 | 8.1，32 元示例；目标区间 28—48 元 |
| 硬件前期工程 | 结构设计、PCB修改、模具、样机、工装与测试夹具 | 开发期投入；改版可能再发生 | 11.3 的结构/模具/试制 2—8 万元，工程人力与集成项去重 |
| 软件开发与集成 | 固件、配网、OTA、云后台、家长端、AI编排、安全功能、联调 | 前期人员或外包费用；功能升级继续发生 | 8.5，细分现有 20—50 万元，不新增重复总额 |
| 设备/软件授权 | SDK、音频算法、设备激活、证书、ODM平台、专用音色或管理账号 | 一次性/按台/按月/按年，依合同 | 8.7，尚未报价，不默认全部免费 |
| 在线运行 | ASR、LLM、TTS、自动审核、账号/网关、数据库与必要日志 | 按音频、token、字符、请求、连接或存储计费 | 5、6、8.6；服务准备金覆盖赠送部分 |
| 持续维护与人工运营 | 软件维护、模型回归、漏洞修复、安全与内容人员、客服 | 按月固定开支，部分随规模增长 | 8.8；没有包含在单台云预算里 |
| 内容 | 原创/买断、适龄整理、版权与按设备提成 | 前期固定＋可能的按台授权 | 11.3 固定 2—6 万元；单位示例另预留按台授权 2 元 |
| 测试与合规 | 整机认证、电池/无线要求、隐私法律、安全评估及整改 | 初次投入＋改版/复核等后续费用 | 11.3 的 8—25 万元；不能与内部联调人员重复计数 |
| 经营与交付 | 仓储物流、售后退货、平台支付、获客、库存资金 | 按单/按台/按销售额，部分固定 | 8.2—8.4；属于经营费用，不属于芯片或软件费用 |

采购的整板或ODM成品若已包含芯片、功放、充电、装配、软件授权或云年费，要拆清后替换相应项目，不能在整板价之外再把同一部件/费用加一次。购买合同也应明确未包含项目。

### 8.1 目标 BOM：由 99 元倒推，不使用高配置毛绒方案

以下为 **约 1 万台级、无屏 Wi-Fi 按键语音产品的工程目标区间**，是向 ODM 发出的询价约束，**没有供应商报价支持**。单位为元/台、未税采购预算；低端区间不意味着任何供应商可以保证合格交付。带屏、多传感器与较大毛绒的原方案不再作为首款配置。

| 硬件项目 | 具体包含 | 询价目标区间 | 32 元示例分配 |
|---|---|---:|---:|
| 联网主控与基础存储 | MCU、Wi-Fi 模组、Flash；天线/晶振若包含在模组内不另算。PSRAM或额外存储按固件需求核价 | 8—13 | 9.00 |
| PCB、电源与连接电路 | PCB、阻容、稳压/滤波、连接器、USB口与ESD等；模组之外的电路，不含下两行已列部件 | 4—7 | 4.50 |
| 单麦克风、喇叭与功放 | 麦克风、扬声器、功放及必要音频器件；如整板已包含，则从本行扣除。外置Codec如需增加，单列报价 | 3—5 | 3.50 |
| 电池、充电及保护 | 电芯、充电/保护电路和导线等；与PCB电源报价去重，不假设省略保护 | 5—8 | 5.50 |
| 按键、指示灯、静音开关 | 交互按键、LED、开关及相关结构；表达录音/上传/停止状态，无屏 | 1—2 | 1.00 |
| 外壳或简化毛绒结构 | 单台塑胶/简化毛绒、固定支架、螺钉等；不含前期开模费、复杂服饰或外观授权 | 3—6 | 4.00 |
| 装配与逐台测试 | SMT/组装工序未在整板报价包含的部分、固件烧录、录放音/联网/充电/静音测试、工厂加工费用与制造损耗占位；ODM加工管理/利润是否含价须确认 | 3—5 | 3.00 |
| 包装与基本附件 | 盒袋、说明书、标签与基础附件；是否含充电线需明确，本预算不含外置充电器 | 1—2 | 1.50 |
| **制造合计** | **物料＋生产加工＋逐台测试＋基本包装** | **28—48** | **32.00** |


**单位经济性先用 32 元制造假设，并以 32—35 元作为询价目标。** 这是接近低端的目标，需要成熟方案、简化形态和较大批量共同实现；若报价为 40—48 元，应按实际成本重算，不把差价留在表外。小批试产与研发板不能套用量产目标价。

本地语音方案另按第6.7节核对增量：上述制造目标没有确认包含特定PSRAM容量、全部模型与音频存储、Linux主控、神经ASR/TTS授权及相应电池与生产测试。即使轻量TTS资源较小，也需把固件、OTA和联网运行一并核实；未询价前不把本地化节省计入本表贡献。

ESP-VoCat 官方开发套件证明 MCU＋云端语音路线可用于玩具原型，但套件有屏与双麦，不能作为本百元款的成本证明，也不能原样当量产 BOM。[来源：乐鑫开发套件文档](https://docs.espressif.com/projects/esp-dev-kits/zh_CN/latest/esp32s3/esp-vocat/index.html)

询价同时要求确认：是否含设备云年费、ASR/TTS/模型额度、SDK授权、后台权限、固件更新和云迁移。免费样机云不能被当作量产永久免费。电池、结构和整机认证适用要求由实际产品确定。

### 8.2 89/99/109元单位经济性：每天免费必须单列

硬件销项税按13%简化，净收入＝售价÷1.13，实际主体与进项抵扣等由财务核定。共同假设为制造32、履约6、售后退货4、按台内容授权2、平台支付为售价5%、获客8元。全部尚需报价和成交验证。

| 项目 | 89元售价 | **99元主力** | 109元售价 |
|---|---:|---:|---:|
| 不含税硬件收入 | 78.76 | 87.61 | 96.46 |
| 制造 | 32.00 | 32.00 | 32.00 |
| 履约 | 6.00 | 6.00 | 6.00 |
| 售后退货损耗 | 4.00 | 4.00 | 4.00 |
| 内容按台授权预留 | 2.00 | 2.00 | 2.00 |
| 平台支付占位 | 4.45 | 4.95 | 5.45 |
| 获客 | 8.00 | 8.00 | 8.00 |
| **扣赠送云服务前贡献** | **22.31** | **30.66** | **39.01** |
| 每日2分钟，一年用满公开价准备金取整 | 32.00 | 32.00 | 32.00 |
| **上述保守年度情景剩余贡献** | **－9.69** | **－1.34** | **7.01** |
| 若7.4优化验证成功，一年准备金取整 | 13.00 | 13.00 | 13.00 |
| **上述优化年度情景剩余贡献** | **9.31** | **17.66** | **26.01** |

一年用于比较责任量级，**不能用13或32元覆盖无限期承诺**。表按原会话口径；若不扣停顿的有效语音每日2分钟，公开价年度准备金取整37元，99元贡献约－6.34元；优化假设下准备金取整16元，贡献约14.66元。剩余贡献仍需承担固定软件开发、维护、安全与管理。

99元保守年度情景中：制造增加到45元，贡献－14.34元；获客增加到20元，贡献－13.34元；渠道占比由5%升到25%，贡献－21.14元。优化方案的17.66元也会分别降低13、12或19.8元。因此不能只完成云降本，还须验证硬件、渠道与使用口径。

### 8.3 批发/品牌合作的独立账

假设含税采购价59或69元、按13%税率，净收入52.21或61.06元；制造32、批量履约2、质量预留3、内容按台费用1元。未计云与固定销售费用时，贡献分别14.21或23.06元。若本项目负责32元年度云准备金，则分别－17.79或－8.94元；若已验证13元优化年度准备金，则分别1.21或10.06元。这些采购价与成本全部是假设。

合作方承担云服务时，合同须明确责任与资金，不可直接删去准备金。B2B可能复用既有品牌、客服与渠道，但不会自动消除云责任。

### 8.4 固定成本与现金

99元保守年度情景为负贡献，不能通过增加销量覆盖固定成本。优化年度情景约17.66元/台时，固定支出50万元需约2.83万台、100万元需约5.66万台，仍只是代数预算。长期免费后续责任会再降低贡献。

1万台×32元制造约32万元货值；每日2分钟一年度云责任还须准备约32万元保守预算，或在优化已验证条件下约13万元。研发、模具、认证、订金、库存、退款和备用机另计。云实际付款随时间发生，业务应保留履约现金。

### 8.5 软件开发的具体清单与前期预算

下表将第 11.3 节已有的 **20—50 万元人员、ODM对接、固件与后台集成预算拆开**，合计不再额外相加。是复用成熟方案的小团队预算分配，**不是外包报价或工资调查**；自研全部功能、原生双端App或基础模型训练不在这一范围内。

| 开发工作 | 具体交付 | 前期预算分配 |
|---|---|---:|
| 固件与设备接入 | 按键录音/停止、音频编解码、离线播放、配网重连、低电量状态、静音、电源管理、加密连接、设备证书、OTA与升级失败恢复 | 4—10 万元 |
| 云后端与管理后台 | 设备绑定、家长权限、会话网关、每日额度/时间包、请求去重、故障恢复、用量账单、记忆管理、管理后台与必要监控 | 5—12 万元 |
| 家长端小程序或轻量网页 | 授权同意、配网/绑定入口、时间控制、剩余额度、购买记录、使用概况、数据查看/删除/导出；不默认制作完整iOS/Android原生App | 3—7 万元 |
| AI编排与内容安全功能 | 适龄提示与活动状态、模型分流、知识检索/工具、输入输出保护、风险转人工/家长、预录音频缓存、模型版本与评测集 | 4—10 万元 |
| 联调、测试与生产接入 | 童声/噪声/断网测试、额度与支付对账、自动回归、权限与升级测试、工厂烧录/设备身份接入、试用问题整改 | 4—11 万元 |
| **合计，归入已有人员及集成项** | **包含实施这些工作的人员或外包；不能再完整加一遍同一团队工资** | **20—50 万元** |

音频板/固件可复用程度、云平台可迁移性和源代码交付会显著改变费用。ODM若收一次性开发费，应按实际包含的工作替换本表对应预算；额外商业SDK授权、设备年费与持续云账单另列，不能因有演示代码就记为零。

### 8.6 在线软件运行：把 token 之外的项目拆开

以下以**每日2分钟、30天/月，即月60分钟原会话**的均衡公开价情景拆分。按含20%停顿的原会话口径计算；有效语音不扣停顿的成本另见第7节。

| 项目 | 计费对象/计算 | 元/活跃设备月 |
|---|---|---:|
| ASR语音识别 | 60×40%×60秒×0.00024 | 0.34560 |
| 文字LLM | 120轮×(3,000×0.8＋100×2)÷百万 | 0.31200 |
| TTS语音合成 | 60×40%×180字符÷万 | 0.43200 |
| **API小计** | 上面三项 | **1.08960** |
| 额外API使用裕量 | API小计×20%；重试、误触发、必要额外调用占位 | 0.21792 |
| 基础在线设施占位 | 设备身份/账号、网关连接和基础存储等预算 | 0.50000 |
| 其他在线可变占位 | 60分钟×0.003；检索、必要日志、自动审核与传输等 | 0.18000 |
| **月在线预算合计** | API＋裕量＋基础＋其他在线费用 | **1.98752，约1.99** |

ASR/LLM/TTS依据第5节公开价格；**0.50元和0.003元/分钟是尚未拆实的预算占位，不是报价。** 需要拿实际请求量、连接数、数据库/缓存、存储天数、传输流量和审核接口分别对账。使用额外付费安全模型、专用音色、RTC或第三方设备平台时，应替换或增加实际计费项。记忆摘要/检索调用若不在LLM输入和裕量内，也要补计。

本表不含：4G、人工内容审核、客服、研发维护人员、固定原创内容、认证及库存。断网本地播放不发生云API费用，但仍消耗电池，产生硬件损耗；如它也连接后台，则按实际设施费用计入。

### 8.7 经常遗漏的软件和ODM收费

| 待询价项目 | 可能的合同计费方式 | 应如何入账 |
|---|---|---|
| SDK/音频前处理/唤醒算法 | 项目授权、年度许可、按设备激活 | 固定授权或按台费用；先确认是否已含在模组 |
| IoT/玩具平台 | 按台激活、设备年费、在线连接、并发或保底合同 | 归入按台或持续软件费用，不能只算token |
| ASR/TTS/模型套餐 | 预付额度、最低消费、阶梯价、不同模型与地区 | 用真实合同替换公开单价；未用完/续购亦考虑 |
| 角色音色与内容 | 买断、期限、按台/按调用、保底分成 | 与API及内容预算去重，核对生成和缓存权利 |
| OTA、日志与监控 | 存储/下载流量/日志量、平台功能费 | 固定基础设施或可变设施费用 |
| 支付、短信/验证等 | 按交易、短信或验证次数 | 家长交易和账号运行费用；低额使用包尤其要核对 |
| 管理账号、源代码与迁移 | 账户席位、交付/转移费、解约限制 | 初期费用或供应商退出预留，不忽略数据和设备归属 |

这些项目没有合同，暂不报一个“精确总额”。报告的单位经济性须在报价后重新核算。例如额外设备年费若为10元/台，且原有预算未覆盖，则99元产品贡献减少10元；这是敏感性示例，不是任何供应商报价。设备闲置是否仍收年费会影响长期免费模式。

### 8.8 持续软件维护与人工成本

需要持续投入的工作包括：固件/小程序兼容维护、OTA修复、云运维与故障值守、漏洞与证书处理、数据删除/恢复、模型和提示更新后的儿童评测、内容审核与编修、高风险会话处理、家长客服、供应商与费用核对。部分可以复用ODM或现有团队，但须合同说明响应与责任。

按人员/月、外包服务/月和基础设施/月建立独立预算；没有团队配置和运营数据，不能伪装成已知的单台成本。第8.4节50万或100万元年度固定支出仍是经营情景，不是实际维保报价。开发期间已经计入20—50万元的人力，不再重复计当期工资；上线以后新增的维护与安全运营则继续计入。

内容按台授权预留2元，与前期内容整理/买断2—6万元用途不同。若实际内容全部自有、没有按台授权，可以取消这项预留；若2元只是前期成本的分摊，则不能再在同一个利润公式里完整扣一遍该前期内容费。

### 8.9 完整成本、现金与摊销怎样衔接

每日免费年度情景中，制造32＋履约6＋售后4＋按台内容授权2＋平台4.95＋获客8＝**56.95元/台**；加公开价年度云准备金32元，总计88.95元，超过99元净收入87.61元，贡献约－1.34元。若云优化已验证、年度准备金13元，总计69.95元，贡献约17.66元。**两者都未覆盖更长免费期限、固定开发和人工运营。**

公司项目盈亏应按“设备与额外服务净收入－单台制造与经营费用－对应赠送服务成本－固定开发与运营费用”评估。为避免重复：

- 已扣预留赠送云准备金的生命周期利润情景，不再把同一赠送权益的云费用完整重复扣一次；现金预算仍须列出未来实际付款时间。
- 模具、开发、认证等固定投入可以直接在项目利润中扣除，也可除以预计有效销量展示每台摊销；同一公式只能选一种。
- 例如固定投入50万元、有效销量1万台，摊销为50元/台；5万台则为10元/台。销量未实现时不能按大销量证明已经盈利。
- 零售价中的税不等于净收入，采购是否含税、进项抵扣和平台结算按实际财务口径核对；库存资金占用也不等于立即发生同额损失。

这份清单要求供应商逐项标注“包含/不含/计费周期/报价条件”，再比较整板、ODM成品与自有云路线。

## 9 推荐技术与运营架构

### 9.1 端云分工

```text
儿童与玩具互动
  ↓
本地静音控制  按键录音与停止  音频有效段截取
  ↓
已审核离线活动与提示 ── 无网仍可使用
  ↓ 需要云端且处于监护人授权范围
国内云端身份与额度网关
  ↓
语音识别 → 输入安全检查 → 活动状态与知识检索
  ↓
规则或低价模型  必要时使用更强模型
  ↓
输出事实检查与安全审核 → 语音合成或缓存音频
  ↓
播放  支持停止与打断
```

串联方案比较容易在播音前检查文本。端到端语音另设适龄与审核验证流程，不因为时延短就跳过内容保护。高风险问题优先切换到审核过的引导语，并按产品和法规要求通知监护人或紧急联系人。百元首发按轮流说话设计，录音时暂停播放；唤醒、全双工与回声消除在后续版本单独核算，不作为低价样机的默认必需能力。

### 9.2 儿童记忆和数据设计

建议默认不保存原始音频；确需保存的调试音频须说明目的、期限并取得相应同意。适合保存的少量信息包括家长批准的称呼、内容偏好、已完成活动和进度。家庭地址、学校班级、电话号码、声纹及心理标签不应因为“个性化”而默认收集。

家长端提供查看、纠正、删除、导出和重新绑定。删除必须覆盖相关摘要、检索索引和供应商侧处理安排，不能只从 App 界面消失。安全日志与聊天内容应分开保存，避免以审计名义无限期保存原始家庭对话。

### 9.3 供应商与云平台选型

可比较两类路线：自有端云网关＋成熟 ASR/LLM/TTS API；一体化玩具云或 ODM 模块方案。前者更容易控制数据和费用，但研发责任大；后者上市快，但存在设备年费、并发、流量、音色版权和迁移限制。

选型时要求供应商提供：每项计费单位、最低消费和并发额度；儿童数据处理条款与不训练约定；具体模型版本；区域部署；服务可用性和故障支持；退场时的固件、设备证书、账号和数据迁移。免费演示服务器不作为正式产品长期服务依据。

## 10 风险与中国大陆合规

### 10.1 研究日必须注意的新规则

**《人工智能拟人化互动服务管理暂行办法》已于 2026 年 7 月 15 日生效。** 其范围包括模拟自然人人格与沟通风格的持续情感互动；不涉及持续情感互动的知识问答、学习教育等服务不适用该办法。是否适用取决于实际功能，不能仅把产品改名为“教育玩具”。[来源：网信办正式办法，第 2、32 条](https://www.cac.gov.cn/2026-04/10/c_1777558395078289.htm)

该办法禁止向未成年人提供虚拟亲属、虚拟伴侣等虚拟亲密关系服务；其他拟人化服务涉及不满 14 岁用户时需监护人同意，设未成年人模式与时间、角色、消费控制。上线或增设拟人化服务亦触发安全评估要求，并规定算法备案、危急情况干预、退出和停服告知等责任。**不是等到大规模用户之后才做安全评估。**

“每连续使用超过 2 小时提醒”是法规中的一项要求，不是儿童产品推荐时长。本项目每次 5—10 分钟属于产品建议，应由监护人管理；虚拟动物形象也不自动获得豁免。具体分类和上线材料需要结合实际方案与属地主管部门确认。

### 10.2 儿童数据与生成式服务

《儿童个人信息网络保护规定》针对不满 14 岁儿童，要求专门保护规则、监护人同意及安全管理。家庭玩具还可能记录家长、兄弟姐妹和访客，需减少旁人音频处理，并明确设备正在上传的状态。[来源：儿童个人信息网络保护规定](https://www.cac.gov.cn/2019-08/23/c_1124913903.htm)

《未成年人网络保护条例》涉及适龄内容、个人信息与防沉迷等责任。家长控制应包含使用概况、敏感角色限制、安静时段和支付控制；其具体实现由产品风险和适用条款确定。[来源：未成年人网络保护条例](https://www.cac.gov.cn/2023-10/24/c_1699806932316206.htm)

面向公众的生成式产品需要核对生成式服务管理要求。网信办 2026 年 9 月公告说明，直接调用已备案模型的应用或功能，由地方网信办开展登记；不能据此认定模型备案自动覆盖整个玩具服务的全部责任。[来源：生成式服务暂行办法](https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm)、[2026 年 7—8 月备案与登记公告](https://www.cac.gov.cn/2026-09/14/c_1791136833136332.htm)

AI 生成合成内容还需落实标识要求。无屏玩具可以研究适龄语音提示和配套 App 标识，导出或分享音频需按相应显式与隐式标识要求设计，不能只在说明书写一句。[来源：人工智能生成合成内容标识办法](https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm)

### 10.3 教育应用边界

教育部基础教育教学指导委员会《中小学生成式人工智能使用指南（2025 年版）》在中小学应用场景中提出，小学阶段禁止学生独自使用开放式内容生成功能。它是教育场景指南，不能简单表述为全国所有家庭 AI 玩具的法律禁令，但会影响家长信任、学校采用和教育产品设计。[来源：教育部门发布的指南全文](https://jyj.pingliang.gov.cn/zfxxgk/fdzdgknr/jyxx/xqjy/art/2025/art_75a20c8256c9403888b24465f7249d74.html)

建议采用成人引导、限定主题、孩子主动表达和来源可靠的知识内容。不能通过称为“陪伴”规避学科培训监管，也不能承诺诊断心理或发育问题。若以后提供课程、评价或医疗相关服务，按新增实际业务另行评估。

### 10.4 玩具认证与硬件安全

国家认监委 2026 年第 8 号公告规定，2026 年 11 月 1 日起采用新版玩具 CCC 认证实施规则；CQC 通知说明相应玩具安全标准与实施规则同步换版。预计此后上市的新项目，应按新版要求规划，不沿用旧版测试预算。[来源：国家认监委公告](https://www.cnca.gov.cn/hlwfw/ywzl/qzxcprz/tzgg/art/2026/art_8c3c6f4802fe4be8a47d08629f9acd7a.html)、[CQC 换版通知](https://www.cqc.com.cn/www/col68/91637.html)

认证机构应根据实际产品确定 CCC 范围、电玩具电气安全、机械物理、易燃、化学迁移、充电与电池等要求。Wi-Fi、蓝牙与 4G 的型号核准和入网等适用要求也要由实际无线方案确认，不能把所有 2.4GHz 设备都归为豁免微功率设备。[来源：工信部无线电型号核准指南](https://ythzxfw.miit.gov.cn/bssx/axy/wxdhwxtx/art/2020/art_e00be70da40a4355afe7b869eba30fdb.html)

儿童常见风险包括小部件脱落、挂绳缠绕、毛绒覆盖充电发热、液体进入、过高音量、电池损坏和可拆机芯被儿童取出。电子模块拆洗应由家长操作；云端功能、App、OTA 和数据接口也需要安全测试。

### 10.5 已有事件的启示

PIRG 在 2025 年对部分 AI 玩具测试中发现不当内容和危险行为指导等问题，Kumma 的部分长对话问题发生于安全审计前，报告也说明复测中相关问题已经修复。该事件支持做多轮安全回归，**不能据此断言该品牌当前仍存在相同问题，更不能推断所有产品都不安全**。[来源：PIRG 2025 年 AI 玩具研究，第 28 页等](https://pirg.org/edfund/wp-content/uploads/2025/12/AI-Comes-to-Playtime-Artifical-companions-real-risks.pdf)

FTC 2018 年与 VTech 就儿童隐私通知、同意及数据保护等指控达成 65 万美元和解。它是历史美国案例，中国项目应依中国法规处理，但设备简单并不意味着家庭数据风险简单。[来源：FTC 官方公告](https://www.ftc.gov/news-events/news/press-releases/2018/01/electronic-toy-maker-vtech-settles-ftc-allegations-it-violated-childrens-privacy-law-ftc-act)

### 10.6 风险矩阵

以下为项目风险判断，优先级用于研发和预算排序，不是统计概率。

| 风险 | 优先级 | 影响 | 首期控制与发布条件 |
|---|---|---|---|
| 不当内容与危险指导 | 最高 | 儿童伤害、下架、信任损失 | 输入输出保护、长期对话测试、危急转人工或联系监护人 |
| 家庭音频泄露 | 最高 | 隐私损害、监管及声誉风险 | 实体静音、最少采集、权限隔离、删除验证 |
| 重度用户费用 | 高 | 服务毛利转负 | 明确额度、每设备预算、异常使用监控 |
| 服务停运 | 高 | 设备失去核心功能、预付赔付 | 离线可用、服务准备金、迁移与退出方案 |
| 童声识别差 | 高 | 孩子放弃、家长退货 | 真实家庭任务评测，不能只测成人普通话 |
| 知识或教育内容错误 | 高 | 错误学习、投诉 | 审核知识库、确定性工具、拒答和纠错 |
| 情绪依赖与真人交往减少 | 高 | 家庭接受度下降、保护风险 | 活动结束、真人关系引导、家长参与 |
| 锂电与结构事故 | 高 | 人身伤害、召回 | 材料、充电和结构测试，批次追踪 |
| 高退货和高获客 | 高 | 现金流压力 | 小批量、明确宣传、渠道贡献核算 |
| IP 或音色侵权 | 高 | 停售、角色被替换 | 逐项授权、期限和退场安排 |
| 云供应商锁定 | 中高 | 涨价、停服或无法迁移 | 自有网关、双供应商、可导出配置 |
| 假成长报告 | 中高 | 家长误判孩子能力 | 使用概况与学习评价分开，不做诊断 |
| 陌生人社交与家庭定位 | 高 | 儿童接触和泄露风险 | 首发不加入，家长批准的互动另行验证 |

## 11 验证计划与预算

### 11.1 先验证什么

**第一阶段，约 2—3 周：需求与竞品。** 访谈 30 个目标家庭，按儿童年龄、家长付费能力和家庭任务分组。购买芙崽、憨憨、BubblePal/CocoMate 等设备，完成成人安全与收费边界检查。用可退款的试用意向或真实小额订单验证付款意愿，不只询问“喜欢吗”。

**第二阶段，约 4—6 周：受控原型。** 做 3 类各 5—10 分钟活动，比较 2 套 ASR、2 个文字模型与串联/端到端语音方案。记录实际计费音频、字符、token、失败重试和首个有意义回应的时延。完成监护人同意、静音、限时、删除和紧急提示。

**第三阶段，约 6—8 周：100—300 个家庭试用。** 至少观察 30 天，并延续至 60—90 天以识别新鲜感衰减。记录家长认可、退款、孩子实际任务、P50/P95/P99 费用和安全反馈。原型阶段同样遵守实际适用的安全评估与登记要求，不能用“测试”作为默认豁免。

**第四阶段：小批试产再扩大。** 先验证 500—1,000 台级质量、工厂测试和售后；在产品、安全与贡献利润达到条件后扩大。上述时间可部分重叠，认证、模具或整改会延长进度，不能当作固定量产承诺。

### 11.2 建议的内部放行指标

以下为待校准的项目门槛，不是行业平均值或效果保证。

| 指标 | 初始建议 | 核验方法 |
|---|---|---|
| 首次成功可用 | 目标家庭至少 90% 可独立完成家长侧设置 | 记录失败原因与所需客服 |
| 核心活动完成率 | 至少 85% | 以童声和真实噪声完成任务，包含澄清重试 |
| 首个有意义回应 | 中位数不超过 1.5 秒，P95 不超过 3 秒作为优化目标 | 不把提示音计入回答，包含审核 |
| 30 天家庭留存 | 40% 以上作为继续投入假设 | 留存定义为第 4 周完成至少两次核心活动 |
| 家长认可 | 70% 以上认为值得持续使用 | 与实际付款、退款行为交叉验证 |
| 高严重度内容风险 | 发布测试集内零次；发现一次即整改复测 | 零次测试不等于风险为零 |
| 云端费用 | 每日2分钟候选，原会话优化目标约0.85—1元/月；有效语音口径约1—1.2元/月 | 分别核实缓存、分流、基础设施和长期责任，不依赖尚未签约折扣 |
| 退货 | 先以低于 10% 为经营假设 | 到货后真实退货，细分质量与预期差 |
| 单位贡献 | 99 元主力扣获客、售后和赠送云准备金后至少 15 元为初始放量目标 | 渠道分别算账；15 元是经营门槛假设，不是行业水平 |
| 百元渠道可行性 | 优化年度有效语音情景中，15元贡献目标对应获客不高于约7.66元/台；随实际成本重算 | 以退款后保留订单为分母，纳入可归因佣金与推广成本；年度以外服务单列 |

若 99 元主力无法达到单位贡献，优先调整形态、成熟方案、渠道与赠送权益；先保持用户的百元定位约束。不用未经签约的 token 折扣或“后续用户一定续费”掩盖亏损。

### 11.3 低价产品优先复用方案的投入占位

采用成熟 ODM、简化外壳和已有内容，初步以约 3—6 个月的小团队方案测算；安全评估、注册、认证和整改仍按实际要求完成，不能保证固定时间上市。全部为预算假设，**不是报价**。

| 项目，至首轮小批量 | 预算范围 |
|---|---:|
| 人员、ODM 对接、固件与后台集成 | 20—50 万元 |
| 简化结构、模具调整与试制 | 2—8 万元 |
| 测试、认证、法律与隐私准备 | 8—25 万元 |
| 原创或已有内容的适龄整理与授权 | 2—6 万元 |
| 家庭试用、云服务与设备材料 | 3—8 万元 |
| 低成本渠道实验 | 3—8 万元 |
| **合计占位** | **38—105 万元** |

初始家庭访谈、有限竞品实购和供应商同规格询价可先预留 2—5 万元，作为上述总预算内的第一阶段，不额外相加。样机与安全设计明确后再投入集成，完成必要要求后才进入家庭试用和试产。

以上不含 1 万台备货和赠送云准备金。小团队、已有技术/品牌资源可降低新增现金支出，但不能假装没有劳动与安全运营成本。若 ODM 模组、平台费或最低采购量明显不符合目标，应提前止损或调整供应链，不先做完整自研系统再寻找百元售价的解释。

## 12 尽调清单与最终立项判断

### 12.1 对竞品需要补齐的事实

| 对象 | 尚需核实 |
|---|---|
| 芙崽国内实机 | 当前 SKU 成交价、免费额度、内购权益、精力值规则、到期行为、是否存在服务变化 |
| 憨憨蜂窝版 | SVIP 续费价、到期免费能力、4G 费用与期限、儿童模式和云数据处理主体 |
| Babycare小丑鸭 | 首月销量、当时平均成交价与销售额口径；当前SKU与补贴后净结算、不限时免费合同及服务期限、模型和云供应商、异常使用规则、家长端与数据处理 |
| BubblePal 与 CocoMate | 每个型号成交价、终身权益合同、额度或公平使用条款、4G 续费、可清洗部分 |
| 所有竞品 | 童声和噪声实测、长期记忆纠错、删除流程、服务结束与迁移条件 |

### 12.2 对供应商要索取的材料

要求至少三家 ODM 对“99元零售、无屏Wi-Fi、单麦、按键说话、小形态、离线内容、每日免费不累积”的同一规格报价，分别列 1,000/10,000/50,000 台价格。核对 32—35 元制造目标，索取良率、质量赔付、模具归属、固件与云平台权限、测试报告和认证换版计划。要求至少两家云方案提供按同一儿童会话脚本的账单、音色授权、数据委托处理条款、并发报价、停服和模型变更流程。

运营商报价应包含卡池最低消费、停用卡收费、数据使用范围和服务期限。IP 合同应明确生成互动与音色使用、库存清售、已售设备后续服务和到期替代安排。

### 12.3 何时继续，何时调整

**按约 100 元、低价策略进入原型与小规模验证。** 放量前同时证明：实际量产报价支持约 32—35 元制造目标；家长接受99元、每日基础免费及计时口径；孩子第 4 周仍愿意使用；安全与隐私设计合格；渠道贡献至少约 15 元；每日免费保障有资金覆盖。制造目标、贡献门槛与权益都是待验证条件，不能因为售价低就提前通过。

出现以下情况，应先调整方案：孩子主要需求只是播放故事且 AI 没有额外价值；童声识别反复失败；既定百元价格下报价或渠道始终无法留出正贡献；必须依靠无限对话才能留存；服务承诺多年但单位贡献不足；内容保护仅靠一段提示词；供应商无法提供儿童数据处理与退场安排。

本项目的低价机会在于 **用轻硬件和受控 AI 为普通玩具增加真实互动价值，再用成熟供应链与低成本成交扩大覆盖**。约 100 元主力可以研究成立；前提是范围收敛、报价可交付、有限云权益被家长接受，并且安全和单位贡献同时合格。

## 附录 主要来源与证据性质

以下资料均于 2026 年 10 月 10 日查阅。正文关键事实附近已放置对应链接，列表便于继续尽调。

| 来源 | 时间或性质 | 主要用途 |
|---|---|---|
| [Fuzozo 官网](https://fuzozo.net/) | 当前产品及预售页面，企业发布 | 海外价格、角色、适龄宣传、销售数量自述 |
| [Fuzozo FAQ](https://fuzozo.net/pages/faq) | 当前官方服务说明 | 基础与 Plus 权益、地区及网络 |
| [Fuzozo 国内 App Store](https://apps.apple.com/cn/app/fuzozo%E8%8A%99%E5%B4%BD/id6746146243) | 开发者信息与内购目录 | 国内存在付费项目，不能独立证明权益 |
| [WIKO 憨憨](https://www.wiko.com/ai_toys/hanhan) | 当前官方蜂窝版页面 | 功能、参数、赠送权益和网络费用提示 |
| [IT 之家蜂窝版上市报道](https://www.ithome.com/0/941/360.htm) | 2026 年 4 月，媒体报道 | 历史上市价，非实时成交 |
| [虎嗅芙崽创始人访谈](https://m.huxiu.com/article/4873536.html) | 2026 年，企业访谈 | 云端架构与模型调度自述 |
| [Haivivi BubblePal](https://www.haivivi.cn/zh/product) | 官方产品页 | 儿童角色、故事及家长功能 |
| [Haivivi CocoMate](https://www.haivivi.cn/product/cocomate) | 官方产品页 | 端到端、主题卡、4G 与参数 |
| [Haivivi 创始人访谈](https://finance.sina.com.cn/jjxw/2025-09-06/doc-infppxve1324706.shtml) | 2025 年 9 月，财经网访谈转载 | 买断与终身免费变化，企业自述 |
| [FoloToy Fofo](https://www.folotoy.com/zh/products/fofo/) | 官方产品页 | 传统玩具改造形态 |
| [火火兔](https://www.alilo.com.cn/) | 官方企业与产品信息 | 早教内容替代品 |
| [中国日报网小丑鸭报道](https://cn.chinadaily.com.cn/a/202512/01/WS692d4d00a310942cc4994480.html) | 2025年12月1日，媒体报道，未提供审计与销量明细 | 首月销售额超过200万元；销量仅作价格情景推算 |
| [魔镜洞察报告](https://pdf.dfcfw.com/pdf/H3_AP202601071816825695_1.pdf) | 2025 年 12 月，第三方监测 | 2025 年 1—10 月线上交易口径 |
| [京东 AI 玩具白皮书](https://pdf.dfcfw.com/pdf/H3_AP202508051721756227_1.pdf) | 2025 年，平台与协会报告 | 市场定义与长期预测口径 |
| [2025 年统计公报](https://big5.www.gov.cn/gate/big5/www.gov.cn/lianbo/202602/content_7059980.htm) | 2026 年发布，官方统计 | 出生人口，非项目需求调查 |
| [qwen-flash](https://help.aliyun.com/zh/model-studio/qwen-flash) | 云厂商官方文档 | 国内文字价格 |
| [qwen-plus](https://help.aliyun.com/zh/model-studio/qwen-plus) | 云厂商官方文档 | 模型升级成本比较 |
| [Qwen 模型介绍](https://qianwen.aliyun.com/landing?family=qwen) | 厂商模型定位 | 简单、均衡和复杂任务的候选划分 |
| [qwen-flash-character](https://help.aliyun.com/zh/model-studio/qwen-flash-character) | 云厂商官方文档 | 角色候选能力及价格，不代表儿童合格 |
| [百炼模型价格](https://help.aliyun.com/zh/model-studio/model-pricing) | 云厂商官方文档 | ASR、TTS、实时音频价格及计费 |
| [ESP-SR](https://docs.espressif.com/projects/esp-sr/zh_CN/latest/esp32s3/getting_started/readme.html) | 芯片厂商官方文档 | 端侧语音前端与命令词能力 |
| [乐鑫 TTS](https://docs.espressif.com/projects/esp-sr/en/latest/esp32s3/speech_synthesis/readme.html) | 芯片厂商官方文档 | 嵌入式语音合成线索 |
| [ESP-SR资源基准](https://docs.espressif.com/projects/esp-sr/zh_CN/latest/esp32s3/benchmark/README.html) | 芯片厂商测试，配置特定 | 轻量TTS资源占用，非整机性能保证 |
| [MultiNet命令识别](https://docs.espressif.com/projects/esp-sr/en/latest/esp32s3/speech_command_recognition/README.html) | 官方组件说明 | 预设命令与自由ASR的能力区别 |
| [SenseVoice部署基准](https://k2-fsa.github.io/sherpa/onnx/sense-voice/pretrained.html) | 项目官方文档与指定设备测试 | 中文本地ASR文件规模、速度和部署 |
| [本地VITS/Melo TTS](https://k2-fsa.github.io/sherpa/onnx/tts/pretrained_models/vits.html) | 项目模型与特定板卡测试 | 神经TTS大小与运行速度，非全模型结论 |
| [Oído MCU ASR](https://github.com/lokutor-ai/oido) | 项目自述与板卡测试，持续更新 | 外语开放识别进展及当前时延边界，非中文童声验证 |
| [小智 ESP32](https://github.com/78/xiaozhi-esp32) | 官方开源仓库 | 原型与代码许可证 |
| [sherpa-onnx](https://github.com/k2-fsa/sherpa-onnx) | 官方开源仓库 | 离线转写和合成路线 |
| [CosyVoice](https://github.com/QwenAudio/CosyVoice) | 官方开源仓库 | 开源语音生成路线 |
| [拟人化互动办法](https://www.cac.gov.cn/2026-04/10/c_1777558395078289.htm) | 2026 年 7 月 15 日生效，正式法规 | 儿童情感服务与安全责任 |
| [儿童个人信息保护规定](https://www.cac.gov.cn/2019-08/23/c_1124913903.htm) | 正式规章 | 14 岁以下信息保护 |
| [未成年人网络保护条例](https://www.cac.gov.cn/2023-10/24/c_1699806932316206.htm) | 2024 年生效，正式条例 | 适龄内容、数据与防沉迷 |
| [生成式服务暂行办法](https://www.cac.gov.cn/2023-07/13/c_1690898327029107.htm) | 正式规章 | 公众生成式服务要求 |
| [2026 年备案登记公告](https://www.cac.gov.cn/2026-09/14/c_1791136833136332.htm) | 2026 年 9 月，官方公告 | 已备案模型应用的登记路线 |
| [AI 内容标识办法](https://www.cac.gov.cn/2025-03/14/c_1743654684782215.htm) | 2025 年发布，正式办法 | 语音和其他生成内容标识 |
| [中小学生使用指南](https://jyj.pingliang.gov.cn/zfxxgk/fdzdgknr/jyxx/xqjy/art/2025/art_75a20c8256c9403888b24465f7249d74.html) | 2025 年，教育指南 | 小学阶段开放生成使用边界 |
| [CCC 规则换版公告](https://www.cnca.gov.cn/hlwfw/ywzl/qzxcprz/tzgg/art/2026/art_8c3c6f4802fe4be8a47d08629f9acd7a.html) | 2026 年 5 月，官方公告 | 2026 年 11 月新认证规则 |
| [CQC 换版通知](https://www.cqc.com.cn/www/col68/91637.html) | 2026 年，认证机构通知 | 玩具安全标准换版 |
| [无线电核准指南](https://ythzxfw.miit.gov.cn/bssx/axy/wxdhwxtx/art/2020/art_e00be70da40a4355afe7b869eba30fdb.html) | 工信部办事指南 | 无线方案适用性核实 |
| [PIRG AI 玩具研究](https://pirg.org/edfund/wp-content/uploads/2025/12/AI-Comes-to-Playtime-Artifical-companions-real-risks.pdf) | 2025 年，第三方测试 | 历史内容安全案例，含整改后说明 |
| [FTC VTech 公告](https://www.ftc.gov/news-events/news/press-releases/2018/01/electronic-toy-maker-vtech-settles-ftc-allegations-it-violated-childrens-privacy-law-ftc-act) | 2018 年，监管历史案例 | 儿童玩具数据治理教训 |

**建议后续决策顺序：竞品实购与家庭访谈 → 受控原型及真实账单 → 30—90 天家庭试用 → 安全与认证落实 → 小批量 → 扩大投入。**

补充技术来源：[乐鑫 ESP-VoCat 开发套件](https://docs.espressif.com/projects/esp-dev-kits/zh_CN/latest/esp32s3/esp-vocat/index.html)，用于说明 MCU＋云语音原型路线；不提供百元产品制造报价。

新增竞品来源：[CKE小丑鸭展商产品页](https://www.china-kids-fair.com/product/-_en-28394)（企业展示）；[Babycare负责人访谈](https://finance.sina.com.cn/wm/2026-03-26/doc-inhsikav8949298.shtml)（企业自述，未披露账单）。249元与不限时线索来自用户，当前购买合同尚未独立核实。
