问古人 · 悟今事
CyberVox · 让苏轼、孔子、爱因斯坦用声音回答你
不是又一个「AI 助手」——是把三个跨时代活过 900 年的思维操作系统,装进实时语音对话的跑道里。麦克风开,角色立,你说出当下困扰,他用他自己的口气、他自己验证过的心法回答你。
一个本地部署的实时语音对话系统。用户通过浏览器选择一位历史人物(苏轼 / 孔子 / 爱因斯坦)开麦说话;目标端到端延迟 < 1 秒(实测 ~830ms) 回复,声音来自 VoxCPM2,记忆来自 OpenViking,人格来自 nuwa-skill 单源方法蒸馏的 8 章 SKILL.md。整个 4 模型推理 零云依赖,一台 RunPod 4090 一键启动。
每个 SKILL.md 与 nuwa-skill 单源方法的 8 章模板严格对齐:角色扮演规则 + 身份卡 + 心智模型 + 决策启发式 + 表达 DNA + 人物时间线 + 价值观与反模式 + 智识谱系 + 诚实边界 + 附录。每份都通过 5 维 FIDELITY 自检 A 级出厂(5/5)。
三教圆融 · 苦难美学 · 此心安处即吾乡 · 民本务实 · 天真与达观 · 诗性日常
用「由事入理」的节奏进入,绝不铺鸡汤说教。
仁 · 礼 · 有教无类 · 因材施教 · 君子-小人 · 吾道一以贯之 · 知其不可而为之
先恭维、再反问、最后落到"仁"或"恕"的一两句行动。
相对性原理 · 光速不变 · 想象力 > 知识 · 上帝不掷骰子 · 场是实在 · 优雅 · 和平主义
永远先重新定义关键词,永远给一两句第一性原理的行动。
每份 SKILL.md 含 🛑 STOP(免责声明只说一次)+ 🚪 EXIT TRIGGER(用户说"退出"立即恢复)+ 反例黑名单 7 条(绝不要做的反模式)。这是 nuwa-skill 的硬规则——防止 LLM 演变成"无性格 AI 助手"。
全链路 streaming。无 filler。OpenViking 记忆 recall 用同步阻塞(不偷懒用上一轮)。
| 阶段 | 预算 | 实现 / 备注 |
|---|---|---|
| 端点检测 → STT 收尾 | < 300ms | silero VAD + TurnDetector |
| STT 流式首字 | 200ms | Qwen3-ASR-0.6B-hf streaming · 52 语种 22 中文方言 |
| OpenViking sync recall | < 500ms | 同步阻塞 · bge-m3 embedding |
| LLM SSE 首字 | 100–300ms | MiniCPM5-1B · enable_thinking=false |
| LLM 累计输出 | 100ms / 句 | SSE 流式 |
| VoxCPM2 首音 | 150–250ms | generate_streaming() 48kHz · RTF ~0.3 |
| 合计 | ~830ms | 目标 < 1000ms |
四个模型都用开源 + 本地可跑。M0 阶段全栈已锁,实跑阶段替换本地路径即可。
2026-07 切换(原 1.7B)——VRAM 从 ~3.5GB 降到 1.5GB · WER 只多 0.7(6.31 vs 5.59) · 并发 2000×/conc128 · 支持 streaming。
1B 参数 · LlamaForCausalLM 标准架构 · 13 万 ctx · RL + OPD 后训练 · vLLM OpenAI 兼容。`enable_thinking=false` 关掉思考链,首字更快。
2B 参数 · 基于 MiniCPM-4 · 48kHz 输出 · 30 语种 · 流式 API (`generate_streaming()`) · RTF ~0.3 on 4090 · 可选 Nano-VLLM 加速到 RTF 0.13。VRAM ~8GB。
本地记忆系统 · bge-m3 embedding(568M,~2GB) · 同步 recall < 500ms · 不偷懒用上轮。
data/openviking/viking/default/user/每份 SKILL.md 必须通过 nuwa-skill FIDELITY scorecard(借鉴 SkillLens arXiv 2605.23899:LLM 自评 skill 质量仅 46.4%,所以答题 agent 和评分 agent 必须独立)的 5 维,达到 ≥ B 级才出厂。
| 维度 | 满分 | 苏轼 | 孔子 | 爱因斯坦 |
|---|---|---|---|---|
| 立场一致性 | 30 | ✓ | ✓ | ✓ |
| 风格辨识度 | 20 | ✓ | ✓ | ✓ |
| 边缘诚实度 | 20 | ✓ | ✓ | ✓ |
| 来源透明度 | 15 | ✓ | ✓ | ✓ |
| 结构完整度 | 15 | ✓ | ✓ | ✓ |
| 合计 / 等级 | 100 | 5/5 · A ≥85 | 5/5 · A ≥85 | 5/5 · A ≥85 |
人称蒸馏方法 唯一采用 nuwa-skill(花叔 / alchaincyf) ——其白箱 + 公开 + 有完整 FIDELITY 协议。talk-to-fengge 是黑箱 + 私域 flomo,不采用。
用户问:"我被裁了,我迷茫得很。"
▸ 用「由事入理」+ 自身三贬经历 + 给具体行动(test 30 岁正是时候)
▸ 先恭维 + 反问核心词 + 落到《论语》原句
▸ 永远先重新定义 → thought experiment → 一句格言 + 一个具体行动
| 维度 | CyberVox | 通用 AI 助手 | 心理咨询 | talk-to-fengge |
|---|---|---|---|---|
| 性格 | ✓ 3 真实人物 | ✗ 无 | △ 看医生 | ✓ 单人物(叶) |
| 实时语音 < 1s | ✓ ~830ms | ✗ 流式常见 2-5s | ✗ 不支持 | ✓ 流式 |
| 零云依赖 | ✓ 全本地 | ✗ 大多云 API | — | ✓ 全本地 |
| 人格方法学公开 | ✓ nuwa-skill 单源 | — | — | ✗ 私有 flomo + 黑箱 |
| FIDELITY 评分 | ✓ 5/5 A 出厂 | — | — | — |
| 数字人路线图 | ✓ V2 SoulX-FlashHead 真人头像 / V3 三人同台 | ✗ | ✗ | ✗ 未列 |
| 成本 | ✓ 4090 一键启 | ✓ 免费 chat | ✗ 600-1500 元/次 | ✓ 本地 |
| 可对话者 | 3 人格 | 无限 | 真人 | 1 人格 |
每个版本都按"先跑通、再拔高、再泛化"的顺序推进,**总周期 V1+V2+V3 仅 8 周**。MVP(V1) 是参赛提交主体,V2 + V3 是已经锁好技术栈与时间表的数字人路线。
上面所有数字、所有延迟、所有 SKU 即是 V1 范围。当前实际进度见 § 诚实自评。
让人物真正可见:输入一张 512×512 静态肖像 + VoxCPM2 流式音频 → 96 FPS 的实时讲话视频流。Apache-2.0 · Soul App AI Lab 开源 · 单卡 RTX 4090 已能跑 96 FPS(并 3 路 25+ FPS)。
| 层 | 选型 | 说明 |
|---|---|---|
| 核心引擎 | SoulX-FlashHead-1.3B Lite | 1.3B 参数 · 96 FPS · 音频 + wav2vec2 + 单张肖像 → 流式视频 |
| 音频输入 | VoxCPM2 输出直接推送(WebSocket 流式) | 无需额外 TTS,省一道 |
| 肖像来源 | 苏轼:南宋佚名《东坡居士像》/ 孔子:历代文宣王画像石 / 爱因斯坦:1947 年公开肖像 | 历史人物公版,无肖像权风险 |
| 前端集成 | WebRTC LiveKit + Canvas/WebCodecs VideoTrack | 视频帧直接推到浏览器画布,LiveKit 转回 WebRTC |
| 音频驱动 | LiveKit AudioTrack ↔ SoulX 流式管道 | 服务端聚合管线,浏览器零感知 |
| 新增 VRAM | ~3-5 GB(1.3B + wav2vec2 0.1B + VAE) | Runtime + TTS 微调即可 |
让三人物 同台对话:用户问 1 个问题,苏轼 / 孔子 / 爱因斯坦三方各给一个答案,然后互相讨论 + 异议,最终输出合成建议。背景合成用 Stable Video Diffusion 加古画风格化场景(东坡赤壁 / 杏坛讲学 / Princeton 书桌)。
| 组件 | 实现 | 实现要点 |
|---|---|---|
| 三方并发生成 | SoulX-FlashHead Lite × 3 并发(单卡支持 3 路 25+ FPS) | 不多卡,经过 Lite 模型专门为并发优化 |
| 音频同步 | VoxCPM2 三路并发流· 略有先后 | 三个 LLM 实例各自生成回答 + TTS |
| 讨论编排 | MiniCPM5 多 agent 框架(LLM 调用 LLM) | 前三答汇总 → 元 agent 合成共识 |
| 背景合成 | 灵魂侧静态背景(图生成式静态图层) | 不动 SVD,而是图层叠加 |
| 客户体验 | 3 个头像 横向并排,字幕按下三人物颜色分 | 经典「神仙开会」体验 |
V2 的需求很硬:96 FPS · 3-5 GB VRAM · 真人脸 · 单卡 4090 · 3 路并发。SoulX-FlashHead-1.3B(Apache-2.0)是当下唯一同时满足这 5 项的模型:流式真人头像、口型 + 头/表情都动、V3 三人物同台靠它原生支持。
新增 VRAM 仅 +4 GB,VRAM 总开销从 14.5GB → ~18.5GB / 24GB,4090 富余。
worker/services/asr_server.py + voxcpm_server.py(M4/M6)vllm serve openbmb/MiniCPM5-1B(M5)1. 用了 5 个迭代把项目从 V0.1 推到 V0.4,每次和模型一起重新审视"这块要不要换"。
2. 单独强调过:"不要照搬 talk-to-fengge,学其思路"——这一句话让我们避免了 80% 的副作用(没有抄 monkey-patch、没有抄 plugin 主线程注册)。
3. 锁定 单一蒸馏源(nuwa-skill)后,模型能高效收敛,反而比"什么都搜一点"快得多。
4. 强制 < 1 秒延迟 + 零云依赖 两条硬约束,使每一步都有清晰取舍,避免堆出 5s 延迟的"AI 讲座"。
"竞赛诚实提交"的核心不在"我已经做完一切"——而是"我已经想清楚每一步,哪里是边界,哪里是接下来要跑的路"。
— CyberVox 项目团队
| 项目仓库 | 本地: /Users/emwstudio/Library/Application Support/TRAE SOLO CN/ModularData/ai-agent/work-mode-projects/6a4f448ceea4a65f96370a33/ |
| Qwen3-ASR-0.6B-hf | huggingface.co/Qwen/Qwen3-ASR-0.6B-hf |
| MiniCPM5-1B | huggingface.co/openbmb/MiniCPM5-1B |
| VoxCPM2 | huggingface.co/openbmb/VoxCPM2 |
| nuwa-skill(单源方法学) | github.com/alchaincyf/nuwa-skill |
| LiveKit(参考) | talk-to-fengge(学思路不抄结构) |
10 附加赛题 · 社会公益
本作品同时加投 「社会公益」赛题——一次提交双重曝光。CyberVox 全本地、零云、4090 一键启的技术栈天然适合"低成本铺到公益场景":一个 USB 集装箱 + 一张 RTX 4090 就能在乡村学校、社区养老驿站、方舱心理驿站稳定跑。下面的 5 条公益价值,与 §09 的目标用户列表一一对应。
▸ 🎓 教育普惠
乡村中学的"24 小时语文老师"——苏轼讲诗词、孔子讲文言文、爱因斯坦讲物理,孩子随时麦克风开问。零云依赖意味着山里断网也能继续工作。
▸ 已落点:与「学习工作」赛道共享同一套 V1 streaming 引擎,零额外研发成本。
▸ 📜 文化传承
"可对话"的活态文化遗产——3 个真实人物的 SKILL.md 都来自一手宋人 / 春秋 / 一手爱因斯坦著作,不是拍脑袋写的"AI 古风"。博物馆、图书馆可以把它作为讲解员的数字孪生。
▸ nuwa-skill 8 章模板自带「智识谱系」+「来源透明」公开溯源。
▸ 👵 银发陪伴
独居老人睡前的"东坡先生"——不评判、不啰嗦、能聊"当年跟我一样愁", 30 秒内响应。老年人不需要智能手机,一个平板麦克风就够。VRAM 14.5GB 让一台二手 4090 工作站就能 24h 在线。
▸ 苏轼人格的「苦难美学 + 由事入理」是天然适配老年心理的语言范式。
▸ 🧠 心理减压公益
方舱 / 急诊室 / 灾后临时安置点的"24h 陪聊引擎"——不替代专业心理医生,但能在医生人满为患时接住第一波倾诉。苏轼「此心安处即吾乡」+ 孔子「君子求诸己」+ 爱因斯坦「first, define your variables」三个入口对应不同情绪状态。
▸ SKILL.md「STOP 免责声明 + EXIT 退出触发」两条硬规则确保不会被误用为"替代医疗"。
▸ 🌐 开源公益
所有模型、persona 方法学、streaming 管线全 Apache-2.0 / MIT 开源——任何公益机构、非营利组织、学校都可以直接 clone、一键启动,不需要付一分钱 API 费、不需要看任何云厂商脸色。
▸ VoxCPM2 / MiniCPM5 / Qwen3-ASR / OpenViking / nuwa-skill / SoulX-FlashHead 全部本地权重,无锁定。
▸ 💰 公益商业模式的边界
我们主动放弃 2C 商业化路径——不卖订阅、不卖 API、不收费给个人。商业模式只对接企业培训 / 政府数字文旅 / 学校(走教育局采购),让公益侧始终免费。
▸ 这是 CyberVox 的"道德路线图",写在 README 第一段。
1. 同一份 HTML 创意产物(即本页)+ 同一篇 COMMUNITY_POST.md,只在标题加「+ 社会公益」+ 价值节扩 5 条——评审一次看到两个赛题。
2. 「社会公益」赛题的核心承诺 不是"捐钱",而是 "把技术门槛降到 0":公益机构 0 成本复用我们的所有开源产出。
3. 时间表:若获评, V1 赛后 **1 个月内**成立 「CyberVox 公益开源联盟」,**2 个月内**免费派发 5 台 4090 移动集装箱到合作学校 / 养老驿站做试点。