待补充 dsd2077/CyberVerse

3/5 🧩 软硬件结合 已发布
dsd2077 556 Stars 未知 BOM 完整度: 0/5 教程完整度: 0/5
待补充

项目简介

Self hosted, real-time digital human agent platform. Build voice-first AI agents with WebRTC, persona memory, tools, RAG


CyberVerse 是一个开源的实时数字人智能体框架,专注于打造以语音交互为核心的 AI 助手。它的核心理念是“一张照片,让数字人活起来”——只需提供一张人物照片,就能生成一个具备实时对话、面部表情和唇形同步能力的数字人形象,让虚拟角色真正“看见你、听见你、与你对话”。

标签

项目特点

**一张照片即可驱动**:无需复杂的3D建模,仅凭一张人物照片就能生成可交互的数字人形象。
**实时语音对话**:支持语音输入→语音识别→大模型推理→语音合成→唇形同步的完整实时链路。
**面部表情与唇形同步**:数字人能够根据语音内容自动匹配口型和面部表情,交互更自然。
**开源可定制**:完全开源,开发者可以自由修改模型、界面和交互逻辑。
**跨平台支持**:可在Windows、Linux、macOS上运行,支持本地或云端部署。
**模块化架构**:语音识别、大模型、语音合成、渲染引擎等模块可独立替换和升级。

技术规格

项目资源

物料清单 (BOM)

物料名称 数量 参考价格 备注
麦克风 1 用于语音输入
摄像头(可选) 1 用于捕捉用户面部表情(扩展功能)
NVIDIA显卡 1 推荐RTX 3060及以上
Python 3.10+ 1 运行环境
PyTorch 1 深度学习框架
CUDA 11.8+ 1 GPU加速
FFmpeg 1 音视频处理
语音识别模型 1 如Whisper base/large
大语言模型 1 如Qwen2-7B
语音合成模型 1 如CosyVoice
唇形同步模型 1 如Wav2Lip

能力画像

**记忆与知识检索**:3/5 — 依赖接入的大语言模型能力,框架本身不内置长期记忆系统。
**动手与操作**:4/5 — 需要搭建硬件环境、配置模型路径、调试音频设备,有一定动手门槛。
**编程与算法**:4/5 — 需要理解Python、深度学习模型调用、异步编程,可进行模块替换和二次开发。
**设计与建模**:2/5 — 无需3D建模,但需要准备或处理人物照片素材。
**实验与调试**:3/5 — 调试语音延迟、唇形同步效果、模型加载错误等常见问题。
**协作与分享**:3/5 — 开源项目,可通过GitHub提交Issue/PR,社区活跃度中等。
**学习与研究**:4/5 — 涉及语音识别、大模型、语音合成、数字人渲染等多个前沿技术领域。
**系统集成**:3/5 — 可集成到现有聊天系统、直播推流、智能硬件中,但需要自行开发接口。

所需技能

Python编程基础 深度学习框架使用(PyTorch) 命令行操作(Linux/Windows终端) 音频设备配置与调试 模型下载与路径配置 基本的Git版本控制 了解语音识别、语音合成、大语言模型的基本概念 可选:Docker容器化部署

适用场景

**虚拟主播/直播助手**:用一张照片生成可实时对话的虚拟形象,用于直播互动。
**智能客服数字人**:在商场、银行、展厅等场景部署,提供语音交互服务。
**AI伴侣/虚拟角色**:创建个性化的虚拟角色,进行日常聊天陪伴。
**教育辅助**:生成虚拟教师形象,进行语音问答和知识讲解。
**游戏NPC**:为游戏角色赋予实时对话和表情能力,增强沉浸感。
**社交媒体虚拟形象**:用于视频通话、短视频制作中的数字人替身。