待补充 RunanywhereAI/RCLI

3/5 🧩 软硬件结合 已发布
RunanywhereAI 332 Stars 未知 BOM 完整度: 0/5 教程完整度: 0/5
待补充

项目简介

Talk to your Mac, query your docs, no cloud required. On-device voice AI + RAG


RCLI 是一款专为 macOS 设计的本地语音 AI 工具,完全运行在 Apple Silicon 设备上,无需联网、无需云服务、无需任何 API 密钥。它集成了完整的语音交互流水线,包括语音活动检测(VAD)、语音转文字(STT)、大语言模型(LLM)、文字转语音(TTS)以及视觉语言模型(VLM),所有推理任务均在本地完成,端到端延迟低于 200 毫秒。RCLI 的核心技术是 RunAnywhere 自研的 MetalRT GPU 推理引擎,专为 Apple Silicon 优化,在 M3 及以上芯片上性能尤为突出,解码速度远超 llama.cpp 和 MLX 等方案。用户可以通过语音直接控制 macOS 的 40 多种操作,例如打开应用、调节音量、播放音乐等;也可以对本地文档进行检索增强生成(RAG),实现毫秒级的混合检索问答;还能通过摄像头或屏幕截图进行实时视觉分析。RCLI 提供了简洁的终端交互界面(TUI),支持连续语音模式、一键命令和模型热切换。安装方式简单,支持 Homebrew 或一键脚本,首次使用只需运行 `rcli setup` 下载约 1GB 的模型文件即可。该项目解决了传统语音助手依赖云端、延迟高、隐私风险大的问题,特别适合追求低延迟、高隐私、离线可用的 macOS 用户,无论是开发者、研究人员,还是希望用语音提升日常效率的普通用户,都能从中受益。

标签

项目特点

**完全本地运行**:所有语音和语言模型推理均在 Apple Silicon 设备上完成,无需联网或云服务,保护隐私。
**超低延迟**:端到端语音交互延迟低于 200 毫秒,实现近乎实时的对话体验。
**自研 MetalRT 引擎**:RunAnywhere 自研的 GPU 推理引擎,针对 Apple Silicon 深度优化,解码速度超越 llama.cpp 和 MLX。
**完整语音流水线**:集成 VAD、STT、LLM、TTS 和 VLM,支持语音输入、文字对话和视觉理解。
**无需 API 密钥**:完全开源,无需注册或付费,开箱即用。
**支持视觉语言模型**:可处理图像输入,实现多模态交互。

技术规格

支持平台 macOS(Apple Silicon)
最低硬件要求 Apple Silicon 芯片(M1 及以上)
推荐硬件 M3 及以上芯片
端到端延迟 < 200 毫秒
语音活动检测(VAD) 集成,本地运行
语音转文字(STT) 本地模型,支持实时转录
大语言模型(LLM) 本地推理,支持多种开源模型
文字转语音(TTS) 本地合成,低延迟
视觉语言模型(VLM) 支持图像输入与理解
推理引擎 RunAnywhere MetalRT(自研)
依赖 无云服务、无 API 密钥
许可证 未知(需查阅仓库)

项目资源

物料清单 (BOM)

物料名称 数量 参考价格 备注
Apple Silicon Mac(M1/M2/M3/M4) 1 必需,推荐 M3 及以上
macOS(最新版本) 1 必需
RCLI 二进制或源码 1 从 GitHub 获取
语音模型(VAD/STT/TTS) 若干 自动下载或用户指定
大语言模型(LLM) 1+ 用户选择,如 Llama、Mistral 等
视觉语言模型(VLM) 可选 用于图像理解

能力画像

**记忆与知识检索**:3/5 — 依赖本地 LLM 的知识库,无外部检索增强,但可加载大模型提升知识覆盖。
**动手与操作**:4/5 — 通过语音直接控制命令行,支持执行系统命令和脚本,操作效率高。
**编程与算法**:3/5 — 可辅助代码生成和调试,但受限于本地模型能力,复杂任务需配合专业工具。
**设计与建模**:2/5 — 无图形界面,不直接支持设计工具,但可通过 VLM 理解图像内容。
**实验与调试**:4/5 — 低延迟语音交互适合快速迭代测试,支持实时反馈。
**协作与分享**:2/5 — 单机工具,无内置协作功能,但可导出对话记录。
**学习与研究**:4/5 — 适合语音驱动的学习场景,支持多模态输入,可辅助研究笔记和问答。
**系统集成**:3/5 — 可通过命令行与其他工具集成,但无原生 API 或插件系统。

所需技能

macOS 基本操作 命令行使用基础 Git 版本控制(如需从源码构建) 了解 Apple Silicon 架构(非必需,但有助于性能调优) 对语音 AI 和 LLM 的基本概念(非必需,但有助于理解功能)

适用场景

**个人语音助手**:在 Mac 上实现本地、隐私安全的语音交互助手。
**开发者效率工具**:通过语音快速执行命令、编写脚本、查询文档。
**无障碍辅助**:为行动不便或视力障碍用户提供语音控制电脑的能力。
**离线 AI 实验**:在无网络环境下测试和运行语音 AI 流水线。
**多模态交互研究**:结合语音和图像输入,探索本地多模态 AI 应用。
**隐私敏感场景**:处理敏感数据时,避免将语音或文本上传至云端。