待补充 valentinfrlch/ha-llmvision

3/5 🧩 软硬件结合 已发布
valentinfrlch 480 Stars 未知 BOM 完整度: 0/5 教程完整度: 0/5
待补充

项目简介

Visual intelligence for your home.


LLM Vision 是一个专为 Home Assistant 设计的智能视觉集成组件,它的核心使命是让家庭自动化系统真正“看见”并理解画面内容。通过接入多模态大语言模型,这个项目将传统的摄像头监控升级为具备视觉理解能力的智能系统。

标签

项目特点

**多模型支持**:兼容 OpenAI GPT-4o、Anthropic Claude、Google Gemini、本地 Ollama 等多种多模态大语言模型。
**实时视觉理解**:支持摄像头快照、图片文件、URL 图片等多种输入源,自动分析画面内容。
**智能自动化触发**:根据视觉分析结果生成结构化数据,直接驱动 Home Assistant 自动化规则。
**自定义提示词**:允许用户编写自己的分析提示词,定制识别目标和响应逻辑。
**本地化部署选项**:支持通过 Ollama 运行本地模型,保护隐私且无需联网。
**轻量集成**:作为 Home Assistant 自定义组件安装,配置简单,与现有自动化体系无缝对接。

技术规格

平台 Home Assistant(自定义集成)
支持模型 OpenAI GPT-4o / GPT-4o-mini、Anthropic Claude 3.5 Sonnet、Google Gemini 1.5 Pro/Flash、Ollama(本地多模态模型)
输入源 摄像头实体快照、本地图片文件、URL 图片
输出格式 结构化 JSON(含描述、物体识别、场景分类等)
安装方式 HACS 自定义仓库 或 手动复制到 custom_components
依赖 Home Assistant 2024.1+、Python 3.11+
通信协议 REST API(调用大模型服务)
隐私模式 支持本地 Ollama 模型,数据不出设备

项目资源

物料清单 (BOM)

物料名称 数量 参考价格 备注
Home Assistant 1 需 2024.1 及以上版本
HACS(可选) 1 用于简化安装
Python 3.11+ 1 Home Assistant 运行环境
OpenAI API Key 1 使用 OpenAI 模型时必需
Anthropic API Key 1 使用 Claude 模型时必需
Google AI API Key 1 使用 Gemini 模型时必需
Ollama 本地服务 1 使用本地模型时必需
摄像头(IP/USB) 1+ 需 Home Assistant 已集成

能力画像

**记忆与知识检索**:2/5 — 不涉及长期记忆或知识库,仅依赖大模型的即时视觉理解能力。
**动手与操作**:3/5 — 需要配置 Home Assistant 和 API 密钥,但无需硬件焊接或物理组装。
**编程与算法**:2/5 — 无需编写代码,但理解 YAML 配置和自动化规则有一定门槛。
**设计与建模**:1/5 — 不涉及 3D 建模或电路设计,主要是软件集成配置。
**实验与调试**:4/5 — 需要反复调整提示词、测试不同模型、调试自动化触发条件。
**协作与分享**:3/5 — 可通过 GitHub 提交 Issue/PR,社区论坛分享配置案例。
**学习与研究**:4/5 — 涉及多模态 AI、Home Assistant 自动化、API 调用等前沿技术学习。
**系统集成**:5/5 — 核心能力就是集成多种大模型 API 与 Home Assistant 生态系统。

视频

所需技能

Home Assistant 基本操作与配置 YAML 配置文件编写 理解 REST API 和 API 密钥管理 摄像头设备集成基础 大语言模型提示词工程 自动化规则逻辑设计 基本网络故障排查能力

适用场景

智能家居安防:识别陌生人、包裹送达、门窗异常开启
宠物监控:检测猫狗活动、自动投喂或报警
老人/儿童看护:识别跌倒、长时间未活动等异常情况
厨房安全:监测炉灶无人看管、烟雾或火焰
花园/阳台:识别植物生长状态、鸟类或害虫
车库/车位管理:检测车辆进出、车位占用状态
门禁联动:根据人脸或物体识别触发门锁或灯光
能源管理:识别电器使用状态,联动节能自动化