跟房子说话,它真听懂了:Home Assistant 2026.10 AI 功能解读

以前的语音助手,是"人工智障"
玩智能家居的都有过这种体验:对着音箱喊"打开客厅灯",它给你放了首《客厅灯》;说"把空调调到 26 度",它回你"没听懂,再说一遍"。固定话术、死板匹配,稍微换个说法就抓瞎。
Home Assistant 2026.10 这次更新,等于给家里的语音助手换了个大脑——直接接大模型。从此你跟房子说话,不用再背话术了。

跟房子聊天:想怎么说就怎么说
新版 Assist 语音助手支持把 OpenAI、Claude、Gemini 这些大模型当对话引擎,也支持本地跑 Ollama。你可以说:
- "我出门了"——它自己关灯、关空调、锁门、布防
- "今晚有客人来,客厅弄得亮堂点"——它调灯光场景、开背景音乐
- "卧室有点闷"——它查一下温湿度,开新风或者调空调
不用记"打开XX""关闭XX"这种指令式说法,日常怎么说话就怎么说,大模型自己理解意图、自己去调设备。这才是语音控制该有的样子。
摄像头会"看"了:不只是录像
这次最让我兴奋的是 LLM Vision 配了个专用小模型 Glimpse-v1——4B 参数,专门用 5000 多个真实家庭安防画面训练出来的。它不干别的,就干一件事:看懂你家摄像头拍到了什么。
以前摄像头推送是"检测到移动物体",你点开一看,是风吹的树枝。现在推送是:"门口有个穿深色外套的人放了个包裹在柱子旁,然后走了。"一次调用,直接生成标题+描述,延迟还低。
对别墅业主来说,院子大、摄像头多,以前每天几十条"有人移动"的推送,看到麻木。现在 AI 先帮你看一遍,只有真有事才打扰你。

不想把家传上云?本地跑大模型
很多人对 AI 进家最大的顾虑是隐私:摄像头画面、语音指令,全传到云端大模型那儿,总觉得不踏实。
新版支持 Ollama 本地跑模型,Llama 3 8B 这种量级的,家里一台小主机(Intel N100 级别就行)就能带动。语音识别、对话理解、画面分析,全在自家局域网里完成,一帧画面都不出门。
云端大模型效果更好,本地模型隐私更稳。怎么选看你自己——重要的是,选择权在你手里。
旧手机别扔:变成家里的"耳朵"
新版还有个实用的小功能:安卓手机能当语音卫星用了。家里抽屉里那台旧手机,装上 App 往客厅一放,就是个语音控制点,还支持端侧唤醒词(实验性)。
别墅房间多,每个房间买个语音音箱是笔不小的开销。旧手机再利用,零成本多几个控制点,挺香。
开发者视角:AI 调设备,安全得有谱
这次更新还有个底层变化,普通用户感知不到,但很重要:LLM 工具现在返回结构化的 ToolResult(带成功/失败标记),每个工具还多了四个安全标记——只读、是否破坏性、是否幂等、是否访问外部世界。
翻译成人话就是:AI 在动手调你家设备之前,系统先知道"这个操作是只看看,还是会真动手""搞砸了能不能撤销"。再配合 MCP Server,这些安全信息也能给外部 AI 客户端用。AI 权力越大,缰绳得越紧,这次是把缰绳做结实了。
给别墅业主的实战建议
- 先上语音+大模型:这是感知最强的升级,老人小孩都能用,不用学 App
- 摄像头接 LLM Vision:院子、门口、车库三个位置优先,推送质量天差地别
- 隐私敏感就本地跑:加台小主机跑 Ollama,语音和画面都不出内网
- 旧手机利用起来:每个常待的房间放一个当语音卫星
最后说句大实话
智能家居喊了这么多年"智能",其实大部分时间只做到了"遥控"。大模型进来之后,房子第一次有了"理解"的能力——理解你随口一句话的意思,理解摄像头画面里发生的事。
2026.10 这个版本,标志着 Home Assistant 从"设备遥控器"变成了"家庭管家"。别墅越大、设备越多,这种变化的价值就越大。
下期预告:有人问我 Matter 1.6 的 Joint Fabric 到底有啥用,下一篇就掰开揉碎讲讲。
