ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

VisionClaw的“眼睛“:从24fps到1fps,让AI看见你世界的完整视频管道设计

VisionClaw的“眼睛“:从24fps到1fps,让AI看见你世界的完整视频管道设计 VisionClaw的眼睛从24fps到1fps让AI看见你世界的完整视频管道设计【免费下载链接】VisionClawReal-time AI assistant for Meta Ray-Ban smart glasses -- voice vision agentic actions via Gemini Live and OpenClaw项目地址: https://gitcode.com/gh_mirrors/vi/VisionClawVisionClaw 是一款面向 Meta Ray-Ban 智能眼镜的实时 AI 视觉助手它的核心视频管道会将眼镜 24fps 的高帧率画面逐级节流到约 1fps经 JPEG 压缩后通过 WebSocket 送入 Gemini Live 多模态模型让 AI边听你说话边看见你的世界。本文带你拆解这条完整视频管道的每一层设计。为什么 1fps 就够了AI视觉的底层逻辑直觉上实时视频就该实时传输——但给大模型喂画面时恰恰相反。视觉模型读的是静态图像而非运动视频它理解你在看一盏吊灯并不依赖每秒 24 张连续画面只需要一张清晰、最新的帧。把 24fps 原样送进模型代价是带宽、压缩计算和 API 成本的 24 倍放大收益却接近于零。所以 VisionClaw 的核心设计哲学是在管道的每一层都问一句模型真的需要这一帧吗答案是不时果断丢弃。第一级眼镜端采集24fps HEVC 是蓝牙链路的关键眼镜里的摄像头由 Meta 官方 DAT SDK 驱动画面经经典蓝牙链路传到手机。蓝牙带宽有限这里有两个关键设计见 StreamSessionViewModel.swift设计点选择原因视频编码HEVChvc1720x1280裸 NV12 每帧约 1.38MBHEVC 比它小 10~30 倍请求帧率从 2/7/15/24/30 中选SDK 只接受这几个合法值逐帧压缩自适应适配蓝牙预算解码侧同样讲究VideoDecoder.swift 用VTDecompressionSession在后台解码压缩帧避免每帧软件转码拖垮主线程——这正是24fps 能不能流畅的分水岭。第二级应用层节流24fps 变 1fps JPEG 50% 质量画面进入 App 后立刻被降采样约 1fps 抽帧 → 压缩为 50% 质量的 JPEG → 经 WebSocket 发给 Gemini Live管道全貌可参考 README.md 的架构图。眼镜模式DAT SDK 24fps → 节流至 ~1fps → JPEG(50%)手机模式手机后置摄像头 30fpsPhoneCameraManager.kt→ 同样节流至 ~1fps50% 的 JPEG 质量是刻意选择AI 读场景不要求摄影级画质而每降低 10% 质量一帧的字节数就省下一截。一天几百次对话下来这层节流省下的流量非常可观。第三级Agent 端动态采样——说话 1fps沉默 0.3fps真正喂给模型的最后一道闸门在 agent/main.py。这里有一个巧妙的VoiceActivityVideoSampler用户说话时按1fps采样画面——AI 正在理解你的问题需要跟上视线变化用户沉默时降到0.3fps——画面基本静止少看几帧也不影响配合FrameHolder永远只保留最新一帧与帧新鲜度检测stale 时记录帧龄模型看到的永远是当前世界的最新快照。最终帧被编码为最长边 1280px 的 JPEG base64附在会话里送入模型。进阶技巧画面冻结——让模型只看你钉住的那一帧VisionClaw 还有一个反直觉的功能见 LiveKitSession.swift长按画面可以钉住当前帧。此时屏幕显示该帧同时发布给模型的轨道被静音——模型不再收到任何新帧因此你眼前这张图永远是你钉住的那张。当你指着某个细节问这个字写的什么时模型的注意力就稳定锁定在那个瞬间不会被后续走动中模糊的画面带偏。音频与视频管道如何协同视频只是眼睛声音才是这条管道的脉搏。整个实时链路长这样通道方向格式说明麦克风音频手机 → 模型PCM 16kHz100ms 分块实时进 WebSocket摄像头画面手机 → 模型JPEG ~1fps本文的主角模型语音模型 → 手机PCM 24kHz原生语音输出非 TTS 拼接音频是全速双向的视频却只要 1fps——因为语音对话的节奏每几百毫秒一个词对延迟敏感而场景理解你在看什么天然只按秒变化。用帧率匹配任务的感知粒度这条原则值得所有做多模态 App 的人借鉴。顺带一提眼镜第一视角还支持 WebRTC 直播到浏览器观看24fps、2.5Mbps但那条链路只给人看不喂模型两者互不干扰。动手体验没有眼镜也能跑通完整管道 不想买眼镜VisionClaw 内置手机模式用后置摄像头替代眼镜相机整条管道节流、压缩、采样完全一致克隆仓库并构建git clone https://gitcode.com/gh_mirrors/vi/VisionClaw在Secrets.swift/Secrets.kt填入 Gemini API Key点Start on iPhone / Phone再点 AI 按钮即可开始语音视觉对话️ 如果你已有 Ray-Ban 眼镜只需在 Meta AI App 里连点App 版本号5 次打开开发者模式再点Start Streaming接入眼镜相机。小结三层节流一帧就够回顾这条管道VisionClaw 用了三级闸门把 24fps 收敛到模型真正需要的画面量采集层HEVC 压缩 有限帧率档位先扛住蓝牙瓶颈应用层节流至 ~1fps 50% 质量 JPEG砍掉 95% 以上的传输量Agent 层说话 1fps / 沉默 0.3fps 的动态采样最后一帧才进模型对新手来说这套设计传递的信息很清晰给 AI喂图不是越多越好而是越准越好。理解了这个思路你也能给自己的多模态项目设计出既省又聪明的视觉管道。【免费下载链接】VisionClawReal-time AI assistant for Meta Ray-Ban smart glasses -- voice vision agentic actions via Gemini Live and OpenClaw项目地址: https://gitcode.com/gh_mirrors/vi/VisionClaw创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表