谷歌DeepMind推出多语言手语转文本模型SL2T,并首次搭载于Pixel11手机,让手语AI进入消费电子产品。该模型接入Gboard和Live Transcribe,用户通过前置摄像头打手语,即可编辑消息、网页检索及与Gemini对话,替代键盘输入。SL2T基于50多种手语、10万小时素材训练,约四分之一来自美国手语数据集,跨语种联合训练提升识别效果。
据彭博社记者Mark Gurman报道,苹果智能眼镜项目(代号N50)计划于2027年6月WWDC27亮相、秋季正式发布。因产品打磨与完善隐私策略,发布时间由原定的今年底推迟。面对Meta等引发的摄像头隐私争议,苹果将隐私保护作为核心,正完善功能与政策并探索多种产品方案。
Halliday于7月21日发布第二代AI眼镜G2,售价599美元,2026年9月发货。主打Meeting Flow实时会议辅助,提供超45种语言实时字幕、翻译、快速总结与信息检索,支持话题追踪和决策确认,区别于传统会后总结。
法国AI公司Mistral推出轻量级机器人导航模型Robostral Navigate,参数仅8B。该模型仅凭普通RGB摄像头即可实现复杂环境下的完全自主导航,无需激光雷达或深度传感器,适用于室内外多种场景,显著降低硬件成本与部署复杂度。
AirTouch将Mac内置摄像头变为手势控制器,无需硬件,支持十种手势。
快速分享屏幕和摄像头,创建专业视频,适用于内外部沟通。
通过网络摄像头将VTuber虚拟形象变为现实,提升直播体验。
TrackHands通过摄像头提醒你不要把手靠近嘴巴,帮助养成良好习惯。
declare-lab
基于开放X具身数据集训练的视觉-语言-动作模型,以语言指令和摄像头图像为输入生成机器人动作
dima806
基于Google Vision Transformer (ViT)架构的图像分类模型,用于检测监控摄像头图像中的犯罪行为,准确率约83%。
openvla
OpenVLA 7B是一个基于Open X-Embodiment数据集训练的开源视觉-语言-动作模型,能够根据语言指令和摄像头图像生成机器人动作。
一个用于与计算机外设无缝集成的MCP服务器,提供统一的API来控制、监控和管理硬件设备,包括摄像头、打印机、音频设备和屏幕。
YOLO MCP服务是一个强大的计算机视觉服务,通过模型上下文协议(MCP)与Claude AI集成,提供物体检测、分割、分类和实时摄像头分析功能。
这是一个用于控制Reachy Mini机器人的MCP服务器,通过自然语言指令实现舞蹈、表情、头部运动、摄像头图像捕捉、头部跟踪和本地实时语音合成等功能。
一个基于MCP平台的本地代理服务器和客户端实现,集成天气查询、谷歌搜索、摄像头控制、图片生成和智能对话等多种AI工具功能,支持模块化扩展和高性能并发处理。
phospho的官方MCP服务器,实现模型上下文协议,支持通过自然语言控制物理机器人,提供执行动作和摄像头图像流功能。
一个基于OpenCV的MCP服务器,提供网络摄像头控制和图像捕捉功能
PersonaLive是一个基于AI的实时肖像动画系统,支持通过摄像头实时驱动或离线视频处理生成生动的虚拟形象,适用于直播等场景。
Webcam MCP是一个MCP服务器,为LLM智能体提供网络摄像头访问功能,支持拍照和录制视频,使AI代理能够自主观察物理环境并与之交互。
OpticMCP是一个为AI助手提供摄像头和视觉工具的MCP服务器,支持USB摄像头、IP网络摄像头、屏幕捕捉、图像分析、二维码解码等多种功能,实现通用摄像头接口。
一个基于MCP平台的本地代理服务器和客户端实现,集成天气查询、谷歌搜索、摄像头控制、AI图片生成和智能对话等多种AI工具调用能力,支持跨平台运行和模块化扩展。
MCP是一个由Anthropic开发的开源协议,旨在为AI模型提供与外部数据源和工具交互的标准化方式。项目实现了天气查询、谷歌自动检索和摄像头控制等功能,具有高度可配置性,适用于智能助手、自动化工作流等场景。
一个MCP服务器项目,用于连接CCTV录像系统(VMS),实现视频流检索、播放控制及PTZ摄像头操作。
OpenSentry MCP服务器是一个只读的模型上下文协议服务,用于连接OpenSentry安防指挥中心,使AI助手能够查询摄像头状态、带位置数据的检测警报、录像记录和系统健康信息。