小米新一代人形机器人亮相2026世界机器人博览会“具身花园”展台,现场化身花艺师,流畅完成抓取香片、撒花、递送等精细动作,并支持握手、碰拳、比心等互动,表现自然不生硬。官方称其交互并非简单预设程序,而是由大模型驱动,展现更智能灵活的人机交互能力。
具身智能迎来新玩家Enigma。核心难题是让模型掌握未教技能。主流方法靠视频、仿真、真人数据。Enigma不走寻常路,不钻研模型能力,聚焦人机交互,希望从互动中催生直觉接口,甚至一种不经专门训练的操控方式。
微软与高通联合发布“Project Solara”芯片到云平台,标志着科技行业范式转变。双方CEO探讨AI智能体将成为人机交互核心界面,强调当前平台正经历深刻变革。
Sesame,由Oculus创始人及前VR核心成员创立的AI公司,于5月28日推出对话式AI智能体iOS公测版。它打破ChatGPT等传统聊天机器人的“一问一答”模式,通过自主研发技术,在保持AI深度思考的同时,确保对话流畅自然,重新定义人机交互体验。
一个人性化的多代理系统,自动化网络任务。
Vy是未来计算机界面的代表,利用先进的人工智能技术改变人机交互方式。
OmniTalker 是一个实时文本驱动的生成谈话头框架。
下一代情感智能的对话视频界面,让AI交互更自然、更人性。
maitrix-org
Voila是一个大型语音-语言基础模型家族,旨在提升人机交互体验,支持实时、低延迟的语音交互和多语言处理。
Voila是一个全新的大型语音-语言基础模型系列,旨在将人机交互体验提升至全新水平。
Voila是一个全新的大型语音-语言基础模型家族,旨在将人机交互体验提升至新高度。
Voila是一个大型语音-语言基础模型系列,旨在提升人机交互体验,支持多种音频任务和语言。
yueliu1999
基于Llama-3.2-3B通过R-SFT和HS-DPO方法微调的安全防护模型,用于分析人机交互中的有害内容
ACIDE
专为社交人机交互设计的个性化视觉语言模型,通过用户感知调优机制解决语义鸿沟问题
OpenGVLab
InternVideo2-Chat-8B-InternLM2.5是一个视频-文本多模态模型,通过整合InternVideo2视频编码器与大型语言模型(LLM)来增强视频理解和人机交互能力。
InternVideo2-Chat-8B是一个结合大型语言模型(LLM)和视频BLIP的视频理解模型,通过渐进式学习方案构建,能够进行视频语义理解和人机交互。
lamm-mit
Cephalo是一系列专注于多模态材料科学的视觉大语言模型(V-LLMs),旨在整合视觉和语言数据,以促进人机交互或多智能体AI框架中的高级理解和交互。
Cephalo是一系列专注于多模态材料科学的视觉大语言模型(V-LLMs),旨在整合视觉和语言数据,以促进人机交互或多智能体AI框架中的高级理解和互动。
benjaminbeilharz
共情对话模型是一种能够理解和生成具有共情能力的对话的AI模型,旨在提升人机交互的情感体验。
一个通过Discord实现人机交互的MCP服务器,允许AI助手在需要时向人类提问获取输入或判断。
MCP Connect 4是一个通过MCP技术实现人机交互的井字棋游戏项目,允许用户与AI助手对弈,并自动记录游戏状态。
一个基于Puppeteer的MCP服务器,为AI助手提供防检测的浏览器自动化能力,支持真实点击、人机交互等功能。
一个用于实现人机交互工作流程的MCP服务器,适用于Cline和Cursor等工具。
mcp-agent是一个基于Model Context Protocol(MCP)的轻量级AI代理框架,支持通过简单可组合的模式构建高效代理应用。它集成了MCP服务器的生命周期管理,并实现了多种工作流模式,如并行处理、路由、评估优化等,适用于多代理协作、人机交互等多种AI应用场景。