谷歌DeepMind推出多语言手语转文本模型SL2T,并首次搭载于Pixel11手机,让手语AI进入消费电子产品。该模型接入Gboard和Live Transcribe,用户通过前置摄像头打手语,即可编辑消息、网页检索及与Gemini对话,替代键盘输入。SL2T基于50多种手语、10万小时素材训练,约四分之一来自美国手语数据集,跨语种联合训练提升识别效果。
谷歌正式发布Pixel 11系列,外观和核心硬件改动有限,主打软件体验与Gemini人工智能深度融合。Gemini具备更强的自主代理执行能力,可在后台高效完成日常繁杂任务,进一步提升智能化使用体验。
谷歌在Google应用测试版推出Gemini每日简报直接提示词定制功能,用户可用文本、语音或预设偏好微调早间AI摘要,打破固定菜单式交互。该功能源于Pixel10 Daily Hub,于2026年I/O大会首秀,新增交互式底部面板,推动早间资讯工具迈入深度个性化阶段。
6月16日,谷歌正式发布Android 17最终版、Wear OS 7及Pixel Drop更新,为Pixel系列注入最新AI基础设施,标志端侧AI应用生态深化。核心战略依托Gemini Omni多模态大模型,全面落地多模态能力,重构底层系统交互。
AI 自动绘画工具,快速生成精美图片。
AI工具,10秒将普通产品照片转为专业照,有模板和自定义功能
使用PixelDojo的AI工具,即时生成逼真或艺术化的胸部图像。
AI技术转换图像为像素艺术,并生成完美文字图像。
QuantStack
基于Flux.1开发的文本到图像生成模型的SVDQ量化版本,提供INT4和FP4两种量化格式,针对不同GPU架构优化,在保持图像质量的同时显著减少显存占用和提升推理速度。
spooknik
PixelWave是基于Flux.1开发的文本到图像模型,经过Nunchaku量化(SVDQ)优化,为不同GPU配置的用户提供了高效的图像生成解决方案。
PolyU-ChenLab
UniPixel-3B是一个用于像素级视觉语言理解的统一多模态大语言模型,能够灵活支持各种细粒度任务,包括图像/视频分割、区域理解以及新颖的PixelQA任务。该模型在视频中联合要求以对象为中心的指称、分割和问答,实现了像素级的视觉推理能力。
TIGER-Lab
PixelReasoner是一个基于Qwen2.5-VL-7B-Instruct的视觉语言模型,采用好奇心驱动强化学习训练,专注于图像文本到文本的任务。
PixelWormhole
基于FLUX.1-dev的LyCORIS适配器,专注于高级时装摄影图像生成
ShoufaChen
PixelFlow 是一个基于流的像素空间生成模型,专注于图像生成任务。
TheLounger
提供Jib Mix Flux V7 Pixel Heaven - beta模型的GGUF格式量化权重,包含3、4和5比特的'K'量化版本
nerijs
专为Stable Diffusion 3.5 Large设计的LoRa模型,用于生成128x128分辨率的像素艺术图像。
Pixel-Dust
基于Stable Diffusion 1.5架构的文本生成图像模型,专门使用CC0许可图像和其他允许自由使用的内容进行训练。
为SD3 Medium打造的像素艺术风格LoRA模型,可生成128x128分辨率的像素艺术作品
基于Stable Diffusion的文本到图像模型,专为生成像素风格的精美图像而设计。
OEvortex
PixelGen是由HelpingAI开发的文本生成图像模型,能够根据文字描述生成高质量图像。
HelpingAI
PixelGen是由HelpingAI开发的先进文本到图像生成模型,拥有34.7亿参数,能够根据文本描述生成高质量的视觉图像,为创意设计和实际应用提供强大的AI工具。
stablediffusionapi
专为生成超现实风格像素艺术图像设计的扩散模型,支持高分辨率输出
artificialguybr
适用于SD 1.5的像素艺术LoRA,能轻松创建精美的像素艺术图像。
专为生成像素艺术图像打造的LORA模型,基于SD XL 1.0架构优化
pixelparty
基于SDXL进行完整模型训练、专为像素艺术效果优化的文本生成图像模型
基于Stable Diffusion XL的像素艺术风格LoRA模型,可生成高质量的像素风格图像
kohbanye
基于Stable Diffusion微调的像素艺术风格图像生成模型
pixelsandpointers
一个专注于生成和理解共情对话的AI模型,能够识别和回应用户的情感需求。
Pixelle MCP是一个基于MCP协议的全模态AIGC解决方案,可将ComfyUI工作流零代码转换为MCP工具,实现LLM与ComfyUI的无缝集成。
Pixeltable的多模态模型上下文协议服务器集合,提供音频、视频、图像和文档的索引与查询功能
该项目为Pixeltable的多模态模型上下文协议服务器集合,提供音频、视频、图像和文档的索引与查询服务,支持Docker本地部署。