谷歌DeepMind推出多語言手語轉文本模型SL2T,並首次搭載於Pixel11手機,讓手語AI進入消費電子產品。該模型接入Gboard和Live Transcribe,用戶通過前置攝像頭打手語,即可編輯消息、網頁檢索及與Gemini對話,替代鍵盤輸入。SL2T基於50多種手語、10萬小時素材訓練,約四分之一來自美國手語數據集,跨語種聯合訓練提升識別效果。
谷歌正式發佈Pixel 11系列,外觀和核心硬件改動有限,主打軟件體驗與Gemini人工智能深度融合。Gemini具備更強的自主代理執行能力,可在後臺高效完成日常繁雜任務,進一步提升智能化使用體驗。
谷歌在Google應用測試版推出Gemini每日簡報直接提示詞定製功能,用戶可用文本、語音或預設偏好微調早間AI摘要,打破固定菜單式交互。該功能源於Pixel10 Daily Hub,於2026年I/O大會首秀,新增交互式底部面板,推動早間資訊工具邁入深度個性化階段。
6月16日,谷歌正式發佈Android 17最終版、Wear OS 7及Pixel Drop更新,爲Pixel系列注入最新AI基礎設施,標誌端側AI應用生態深化。核心戰略依託Gemini Omni多模態大模型,全面落地多模態能力,重構底層系統交互。
AI 自動繪畫工具,快速生成精美圖片。
AI工具,10秒將普通產品照片轉為專業照,有模板和自定義功能
使用PixelDojo的AI工具,即時生成逼真或藝術化的胸部圖像。
AI技術轉換圖像為像素藝術,並生成完美文字圖像。
QuantStack
基於Flux.1開發的文本到圖像生成模型的SVDQ量化版本,提供INT4和FP4兩種量化格式,針對不同GPU架構優化,在保持圖像質量的同時顯著減少顯存佔用和提升推理速度。
spooknik
PixelWave是基於Flux.1開發的文本到圖像模型,經過Nunchaku量化(SVDQ)優化,為不同GPU配置的用戶提供了高效的圖像生成解決方案。
PolyU-ChenLab
UniPixel-3B是一個用於像素級視覺語言理解的統一多模態大語言模型,能夠靈活支持各種細粒度任務,包括圖像/視頻分割、區域理解以及新穎的PixelQA任務。該模型在視頻中聯合要求以對象為中心的指稱、分割和問答,實現了像素級的視覺推理能力。
TIGER-Lab
PixelReasoner是一個基於Qwen2.5-VL-7B-Instruct的視覺語言模型,採用好奇心驅動強化學習訓練,專注於圖像文本到文本的任務。
PixelWormhole
基於FLUX.1-dev的LyCORIS適配器,專注於高級時裝攝影圖像生成
ShoufaChen
PixelFlow 是一個基於流的像素空間生成模型,專注於圖像生成任務。
TheLounger
提供Jib Mix Flux V7 Pixel Heaven - beta模型的GGUF格式量化權重,包含3、4和5比特的'K'量化版本
nerijs
專為Stable Diffusion 3.5 Large設計的LoRa模型,用於生成128x128分辨率的像素藝術圖像。
Pixel-Dust
基於Stable Diffusion 1.5架構的文本生成圖像模型,專門使用CC0許可圖像和其他允許自由使用的內容進行訓練。
為SD3 Medium打造的像素藝術風格LoRA模型,可生成128x128分辨率的像素藝術作品
基於Stable Diffusion的文本到圖像模型,專為生成像素風格的精美圖像而設計。
HelpingAI
PixelGen是由HelpingAI開發的先進文本到圖像生成模型,擁有34.7億參數,能夠根據文本描述生成高質量的視覺圖像,為創意設計和實際應用提供強大的AI工具。
OEvortex
PixelGen是由HelpingAI開發的文本生成圖像模型,能夠根據文字描述生成高質量圖像。
stablediffusionapi
專為生成超現實風格像素藝術圖像設計的擴散模型,支持高分辨率輸出
artificialguybr
適用於SD 1.5的像素藝術LoRA,能輕鬆創建精美的像素藝術圖像。
專為生成像素藝術圖像打造的LORA模型,基於SD XL 1.0架構優化
pixelparty
基於SDXL進行完整模型訓練、專為像素藝術效果優化的文本生成圖像模型
基於Stable Diffusion XL的像素藝術風格LoRA模型,可生成高質量的像素風格圖像
kohbanye
基於Stable Diffusion微調的像素藝術風格圖像生成模型
pixelsandpointers
一個專注於生成和理解共情對話的AI模型,能夠識別和回應用戶的情感需求。
Pixelle MCP是一個基於MCP協議的全模態AIGC解決方案,可將ComfyUI工作流零代碼轉換為MCP工具,實現LLM與ComfyUI的無縫集成。
Pixeltable的多模態模型上下文協議服務器集合,提供音頻、視頻、圖像和文檔的索引與查詢功能
該項目為Pixeltable的多模態模型上下文協議服務器集合,提供音頻、視頻、圖像和文檔的索引與查詢服務,支持Docker本地部署。