谷歌DeepMind推出多語言手語轉文本模型SL2T,並首次搭載於Pixel11手機,讓手語AI進入消費電子產品。該模型接入Gboard和Live Transcribe,用戶通過前置攝像頭打手語,即可編輯消息、網頁檢索及與Gemini對話,替代鍵盤輸入。SL2T基於50多種手語、10萬小時素材訓練,約四分之一來自美國手語數據集,跨語種聯合訓練提升識別效果。
Anthropic簽署歐盟AI法案實踐準則,承諾自2026年8月起,所有新發布的Claude模型將在全球範圍嵌入內容標識,覆蓋API、Claude、Claude Code等全線產品。現有模型設過渡期並推進回溯適配。文本輸出採用隱式水印,不影響可讀性與內容含義。
Meta發佈300億參數開源多模態模型Muse Glimmer,採用寬鬆Apache 2.0許可,專爲本地智能體工作流優化,強化多步推理與工具調用能力,支持文本和視覺處理。這是Llama 4後首次開放模型權重,旨在推動開源AI生態發展。
Anthropic宣佈爲新Claude模型加入不易察覺的水印,以標識AI生成文本來源,水印不影響語義和閱讀,複製粘貼時保留,部分編輯後仍可存在。此舉系根據歐盟《人工智能法案》推動AI透明度,自8月2日起發佈的新模型生成內容支持標記識別,適用於全球用戶。
免費在線AI圖像編輯器,用文本提示編輯圖像,無需註冊
在線AI文本轉語音,14000+逼真聲音,支持角色配音、語音克隆等
SoulVid AI可將文本和歌詞轉化為短劇與MV,輕鬆聊天生成腳本、分鏡和視頻
V2Fun的AI 3D創作平臺,可從文本或圖像生成3D模型、角色、遊戲資源和動畫。
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$6
$24
256
$4
$16
Baidu
128
Bytedance
$1.2
$3.6
4
$2
bartowski
這是對ai-sage的GigaChat3-10B-A1.8B模型進行的量化處理版本,採用llama.cpp的imatrix量化技術,可在不同硬件條件下更高效地運行。模型支持俄語和英語,主要用於文本生成任務。
DevQuasar
這是 ai-sage/GigaChat3-702B-A36B-preview-bf16 模型的量化版本,旨在為大眾提供免費的知識獲取途徑。該模型是一個大型語言模型,專注於文本生成任務。
DakkaWolf
Trouper-12B GGUF是由DarwinAnim8or基於原始模型開發的文本生成模型,專門針對角色扮演和創意寫作場景進行了優化。該模型從Mistral-Nemo-Base-12B微調而來,使用了自定義的'Actors'數據集進行訓練,生成的文本更加自然,避免了常見的'AI語言'特徵。
unsloth
Qwen3-VL-2B-Instruct是Qwen系列中最強大的視覺語言模型,具備卓越的文本理解與生成能力、深入的視覺感知與推理能力、長上下文支持以及強大的空間和視頻動態理解能力。該模型採用2B參數規模,支持指令交互,適用於多模態AI應用。
pnnbao-ump
VieNeu-TTS是首個可在個人設備上運行的越南語文本轉語音模型,具備即時語音克隆能力。基於NeuTTS Air微調,能夠生成自然逼真的越南語語音,在CPU上具備即時性能。
TheStageAI
TheWhisper-Large-V3-Turbo 是 OpenAI Whisper Large V3 模型的高性能微調版本,由 TheStage AI 針對多平臺即時、低延遲和低功耗語音轉文本推理進行優化。支持流式轉錄、單詞時間戳和可擴展性能,適用於即時字幕、會議和設備端語音界面等場景。
TheWhisper-Large-V3是OpenAI Whisper Large V3模型的高性能微調版本,由TheStage AI針對多平臺(NVIDIA GPU和Apple Silicon)的即時、低延遲和低功耗語音轉文本推理進行了優化。
nineninesix
KaniTTS是一款專為即時對話式AI應用優化的高速、高保真文本轉語音模型,採用兩階段管道結合大型語言模型和高效音頻編解碼器,實現卓越的速度和音頻質量。該模型支持西班牙語,具有4億參數,採樣率為22kHz。
KaniTTS是一款專為即時對話式人工智能應用優化的高速、高保真阿拉伯語文本轉語音模型。它採用兩階段流水線架構,結合大語言模型與高效音頻編解碼器,實現卓越的速度和音頻質量,能夠滿足對話式AI、無障礙輔助、研究等多領域的語音合成需求。
KaniTTS是一款專為即時對話式AI應用優化的高速、高保真文本轉語音模型,通過獨特的兩階段架構結合大語言模型與高效音頻編解碼器,實現低延遲與高質量語音合成,即時因子低至0.2,比即時速度快5倍。
LiquidAI
LFM2-VL-3B是Liquid AI開發的多模態視覺語言模型,基於LFM2骨幹架構構建,具備強大的視覺理解和推理能力,特別在細粒度感知任務上表現出色。該模型能夠高效處理文本和圖像輸入,支持高達512×512分辨率的原生圖像處理。
noctrex
這是慧慧AI模型Huihui-MoE-60B-A3B-abliterated的MXFP4_MOE量化版本,為文本生成提供支持。該量化版本基於特定的基礎模型進行處理,能在一定程度上優化模型的性能和使用體驗。
deepseek-ai
DeepSeek-OCR是DeepSeek AI開發的一款先進的光學字符識別模型,專注於探索視覺文本壓縮的邊界,能夠高效地從圖像中提取和轉換文本內容。
citizenplain
這是一個基於Wan2.1-T2V-14B模型訓練的LoRA適配器,專門用於文本到視頻轉換任務。該模型使用AI Toolkit訓練,為視頻生成應用提供支持。
lichorosario
這是一個基於Qwen-Image模型訓練的LoRA(Low-Rank Adaptation)模型,專門用於文本到圖像的生成任務。該項目使用AI Toolkit訓練,能夠將文本描述轉化為高質量的圖像,支持在多種圖像生成工具中使用。
nvidia
NVIDIA GPT-OSS-120B Eagle3是基於OpenAI gpt-oss-120b模型的優化版本,採用混合專家(MoE)架構,具備1200億總參數和50億激活參數。該模型支持商業和非商業使用,適用於文本生成任務,特別適合AI Agent系統、聊天機器人等應用開發。
hyperchainsad
這是一個基於Wan2.2-T2V-A14B基礎模型訓練的文本到視頻LoRA模型,使用AI Toolkit工具包進行訓練,專門用於增強文本到視頻的轉換能力。
abhi099k
基於DeBERTa-v3-large微調的AI文本檢測模型,能夠準確識別文本是由人類撰寫還是AI生成,在自定義數據集上訓練達到約97%的準確率。
synap5e
這是一個基於AI Toolkit by Ostris訓練的文本到視頻LoRA模型,使用Wan2.2-T2V-A14B作為基礎模型,支持文本到視頻的轉換任務,為相關領域的應用提供了強大的支持。
zambawi
joywan-lora是基於AI Toolkit by Ostris訓練的LoRA模型,專門用於文本到視頻和圖像生成任務,需要配合基礎模型Wan-AI/Wan2.1-T2V-14B-Diffusers使用。
LINE Bot MCP Server是一個實現Model Context Protocol (MCP)的服務,用於將AI智能體與LINE官方賬號連接,支持推送文本和富媒體消息、廣播消息及獲取用戶資料等功能。
基於即夢AI的圖像生成服務,專為Cursor IDE設計,實現文本描述到圖像的生成與保存。
基於MaaFramework的MCP服務器,為AI助手提供Android設備和Windows桌面自動化能力,支持OCR識別、點擊、滑動、文本輸入等操作,並能將操作流程轉換為可複用的Pipeline。
MemoryMesh是一個為AI模型設計的知識圖譜服務器,專注於文本RPG和互動敘事,幫助AI維護跨對話的結構化記憶。
MemoryMesh是一個為AI模型設計的知識圖譜服務器,專注於文本角色扮演遊戲和互動敘事。它通過動態模式定義和自動生成工具,幫助AI在對話中維護一致且結構化的記憶,實現更豐富、更動態的交互體驗。
Claude Talk to Figma MCP是一個基於Model Context Protocol的插件,允許Claude Desktop等AI工具直接與Figma交互,實現AI輔助設計功能。項目通過WebSocket服務器連接AI客戶端和Figma插件,支持文檔分析、元素創建修改、文本處理等設計操作。
Neovim與Claude集成的MCP服務器,實現AI輔助文本編輯
一個基於Google Gemini圖像生成模型的MCP服務器,允許AI代理通過文本提示生成、編輯和描述圖像,支持多種模型和配置選項。
Grok MCP插件是一個為Cline提供Grok AI強大功能的接口,支持文本生成、圖像分析和函數調用。
一個基於Cloudflare Workers的MCP服務器,利用WebforAI庫從網頁中提取純文本內容,為AI模型提供網頁數據。
Minimax MCP Tools是一個集成Minimax AI能力的MCP服務器實現,提供圖像生成和文本轉語音功能。
manim-mcp 是一個基於 manimgl 庫的文本轉視頻動畫生成工具,通過多智能體 LLM 流水線將自然語言描述轉換為高質量數學動畫,可作為 CLI 工具、AI 代理或 MCP 服務器與 Claude 等助手集成。
多提供商AI圖像生成服務器,支持Google、ZHIPU AI和阿里雲百鍊,提供文本生成圖像和圖像轉換功能,兼容MCP客戶端應用。
一個集成4o-image API的MCP服務器實現,支持通過標準化協議讓LLM和AI系統生成和編輯圖像,包括文本生成圖像、圖像編輯等功能。
一個為AivisSpeech文本轉語音引擎設計的MCP服務器,支持日語語音合成、多角色聲音選擇和參數配置,實現與AI助手的無縫集成。
MCP-Diagram是一個通過文本描述快速生成多種類型圖表(如架構圖、UML類圖等)的服務器工具,支持與Claude等AI助手集成。
AI視頻生成MCP服務器,支持文本和圖像輸入生成動態視頻,提供多種參數控制和模型選擇。
Naver搜索MCP服務器是一個多平臺通信協議服務,提供對Naver搜索API的訪問,支持博客、新聞、圖書、圖片等多種內容的搜索,並優化了結構化文本響應以供AI代理使用。
Project Synapse是一個革命性的MCP服務器,通過語義分析和知識圖譜技術將文本轉化為互聯知識網絡,並自主生成洞察。它結合Montague語義學和Zettelkasten方法,實現AI的認知協作能力。
AI Humanize MCP Server是一個強大的模型上下文協議服務器,能夠將AI生成的內容優化得更自然、更人性化。它具備AI檢測、自然語言增強、語法修正、可讀性優化等功能,幫助用戶提升文本質量。