谷歌被曝基于DeepThink V3打造实验模型Mathematica,针对复杂计算与符号问题求解优化,或成最强数学推理AI。API显示其内部标识符为“models/deepthink-mathematica-tf-raw-thoughts”,支持百万token上下文,输出上限65536 token,并标注“不稳定实验版”。
腾讯发布混元 Hy4 preview 开源模型,总参数770B、激活参数49B,上下文长度1M。官方称预训练与后训练同步进步,智能水平跃升,居开源第一梯队。模型已在 HuggingFace、GitHub、ModelScope、Gitcode 上线,并接入腾讯云 TokenHub 与 OpenRouter。生产力场景盲测力压 GLM-5.3 与 Kimi K3。
腾讯混元8月28日发布开源旗舰大模型Hy4preview,总参数770B、激活参数49B,上下文1M,定位真实生产力。模型已开源至HuggingFace、GitHub、ModelScope等,并上线腾讯云TokenHub、OpenRouter,可在WorkBuddy/CodeBuddy、元宝、ima体验。其依托软工、游戏、金融、安全等领域专家数据共建,在四大方向取得进展。
苹果公司高管在WWDC 2026后回应“AI模型为Gemini套壳版”的猜测,强调Apple Foundation Models(AFM)完全自主研发,非简单借用谷歌Gemini技术。虽在蒸馏与训练中借助Gemini,但最终产品基于苹果自有代码、技术和数据体系,独立完成。
开源AI模型数据库,涵盖模型规格、定价和特性信息
汇聚先进机器学习模型,提供一站式服务,共建开源社区。
为Firefox浏览器翻译功能优化的CPU加速神经机器翻译模型。
一款能够生成电影级质量视频的图像到视频模型
Moonshot
$200
输入tokens/百万
输出tokens/百万
131
上下文长度
modelscope
Nexus-Gen是一个将大语言模型的语言推理能力与扩散模型的图像生成能力相融合的统一模型
UCSC-VLAA
VLAA-Thinker是一个创新的视觉语言模型,能够同时处理图像和文本输入,并生成高质量的文本输出。该模型基于论文《SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models》的研究成果开发,专注于类似R1的推理能力。
Gemini
GemmaX2-28-9B-v0.1-Q2_K-GGUF 是一个基于 ModelSpace/GemmaX2-28-9B-v0.1 转换而来的 GGUF 格式模型,支持多种语言的翻译任务。
ModelsLab
鱼语语音 V1.5 是一款领先的文本转语音(TTS)模型,基于超过100万小时的多语言音频数据训练而成。
基于T5-base的提示词增强模型,可将简短提示扩展为详细描述
这是一个基于OpenCLIP框架、在LAION-2B英语子集上训练的视觉语言模型,擅长零样本图像分类和跨模态检索任务。
ControlNet++是一款强大的图像生成与编辑模型,支持多种控制条件,能生成高分辨率图像,视觉效果可与Midjourney相媲美。
基于Apache-2.0许可证的开源模型,具体功能和用途需参考完整文档
hazyresearch
M2-BERT-8K是一个8000万参数的长上下文检索模型,基于论文《Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERT》提出的架构。
基于Llama3-8b-instruct基础模型训练,适配中文通用场景,支持ReACT格式的智能体调用
rjhugs
基于microsoft/table-transformer-structure-recognition-v1.1-all微调的表格结构识别模型
M2-BERT-128是论文《Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERT》中提出的8000万参数检索模型检查点
openskyml
基于SDXL-Turbo的文本到图像生成模型,结合了LCM(Latent Consistency Models)和LoRA(Low-Rank Adaptation)技术,实现快速高质量的图像生成。
cerspense
一款基于Modelscope的无水印视频生成模型,优化16:9画面比例和流畅视频输出
vdo
基于diffusers的文本转视频模型,通过ModelScope微调实现动漫风格呈现,训练分辨率为512x512像素。
strangeman3107
这是一个基于diffusers的文本转视频模型,通过modelscope微调后具有动漫风格外观,支持448x384分辨率。
ali-vilab
多阶段文本生成视频扩散模型,输入英文描述文本即可生成符合文字叙述的视频内容
wavymulder
一个基于稳定扩散技术的文本到图像生成模型,能够根据文本描述生成高质量的图像。
一个基于ModelScope图像生成API的MCP服务器,支持通过自然语言提示词异步生成图像,并自动保存到本地文件。