谷歌将AI图像生成模型Nano Banana2集成至Google Earth网页版,向全球用户开放。该功能融合卫星影像、航拍与3D地形数据,用户在任意地点输入场景描述,即可自动生成高精度可视化图像。
Roblox发布AI创作工具Build并升级Studio体系,利用人工智能降低开发门槛,用户通过文本提示可直接生成可编辑游戏内容。该功能7月28日开启测试,深化“用户生成内容”理念。平台日活已达1.32亿,Build为移动优先工具,让创作随时随地进行。
高德发布ABot-World Studio,融合交互式视频生成与3D场景构建,用户输入文字或图片即可一键生成高保真、可实时交互的AI数字世界。其技术突破在于支持单张5090显卡本地部署,并打破以往世界模型推理时长限制,实现更低门槛高效创作。
高德发布ABot-World Studio通用世界模型工坊,首度将交互视频生成与3DGS场景生成合一。用户输入文图即可生成可交互分享的AI世界,支持导出视频与3DGS文件。能单卡RTX 5090本地部署,架构不设推理限制。
利用AI将草图、渲染图和照片转化为逼真室内设计、视频和3D场景
一键将照片转化为定制3D角色、场景及可收藏的实体人偶
Blender 与 Claude AI 的集成,助力 3D 建模与场景创建。
1.3B参数的图像转视频模型,用于生成3D一致的新场景视图
Xai
$1.4
Input tokens/M
$3.5
Output tokens/M
2k
Context Length
Openai
$7.7
$30.8
200
-
Anthropic
$105
$525
Google
$0.7
$2.8
1k
$7
$35
Alibaba
$1
$10
256
$2
$20
$8
$240
52
Bytedance
$1.2
$3.6
4
$3.9
$15.2
64
$15.8
$12.7
$0.8
facebook
MapAnything是一个端到端训练的Transformer模型,能够以多种模态作为输入,直接回归场景的分解度量3D几何结构。该模型支持超过12种不同的3D重建任务,包括多图像SfM、多视图立体视觉、单目度量深度估计等。
manycore-research
FLUX.1-Layout-ControlNet是SpatialGen框架的关键组件,是一个基于语义图像条件化的ControlNet模型。它能够根据文本描述生成2D图像,同时严格遵循输入语义图像的布局约束,主要用于3D室内场景合成。
yslan
STream3R是一种基于因果Transformer的可扩展序列3D重建模型,将点云图预测重新定义为仅解码器的Transformer问题。它引入流式处理框架,利用因果注意力高效处理图像序列,能够很好地泛化到各种具有挑战性的场景,包括传统方法经常失效的动态场景。
lhjiang
AnySplat是一种先进的3D高斯散点渲染模型,能够从不同视角的图像高效生成高质量的3D场景。该模型具有快速推理能力和良好的泛化性能,为3D重建和渲染提供了创新的解决方案。
kvuong2711
AerialMegaDepth是一个专注于空地重建与视角合成的深度学习模型,能够从航拍图像中重建3D场景并生成新视角。
OpenGVLab
InternVL3-9B是InternVL3系列中的一款多模态大语言模型,具备卓越的多模态感知与推理能力,支持工具使用、GUI代理、工业图像分析、3D视觉感知等多种应用场景。
3DAIGC
LHM是一个前馈模型,可在数秒内从单张图像重建可动画的3D人体。通过在大规模视频数据集上使用图像重建损失进行训练,我们的模型对多样化的现实场景展现出强大的泛化能力。
VGGT是一种前馈神经网络,能够直接从场景的一个、几个或数百个视图中,在数秒内推断出所有关键的3D属性。
VAST-AI
MIDI是一款面向单图像生成组合式3D场景的生成模型。
Kai422kx
DAS3R是一种用于静态场景重建的3D模型,采用动态感知高斯泼溅技术,能够从图像生成高质量的3D重建效果。
strangerzonehf
基于LoRA微调的3D萌系卡通风格文本生成图像模型,可生成高质量的3D卡通角色和场景
基于LoRA微调的文本生成图像扩散模型,专注于生成等轴测3D风格的场景和物体
WizWhite
一个用于生成纸质微缩模型的LoRA模型,擅长创作平面纸板场景和3D纸质物件,具有复古风格。
Junyi42
MonST3R是一种在运动存在下估算几何形状的简单方法,能够从图像中重建3D场景。
naver
DUSt3R是一个用于从图像轻松实现几何3D视觉的模型,能够从单张或多张图像重建3D场景。
davizca87
Coinmaker是一款专门用于生成硬币资产的LORA模型,基于SDXL 0.9训练而成。它能让电子游戏、渲染等场景中的硬币资产创建变得更加轻松、有趣且美观,尤其适用于3D投影和3D软件中的挤压建模。
BlenderMCP通过MCP协议将Blender与Claude AI连接,实现AI辅助3D建模与场景控制
Blender MCP VXAI 是一个强大的集成工具,允许用户通过自然语言控制 Blender,实现 3D 建模、动画和场景的创建与修改。它简化了复杂操作,并支持实时导出到项目中。
Cinema4D MCP Server是一个连接Cinema 4D与Claude的桥梁,通过提示词辅助进行3D场景操作和建模。
MCP-Slicer是一个将3D Slicer与模型客户端(如Claude)通过MCP协议连接的集成工具,支持通过自然语言直接操作3D Slicer进行医学图像处理和场景控制。
一个基于Firebase Genkit和Gemini的Blender MCP客户端应用,支持通过选择形状、颜色、纹理和场景描述来创建和操作3D场景,并与Blender实时交互。
SketchupMCP是一个通过模型上下文协议(MCP)将Sketchup与Claude AI连接的整合工具,实现AI辅助3D建模和场景控制。
该项目是一个连接Claude AI与Unreal Engine 5的Python服务器,通过自然语言指令实现对UE5场景中3D对象和蓝图演员的创建、修改与控制。
这是一个8th Wall MCP服务器项目,允许用户通过自然语言指令在Claude Desktop中构建WebAR体验。它提供了超过66个工具,支持场景构建、3D模型管理、动画添加、物理效果、资产搜索以及项目文件管理,并能与8th Wall Desktop和云API集成。
该项目是一个连接Claude桌面应用与Unreal Engine 5.3的Python服务器,通过文本指令实现3D场景的创建与编辑,支持基础物体生成、蓝图调用和场景操作等功能。
SHARP是一个由苹果研究开发的AI模型,能够将单张2D照片快速转换为3D高斯泼溅表示,实现照片到交互式3D场景的实时转换,推理时间不到一秒。