近日,苹果 AI 团队发布最新 AI 模型 GAUDI,它是基于 3D 场景的神经架构 NeRFs,可以根据文字生成 3D 室内场景。 2021 年末时,谷歌通过 Dream Fields 首次展示了 3D AI 生成系统,将 NeRF 生成 3D 视图的能力与 OpenAI 的 CLIP 评估图像内容的能力相结合。 Apple GAUDI 是 3D 内饰专家 虽然谷歌致力于使用 Dream Fields 生成单个对象,但将生成 AI 扩展到完全不受约束的 3D 场景仍是一个尚未解决的问题。 在对四个不同数据集(包括室内扫描数据集 ARKitScences)的实验中,研究人员表明 GAUDI 可以重建学习视图并匹配现有方法的质量。 虽然现在 GAUDI 生成的 3D 场景视频质量还不是很高,但这也说明了 AI 在图像和视频技术这生成的另一种可能。
3D技术中一个特别热门的子领域是3D模型的生成。创造性地组合3D模型,从图像快速生成3D模型,以及为其他机器学习应用程序和模拟创建综合数据,这只是3D模型生成的众多用例中的少数几个。 ? 使用top-p = 0.9的核采样和地面真实网格(蓝色)生成的图像条件样本(黄色)。 但是,在3D深度学习研究领域,为数据选择合适的表示是成功的一半。 在计算机视觉中,数据的结构非常简单:由密集像素组成的图像,这些像素整齐均匀地排列在精确的网格中。3D数据的世界没有这种一致性。3D模型可以表示为体素,点云,网格,多视图图像集等。 3D重建问题和3D-R2N2方法 当今非常经典的PointNet论文为建模点云数据(例如3D模型的尖端)提供了蓝图。 它是一种通用算法,不会对3D模型的面或占用进行建模,因此无法仅使用PointNet来生成3D-R2N2采用的体素方法将我们都熟悉的2D卷积扩展到3D,并通过自然地从RGB图像生成水密网格。
Invesalius是专门应用于医学图像3D重建,输入数据必须是一个序列的2D的DICOM图像,可以是CT或者是MRI序列,输出的是3D表面轮廓,该工具就是为生成解剖学的物理模型而做准备的。 可以看到原始数据会以中轴切面,矢状切面,冠状切面来进行显示,而立体就是最后输出结果示意图。 ? 2、选取感兴趣区域 接下来就是要提取图像中感兴趣的区域了,比如要提取人体肋骨。 3、配置3D表面 3D表面配置可以设置透明度,直接默认值即可,然后下一步。 4、输出结果 直接输出立体图像和相应的3D表面轮廓结果。 ?
最近,3D药物设计的生成模型因其在蛋白质口袋中直接设计配体的潜力而获得了广泛关注。然而,目前的方法通常存在采样时间非常慢或生成分子的化学有效性差的问题。 最后,作者比较了MolFlow与当前方法在生成高质量样本方面的能力,进一步展示了其强大性能。 3D药物设计的生成模型最近因其在蛋白质口袋中直接设计配体的潜力而引起了极大关注。 其他模型尝试训练无条件的3D分子生成器作为起点,尤其是那些应用扩散模型到分子坐标上的模型已经变得特别流行。 现有的3D分子生成器,使用完全连接的消息传递,表现出非常差的扩展性,无法处理更大的分子和更大的模型尺寸。最先进的无条件生成器在采样单批分子时需要数分钟,使其不适合基于RL的微调。 由于现有的3D生成模型在推理时已经需要知道N,因此使用尺度OT时对采样没有额外的限制。
腾讯元宝首发的3D生成应用,利用一张图片即可生成3D角色的技术,是人工智能领域的一个重要创新。这种技术的应用会极大地影响娱乐、游戏开发、虚拟现实和在线购物等行业。 生成3D角色的过程涉及到先进的算法,如生成对抗网络,这些算法能够在训练过程中不断优化,提高生成的3D模型的质量和逼真度。 用户可以快速生成个人3D角色,便于进行360度全方位查看,并可选择分享、转发或者公开。提供保存3D角色模型文件做二次编辑,以及生成3D打印链接,实现从虚拟模型到完整实体的创意体验。 (一)《Protolabs 2024年3D打印趋势报告》显示,3D打印市场正经历显著扩张,将人工智能技术和3D生成结合,可实现更高效、更高质量的内容生成。 (二)此技术的推出会对3D打印和个性化内容创造领域产生积极影响。(三)基于腾讯混元大模型打造的“3D角色梦工厂”,在技术上已具备生成动漫、建筑、游戏道具等类型的3D资产的能力。
机器之心专栏 机器之心编辑部 45 秒单张图片变 3D,无需大量 3D 数据和逐物体优化。 3D AI 生成最近发展得如火如荼,不少最新工作都能够从一句话 / 一张图生成高质量的三维模型。 方法 由于 3D 数据的稀缺性,学术界最近的绝大多数 3D AI 生成工作都通过利用 2D 扩散生成模型来指导 3D 表示(如 NeRF)的优化,从而实现 3D 内容生成。 由于这类方法通过从训练数据学习了有关多视角预测不一致性的先验知识,他们更有希望能从不一致的多视角预测中生成 3D 模型。 、输出的几何表示、结果的 3D 一致性、与输入的相似性,以及所需的 3D 数据规模上,具有多方面的优势。 由于 3D 数据的稀缺性,这样的训练数据规模目前对于很多研究者 / 机构来说还是比较严苛的条件。
新智元报道 来源:VB 编辑:元子 【新智元导读】Microsoft Research近日发表论文介绍了一种通过2D数据生成3D模型的新框架,其使用3D卷积GAN,利用2D图像提供的物体表面之间的曝光差异成功检测出凹形物体的内部结构 研究人员称,该框架是首个针对2D数据的3D模型的“可缩放”训练技术。 与以前的工作相反,研究人员试图利用功能齐全的工业渲染器,例如显示数据生成图像的软件。为此,他们训练了3D形状的生成模型,以便生成与2D数据集的分布相匹配的图像。 生成器模型采用随机输入向量(代表数据集特征的值)并生成3D对象的连续体素表示(3D空间中网格上的值)。 从3D模型生成的一系列合成数据集和一个现实生活的数据集,他们合成了来自不同对象类别的图像,并在整个训练过程中从不同的角度对其进行了渲染。
计算机生成的全息(CGH)通过对衍射和干涉的数值模拟实现了高空间角度的3D投影。 长期以来,研究人员一直在研究制作全息图的技术,但是,现有的基于物理的方法无法生成具有按像素聚焦控制和精确遮挡的全息图。 研究人员通过引入具有4,000对RGB深度图像和相应的3D全息图的大规模CGH数据集(MIT-CGH-4K)进行训练。 ? 训练神经网络通常需要庞大的高质量数据集,而3D全息图以前没有这种数据集。 研究人员引入了大规模菲涅耳全息图数据集MIT-CGH-4K,该数据集由4,000对RGB深度(RGB-D)图像和相应的3D全息图组成。 研究人员创建的数据集具有三个重要功能,以使CNN能够学习逼真的3D全息图。
前言 今天要给大家分享一个很Nice的 3D 生成工具集—MVEdit! 项目介绍 MVEdit 是一个基于控制的多视角编辑的通用3D扩散适配器,使用现成的2D稳定扩散模型进行3D生成和编辑。 无需繁琐的训练,MVEdit 就能够快速生成高质量的3D物体,并提供全功能的UI界面,包含了诸如text to 3D、image to 3D、3D to 3D文字编辑和材质重构等功能。 生成:利用现成的 2D 稳定扩散模型,MVEdit 能够生成具有高质量纹理和结构的 3D 生成物。 • 顶尖性能:在文本引导的纹理生成和图像到 3D 生成等评估中表现出色。
输出端给的是,一个几何+参数化逻辑底座的可编辑3D模型,可以导出到Rhino、Grasshopper、GLB等主流CAD/BIM流程。我也试了一下。 我拿北京央视「大裤衩」的一张草图,让Plamo生成对应的3D模型。最后生成成功了,但整体效果质量还有待提高。这是输入的草图与提示词:使用这张建筑草图作为中央电视台总部大楼三维质量模型研究的抽象参考。 生成了10分钟左右,结果是这样体量是没有对的,不过话说回来,我认为能生成已经非常不错了。 原因是web端(浏览器里做3D模型生成)有几个基础瓶颈要解决——浏览器内的几何内核、显存、长流程的状态管理——这些都是工程上很难绕过去的坎,Plamo能把流程跑通本身已经是突破。 除了Illoca,还有胡政涛的AtomicArch1人10个月,做了一款AI原生建筑3D设计软件,用14万行代码重写CAD底层、看到AIRILab最近在探索3D生成、哈佛系的Reer独家|哈佛系Reer
, Manolis and Song, Shuran and Zeng, Andy and Zhang, Yinda}, journal={International Conference on 3D The dataset consists of several types of annotations: color and depth images, camera poses, textured 3D
="#7BC8A4"></a-plane> <a-sky color="#ECECEC"></a-sky> </a-scene> </body> </html> 中场休息下♨️ 2 书籍封面生成 此部分采用的是 canvas 的原生开发,通过 canvas 生成图案,后导出 base64 作为模型的贴图。 需要先定义几个函数: 书名生成 getTitle 书籍难度生成 getLevel 配色生成 getColors 此处采用的逻辑都是随机从库里数据(随机是最好的方法),例如配色的生成代码: function : 1 根据封面的尺寸,等分,生成网格; 2 随机生成几个六边形或五边形; 3 计算生成的六边形及五边形按照正态分布随机摆放的位置及大小。 5 生成背景图 比较重要的算法就是按照正态分布产生随机数的算法,代码: function mathNormal(x, mu, sigma) { mu = mu || 0; sigma = sigma
因此,将分子的三维条件纳入深度生成模型是非常有必要的,但目前在这个方向上的探索相当有限,仍然存在许多问题需要解决。 引入3D信息的一种方法是将现有的基于SMILES的生成模型建立在3D数据上。 然而,这些模型输出的分子不包含3D信息,通常需要一个额外的优化步骤来将分子嵌入到3D空间。一种更理想的方法是直接生成三维坐标。 为了使该网络能够生成类药分子,作者构建了ChEMBL数据集的类药分子子集,并创建了一个“专家轨迹”,用于生成数据集中的每个分子,然后通过模仿这些轨迹来训练L-Net。 还可以注意到,在生成的分子和真实分子的QED分布之间出现了很大的差异(图8f)。这是在数据选择过程中,硬截止值为0.5的结果。 图7. 利用不同的超参数生成的分子的二维分子性质分布。 模型生成的分子为蓝色,测试集分子为灰色。 本文仅列出部分实验结果,详见原文。 四、总结 在这项工作中,作者引入了L-Net,一个新的深度生成3D类药分子的模型。
机器之心发布 机器之心编辑部 清华大学 TSAIL 团队最新提出的文生 3D 新算法 ProlificDreamer,在无需任何 3D 数据的前提下能够生成超高质量的 3D 内容。 这种技术可以从简单的文本描述中生成具体的 3D 模型,为设计师、游戏开发者和数字艺术家提供强大的工具。 然而,为了根据文本生成准确的 3D 模型,传统方法需要大量的标记 3D 模型数据集。 这些数据集需要包含多种不同类型和风格的 3D 模型,并且每个模型都需要与相应的文本描述相关联。创建这样的数据集需要大量的时间和人力资源,目前还没有现成的大规模数据集可供使用。 由谷歌提出的 DreamFusion [1] 利用预训练的 2D 文本到图像扩散模型,首次在无需 3D 数据的情况下完成开放域的文本到 3D 的合成。 stable-diffusion),Dreamfusion [1] 提出可以在不借助任何 3D 数据的情况下实现开放域的文到 3D 内容(text-to-3D)生成。
无需依赖真实标注,仅凭文字提示即可生成高质量3D场景在自动驾驶、机器人导航等领域,3D场景的感知与生成一直是研究热点。 然而,传统方法通常将这两个过程分离:生成模型仅仅作为数据增强工具,为下游感知任务提供合成数据。这种方法不仅灵活性有限,生成的场景也往往缺乏对感知任务有价值的细节。 近日,上海交通大学与宁波数字孪生研究院联合团队提出了一种名为OccScene的创新范式,将细粒度3D感知与高质量场景生成统一在同一个框架中,实现了跨任务的互利共赢。 传统方法的三大挑战现有3D场景生成方法面临三大核心问题:灵活性有限:依赖真实标注数据(如3D边界框、BEV地图)进行推理,标注成本高且难以生成多样化的边缘案例约束不足:使用区域级粗糙先验无法提供像素级细粒度语义和几何指导目标不明确 /视频及其对应语义占据,为自动驾驶和机器人领域带来了实际价值:无需标注数据即可生成多样化训练样本增强感知模型在复杂场景下的理解能力支持一致性视频生成与编辑,适应动态环境未来展望OccScene为3D场景理解与生成开辟了新路径
DreamFusion 的优点是几乎不需要事先训练,实现了在没有 3D 数据的情况下生成物体 3D 表示,缺点是速度慢(长达数个小时)。 VAST 认为,AI 要想在 3D 生成领域获得长足发展,同样需要跳出对人类知识的依赖,凭借更庞大的数据和更多的计算「学习」一种「通用方法」。 复用强大的 2D 图像生成模型,以文字为条件,同步生成解耦的多视角一致的法向和基础色;2. 结合在大量 3D 数据训练的可泛化 3D 重建模型,从多视角图片生成基础 3D 先验;3. 由于优质、原生、多样化的 3D 数据集资源的稀缺,模型的最终表现受限,导致可以生成的 3D 内容有限,泛化能力不足。 随着对高质量数据集的更深入利用和算法的不断进步,Tripo 未来有望在极短时间内创造出质量媲美人工建模水准的作品。 3D 生成,何时迎来「ChatGPT 时刻」?
连续且与分辨率无关的神经 3D 表示推动了 3D 刚体生成建模的最新进展。由于衣服的复杂相互作用、它们的拓扑结构和姿势驱动的变形,为穿着衣服的人建模是一项具有挑战性的任务。 通过学习个人的生成模型,马克斯普朗克智能系统研究所的研究人员希望使 3D 人类化身广泛可用。 它们提供了第一种方法来生成具有独特身份和形状的多样化 3D 虚拟个体,这些个体出现在各种服装风格和位置,具有逼真的细节,例如服装上的褶皱。 这是通过包含一个潜在空间来实现的,用于有条件地生成穿着衣服的人体形状和蒙皮重量。 该团队演示了第一种方法,该方法可以在姿势控制下生成各种 3D 衣服人体形状,并在姿势控制下仅使用姿势扫描。 结论 马克斯普朗克智能系统研究所的研究人员开发了 gDNA,这是一种 3D 穿衣人体生成模型,可以生成具有精确皱纹和明确姿势控制的各种穿衣人。
近两年,得益于Diffusion模型在2D领域取得的巨大成功以及Objaverse系列大规模3D数据集的开源,3D物体生成领域已经进入迅速发展阶段,3D生成模型数量激增。 基于学习的自动评测体系则受到数据的制约,另一方面,语言和图像领域为我们提供了人工评测方式的新思路。 几何合理性:一个优秀的3D生成模型需要具备广泛且合理的3D几何先验知识。 几何精细度:提升几何精细度是提升3D生成质量的重要方向。 考虑到部分文生3D模型漫长的训练时长,以及我们复杂的数据后处理,目前3DGen-Arena暂不支持开放式输入的在线生成。 3D生成领域是3D视觉领域的重要分支,无论是在学界还是业界,都有着广泛的应用前景和发展潜力。面对生成模型的不断推陈出新,一个全面、有效、鲁棒的评价体系是迫切需要的。
为了训练 MIME,本文构建了一个包含交互人物和自由空间人物的 3D 场景数据集 3D FRONT HUMAN。 为了训练 MIME,我们向 3D FRONT 数据集中填充 3D 人物,构建了名为 3D FRONT Human 的新数据集。 一个包含交互人物和自由空间人物的 3D 场景数据集,该数据集通过将 RenderPeople 的静态姿势和 AMASS 的运动数据填充至 3D FRONT 来构建。 方法 图 2:方法总览。 我们通过在 3D FRONT 中的 3D 房间中填充互动人物来生成一个包含大量房间和各种人物互动的新数据集 3D FRONT HUMAN。 FID 分数和类别 KL 散度用于评估生成场景相较真实场景的真实性与多样性。 表 2:PROXD 数据集上的 3D 物体准确性比较。
然而,大多数现有生成模型只能顾及其一: 方法类型 3D结构建模 合成路径建模 代表方法 扩散/流匹配模型 ✅ 强 ❌ 无 DiffSBDD, TargetDiff, MolCRAFT GFlowNet 核心问题定义 2.1 正式定义 给定靶蛋白口袋 ,目标是生成分子 ,其中: • :组合结构,即有序的合成单元序列(合成路径) • :连续状态,即每个合成单元对应的原子3D坐标 生成过程须使 的奖励函数 方法论:CGFlow 框架 3.1 数据表示 对象 的数学形式化: • 组合结构 :有序序列 ,第 个单元 在第 步生成轨迹中被加入 • 连续状态 :,其中 , 为第 个单元的原子数 边界条件 替代训练目标(无奖励函数时) 当奖励函数不可用或目标为拟合数据分布时,采用交叉熵损失: 4. 距离编码在图边中,使模型能推理3D空间关系。