机器之心专栏 机器之心编辑部 45 秒单张图片变 3D,无需大量 3D 数据和逐物体优化。 3D AI 生成最近发展得如火如荼,不少最新工作都能够从一句话 / 一张图生成高质量的三维模型。 单张图片生成 3D 通过与现有的文生图模型(如 DALL-E2)结合,One-2-3-45 也支持从任意文本生成 3D 模型。 通过借助这类 2D 扩散生成模型,我们能够从一张图片预测生成对应的多视角图像。 一个很自然的想法,便是将这些多视角图像传给经典的基于 NeRF 的重建方法来生成 3D 模型。 通过结合 2D 扩散生成模型和基于 cost volume 的可泛化 NeRF,One-2-3-45 能够在一次前向传播中生成 3D 模型。 而 One-2-3-45 既支持文字生成 3D 也支持图片生成 3D。下图展示了 One-2-3-45 与现有的主要图生 3D 的方法的对比。
在这篇论文中,我们描述了生成式压缩的概念,也就是数据的压缩使用生成式模型。我们也表明这是一个值得追随的方向,可在图像和视频数据上取得更准确的、视觉上更享受的高压缩重建。 我们也证明,相比于传统的变长度编码方案,生成式压缩在比特误码率上有更大的复原力(例如,从有噪声的无线通信频道)。
⭐ 背景 大家好,我是yma16,这篇文章给大家分享大模型+图片生成的功能,完全免费。由于前两天我参加了掘金coze的一个线下活动,获得了一个内部调用api的机会,于是我就接入了小程序。 实现的效果 小程序地址,点击图片跳转 提示词:宫崎骏风格的天空 提示词:画一只老虎 提示词:一个写代码的女孩 实现的逻辑 在coze编排一个作画的工作流 工作流配置 发布勾选api node_koa
给定一张图,就可以生成一个3D的场景,这个看起来很惊艳的场景,最近被李飞飞团队实现了~用李飞飞的话说,「无论怎样理论化这个想法,都很难用语言描述一张照片或一句话生成3D场景的互动体验。」 它给定的是一个村庄图片,然后就可以生成一个可以随意探索的3D场景。 也可以模拟不同的景深,生成不一样的3d场景:另一个特点在于能够随意改变相机的位置和视野:目前它这个模型的主要特点有三个:相机效果:模型能够模拟景深,实现浅景深和多轴变焦效果,为用户提供类似专业相机的拍摄体验 3D效果:生成的3D场景具有持久现实性,实时控制性,以及正确的几何形状,为用户带来沉浸式的探索体验。走进绘画世界:模型能够从经典艺术作品中生成3D世界,补全原画中没有的内容,为用户提供全新的艺术体验。 还可以模拟滑动变焦,同时调整摄像机的位置和视野:3D 效果大多数生成模型专注于像素预测,但生成 3D 场景具有许多显著优势:持久现实:生成的世界具有持续性,即便视线移开再回到场景,画面依然保持不变,增强了沉浸感和真实感
https://github.com/aiagenta2z/onekey-gatewayhttps://github.com/aiagenta2z/agtm目前支持的Agent的API有搜索,地图,金融,图片生成 ,3D生成详细列表。 GeminiNanobanana这里gemini-nano-banana/gemini-nano-banana是<unique_id>,generate_image_nano_banana是希望执行的函数后面是图片生成的入参 exportDEEPNLP_ONEKEY_ROUTER_ACCESS=your_access_key然后onekeygateway返回Gemini的结果里面获得生图的URL了比如目前支持的Agent的API有搜索,地图,金融,图片生成 ,3D生成详细列表参考:https://deepnlp.org/doc/onekey_gateway2.2使用Google-Maps搜索地址npxonekeyagentgoogle-maps/google-mapsmaps_search_places
Invesalius是专门应用于医学图像3D重建,输入数据必须是一个序列的2D的DICOM图像,可以是CT或者是MRI序列,输出的是3D表面轮廓,该工具就是为生成解剖学的物理模型而做准备的。 3、配置3D表面 3D表面配置可以设置透明度,直接默认值即可,然后下一步。 4、输出结果 直接输出立体图像和相应的3D表面轮廓结果。 ?
3D技术中一个特别热门的子领域是3D模型的生成。创造性地组合3D模型,从图像快速生成3D模型,以及为其他机器学习应用程序和模拟创建综合数据,这只是3D模型生成的众多用例中的少数几个。 ? 它是一种通用算法,不会对3D模型的面或占用进行建模,因此无法仅使用PointNet来生成3D-R2N2采用的体素方法将我们都熟悉的2D卷积扩展到3D,并通过自然地从RGB图像生成水密网格。 PolyGen 架构 PolyGen通过将3D模型表示为顶点和面的严格有序序列,而不是图像,体素或点云,对模型生成任务采取了一种非常独特的方法。 这种严格的排序使他们能够将基于注意力的序列建模方法应用于生成3D网格,就像BERT或GPT模型对文本所做的一样。 PolyGen的总体目标是双重的:首先为3D模型生成一组可能的顶点(可能由图像,体素或类标签来限制),然后生成一系列的面,一个接一个地连接 顶点在一起,为该模型提供了一个合理的表面。
近日,苹果 AI 团队发布最新 AI 模型 GAUDI,它是基于 3D 场景的神经架构 NeRFs,可以根据文字生成 3D 室内场景。 目前为止,NeRFs 主要用做 3D 模型和 3D 场景的一种神经存储介质,然后可以从不同的相机视角进行渲染。 2021 年末时,谷歌通过 Dream Fields 首次展示了 3D AI 生成系统,将 NeRF 生成 3D 视图的能力与 OpenAI 的 CLIP 评估图像内容的能力相结合。 Apple GAUDI 是 3D 内饰专家 虽然谷歌致力于使用 Dream Fields 生成单个对象,但将生成 AI 扩展到完全不受约束的 3D 场景仍是一个尚未解决的问题。 对于这个问题,GAUDI 模型的解决方案是:相机姿态解码器对可能的相机位置进行预测,并确保输出是 3D 场景架构的有效位置。
GLM https://arxiv.org/pdf/2103.10360.pdf GLM是General Language Model的缩写,是一种通用的语言模型预训练框架。 它的主要目标是通过自回归的空白填充来进行预训练,以解决现有预训练框架在自然语言理解(NLU)、无条件生成和有条件生成等任务中表现不佳的问题。 具体来说,GLM通过随机遮盖文本中连续的标记,并训练模型按顺序重新生成这些遮盖的部分。这种自回归的空白填充目标使得GLM能够更好地捕捉上下文中标记之间的依赖关系,并且能够处理可变长度的空白。 c) 自回归生成:GLM使用自回归的方式生成Part B。每个词片段都以[S]作为输入的前缀,以[E]作为输出的后缀。 在生成过程中,模型可以根据之前生成的词片段和Part A中的上下文来预测下一个词片段。 d) 自注意力掩码:为了限制模型的注意力范围,
分享下如何使用它将各种视频或电影文件,转换成上万张图片数据集、壁纸集合,来让下一篇文章中的模型程序“有米下锅”,这个方法特别适合宫崎骏、新海诚这类“壁纸合集”类电影。 如果采用之前文章中提到的生成式模型来制作数据集,比如“Stable Diffusion”或者“Midjourney”,效率恐怕就更不能保障啦,因为即使我使用出图速度比较快的 4090,等我生成够我想要的图片数量 所以,提升转换性能的第一个方案就是,减少不必要的图片数据集的生成。 但是,如果我们随便选择一张图片来看,会发现图片的尺寸依旧是惊人的。 这个尺寸,对于我们后续的处理程序以及模型程序,在解析图片的时候,会有很多不必要的压力。 但是,如果你也和我一样,计划用视频素材来验证一些模型程序,或者实现类似图片搜索引擎的能力验证,还可以选择继续对数据集进行优化。
分享下如何使用它将各种视频或电影文件,转换成上万张图片数据集、壁纸集合,来让下一篇文章中的模型程序“有米下锅”,这个方法特别适合宫崎骏、新海诚这类“壁纸合集”类电影。 如果采用之前文章中提到的生成式模型来制作数据集,比如“Stable Diffusion[5]”或者“Midjourney[6]”,效率恐怕就更不能保障啦,因为即使我使用出图速度比较快的 4090,等我生成够我想要的图片数量 所以,提升转换性能的第一个方案就是,减少不必要的图片数据集的生成。 但是,如果我们随便选择一张图片来看,会发现图片的尺寸依旧是惊人的。 挺大个的一张图,或者应该说每一张图 这个尺寸,对于我们后续的处理程序以及模型程序,在解析图片的时候,会有很多不必要的压力。 但是,如果你也和我一样,计划用视频素材来验证一些模型程序,或者实现类似图片搜索引擎的能力验证,还可以选择继续对数据集进行优化。
---- 新智元报道 编辑:LRS 【新智元导读】通过几张二维照片还原为3D模型一直是一个图形学的一个难题,并且照片的不同光线、相机型号都会影响到最终的生成效果,也限制了模型的实际应用场景 例如给定几张不同角度拍摄的二维图像,神经渲染模型能够生成一个三维模型,而无需任何人工的介入。 在现实场景中,可能你会有一堆手办的照片,如果按照传统的方式都建成3D模型,那需要耗费的工作量,想想都头秃。 除了拍手办以外,游戏从业者还可以利用神经渲染技术,简单地拍摄一些物体的照片,合成3D模型,然后就可以制作出一个完美的游戏场景。 研究人员从NeRF模型出发来改进。NeRF神经网络的训练输入为一张图片,用来推测每个像素的颜色、不透明度和辐射度,并猜测物体中没有出现在二维图像中的小部分的缺失像素。
连续且与分辨率无关的神经 3D 表示推动了 3D 刚体生成建模的最新进展。由于衣服的复杂相互作用、它们的拓扑结构和姿势驱动的变形,为穿着衣服的人建模是一项具有挑战性的任务。 通过学习个人的生成模型,马克斯普朗克智能系统研究所的研究人员希望使 3D 人类化身广泛可用。 这是通过包含一个潜在空间来实现的,用于有条件地生成穿着衣服的人体形状和蒙皮重量。 该团队演示了第一种方法,该方法可以在姿势控制下生成各种 3D 衣服人体形状,并在姿势控制下仅使用姿势扫描。 学习到的蒙皮权重可用于重新定位生成的样本。研究人员对 gDNA 进行了广泛测试,发现它的性能明显优于基线。gDNA 可用于拟合和重新激活 3D 图像,优于当前最先进的 (SOTA) 模型。 结论 马克斯普朗克智能系统研究所的研究人员开发了 gDNA,这是一种 3D 穿衣人体生成模型,可以生成具有精确皱纹和明确姿势控制的各种穿衣人。
近两年,得益于Diffusion模型在2D领域取得的巨大成功以及Objaverse系列大规模3D数据集的开源,3D物体生成领域已经进入迅速发展阶段,3D生成模型数量激增。 同时,为了给社区提供一些直觉上的启发,我们推出3DGen-Arena,一个公开、匿名的评测平台,集成了目前流行的19个开源3D生成模型(包括9个文生3D模型和13个图生3D模型,详情参看下图)。 因此,我们划分为了以下5个独立的维度,进行多维度、全方位的评估,并沿用两两比较的方式,为所有参与的模型确定排名顺序。 几何合理性:一个优秀的3D生成模型需要具备广泛且合理的3D几何先验知识。 另外,为了观察3D生成模型对prompt复杂程度的敏感程度,除了单个物体生成外,我们进一步设计了不同物体间的多种排列组合方式,交互方式,以及一些“微场景”。 3D生成领域是3D视觉领域的重要分支,无论是在学界还是业界,都有着广泛的应用前景和发展潜力。面对生成模型的不断推陈出新,一个全面、有效、鲁棒的评价体系是迫切需要的。
Nerf(神经辐射场)结合,提出DreamFusion,实现了从文字生成3D模型。 在该方法中,给定文本生成的 3D 模型可以从任意角度观察,通过任意照明重新点亮,或合成到任何 3D 环境中。 文字生成图片的扩散模型学习 \epsilon_\phi\left(\mathbf{z}_t ; t, y\right) ,这个网络的条件是文字的嵌入(embedding)。 然而,在该任务中,作者们并不希望对像素进行采样;他们只希望学习出一个3D模型,使得该模型在任意视角下看上去像一张好的图片。 下图中给出了该采样方案与扩散模型采样的对比: 这里,作者使用了简单的生成函数 \mathbf{x}=(\operatorname{flip}(\theta), \theta) 作演示(也即生成一个对称的图片
因此,将分子的三维条件纳入深度生成模型是非常有必要的,但目前在这个方向上的探索相当有限,仍然存在许多问题需要解决。 引入3D信息的一种方法是将现有的基于SMILES的生成模型建立在3D数据上。 然而,这些模型输出的分子不包含3D信息,通常需要一个额外的优化步骤来将分子嵌入到3D空间。一种更理想的方法是直接生成三维坐标。 与之前大多数用于3D分子的自回归模型相比,此方法在一次迭代中生成了所有连接到v∗的原子(图5)。这主要有两个优点。首先,它可以节省计算资源(因为状态编码器对每个步骤只运行一次)。 其次,由于相邻原子的位置是高度相关的,一起生成它们可以隐性地提高模型的性能。 图4:与(a)3D分子生成中的大多数自回归模型不同,模型方法(b)将所有连接到焦点原子上的原子作为一个群生成。 模型生成的分子为蓝色,测试集分子为灰色。 本文仅列出部分实验结果,详见原文。 四、总结 在这项工作中,作者引入了L-Net,一个新的深度生成3D类药分子的模型。
嗯,拍一张肖像,录好演讲音频就可以(手动狗头) 用声音控制肖像生成视频 这个框架名叫VLOGGER。 它主要基于扩散模型,并包含两部分: 一个是随机的人体到3D运动(human-to-3d-motion)扩散模型。 另一个是用于增强文本到图像模型的新扩散架构。 其中,前者负责将音频波形作为输入,生成人物的身体控制动作,包括眼神、表情和手势、身体整体姿势等等。 后者则是一个时间维度的图像到图像模型,用于扩展大型图像扩散模型,使用刚刚预测的动作来生成相应的帧。 Audio-to-motion倒是可以音频生成,方式也是将音频编码为3D人脸动作,不过它生成的效果不够逼真。 Lip sync可以处理不同主题的视频,但只能模拟嘴部动作。 网友吐槽 最后,“老规矩”,谷歌没有发布模型,现在能看的只有更多效果还有论文。 嗯,吐槽也是不少的: 画质模型、口型抽风对不上、看起来还是很机器人等等。
Learning a Probabilistic Latent Space of Object Shapes via 3D Generative-Adversarial Modeling 提供已经训练好的模型
今天接到个小需求:前端生成个二维码并且以img标签的方式在web上展示出来。 二维码就不用说了,搜一下实现的各种插件一大堆,这里我用基于jquery的qrcode插件生成一枚。look~ <! DOCTYPE html> <html> <head> <title>canvas生成图片</title> </head> <body> <script src="//code.jquery.com/jquery 因为canvas已经<em>生成</em>了,所以我们只需要拿来用就OK: var Canvas = $('canvas')[0]; var CRC = Canvas.getContext('2d'); var img 最后一步就是把这个canvas变成一张<em>图片</em>,使用toDataURL的方法 function showPic(){ var dataUrl = $('canvas')[0].toDataURL(' DOCTYPE html> <html> <head> <title>canvas<em>生成</em><em>图片</em></title> </head> <body> <script src="//code.jquery.com/jquery
生成器网络经过训练,能够欺骗鉴别器网络,因此随着训练的进行,它逐渐产生越来越逼真的图像:人工图像看起来与真实图像无法区分,只要鉴别器网络不可能鉴别两张图片。 gan网络将隐空间向量映射到鉴别器鉴别generator由隐空间向量生成图片为真的概率上; 使用带real/fake标签的real、fake图片对Discriminator训练; 要训练Generator ,可以使用gan模型损失对Generator权重的梯度。 Generator 首先,开发一个生成器模型,该模型将矢量(从潜在空间 - 在训练期间将随机采样)转换为候选图像。 GAN通常出现的许多问题之一是生成器卡在生成的看起来像噪声的图像。 经过训练,该模型将使生成器向一个方向移动,从而提高其欺骗鉴别器的能力。这个模型将潜在空间点转换为分类决策(“假”或“真实”) 并且它意味着使用始终“这些是真实图像”的标签进行训练。