首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏机器之心

    3D AI生成出新玩法了:无需数小时,只要45秒,单张图片即可生成 3D模型

    机器之心专栏 机器之心编辑部 45 秒单张图片3D,无需大量 3D 数据和逐物体优化。 3D AI 生成最近发展得如火如荼,不少最新工作都能够从一句话 / 一张图生成高质量的三维模型。 单张图片生成 3D 通过与现有的文生图模型(如 DALL-E2)结合,One-2-3-45 也支持从任意文本生成 3D 模型。 通过借助这类 2D 扩散生成模型,我们能够从一张图片预测生成对应的多视角图像。 一个很自然的想法,便是将这些多视角图像传给经典的基于 NeRF 的重建方法来生成 3D 模型。 通过结合 2D 扩散生成模型和基于 cost volume 的可泛化 NeRF,One-2-3-45 能够在一次前向传播中生成 3D 模型。 而 One-2-3-45 既支持文字生成 3D 也支持图片生成 3D。下图展示了 One-2-3-45 与现有的主要图生 3D 的方法的对比。

    4.5K30编辑于 2023-08-07
  • 来自专栏CreateAMind

    生成模型压缩图片

    在这篇论文中,我们描述了生成式压缩的概念,也就是数据的压缩使用生成模型。我们也表明这是一个值得追随的方向,可在图像和视频数据上取得更准确的、视觉上更享受的高压缩重建。 我们也证明,相比于传统的变长度编码方案,生成式压缩在比特误码率上有更大的复原力(例如,从有噪声的无线通信频道)。

    66320发布于 2018-07-24
  • 来自专栏前端javascript

    模型+图片生成+小程序

    ⭐ 背景 大家好,我是yma16,这篇文章给大家分享大模型+图片生成的功能,完全免费。由于前两天我参加了掘金coze的一个线下活动,获得了一个内部调用api的机会,于是我就接入了小程序。 实现的效果 小程序地址,点击图片跳转 提示词:宫崎骏风格的天空 提示词:画一只老虎 提示词:一个写代码的女孩 实现的逻辑 在coze编排一个作画的工作流 工作流配置 发布勾选api node_koa

    1.3K11编辑于 2024-04-10
  • 来自专栏算法一只狗

    首个「空间智能」模型发布,仅需要一张图片即可生成 3D 场景

    它给定的是一个村庄图片,然后就可以生成一个可以随意探索的3D场景。 也可以模拟不同的景深,生成不一样的3d场景:另一个特点在于能够随意改变相机的位置和视野:目前它这个模型的主要特点有三个:相机效果:模型能够模拟景深,实现浅景深和多轴变焦效果,为用户提供类似专业相机的拍摄体验 3D效果:生成3D场景具有持久现实性,实时控制性,以及正确的几何形状,为用户带来沉浸式的探索体验。走进绘画世界:模型能够从经典艺术作品中生成3D世界,补全原画中没有的内容,为用户提供全新的艺术体验。 还可以模拟滑动变焦,同时调整摄像机的位置和视野:3D 效果大多数生成模型专注于像素预测,但生成 3D 场景具有许多显著优势:持久现实:生成的世界具有持续性,即便视线移开再回到场景,画面依然保持不变,增强了沉浸感和真实感 在今年4月的TED演讲中,李飞飞进一步分享了她对空间智能的深刻思考。她指出:「所有具备空间智能的生物,其行动能力都是与生俱来的,这种能力的核心在于能够将感知与行动紧密关联。」

    90920编辑于 2025-01-07
  • OneKey Gateway x agtm 给你的Agent 装上30+Nano Banana图片生成3D模型生成的能力

    https://github.com/aiagenta2z/onekey-gatewayhttps://github.com/aiagenta2z/agtm目前支持的Agent的API有搜索,地图,金融,图片生成3D生成详细列表。 GeminiNanobanana这里gemini-nano-banana/gemini-nano-banana是<unique_id>,generate_image_nano_banana是希望执行的函数后面是图片生成的入参 exportDEEPNLP_ONEKEY_ROUTER_ACCESS=your_access_key然后onekeygateway返回Gemini的结果里面获得生图的URL了比如目前支持的Agent的API有搜索,地图,金融,图片生成3D生成详细列表参考:https://deepnlp.org/doc/onekey_gateway2.2使用Google-Maps搜索地址npxonekeyagentgoogle-maps/google-mapsmaps_search_places

    27410编辑于 2026-03-22
  • 来自专栏最新医学影像技术

    3D人体模型生成案例分享

    Invesalius是专门应用于医学图像3D重建,输入数据必须是一个序列的2D的DICOM图像,可以是CT或者是MRI序列,输出的是3D表面轮廓,该工具就是为生成解剖学的物理模型而做准备的。 3、配置3D表面 3D表面配置可以设置透明度,直接默认值即可,然后下一步。 4、输出结果 直接输出立体图像和相应的3D表面轮廓结果。 ?

    1.6K40发布于 2020-06-29
  • 来自专栏DeepHub IMBA

    使用PolyGen和PyTorch生成3D模型

    3D技术中一个特别热门的子领域是3D模型生成。创造性地组合3D模型,从图像快速生成3D模型,以及为其他机器学习应用程序和模拟创建综合数据,这只是3D模型生成的众多用例中的少数几个。 ? 它是一种通用算法,不会对3D模型的面或占用进行建模,因此无法仅使用PointNet来生成3D-R2N2采用的体素方法将我们都熟悉的2D卷积扩展到3D,并通过自然地从RGB图像生成水密网格。 PolyGen 架构 PolyGen通过将3D模型表示为顶点和面的严格有序序列,而不是图像,体素或点云,对模型生成任务采取了一种非常独特的方法。 这种严格的排序使他们能够将基于注意力的序列建模方法应用于生成3D网格,就像BERT或GPT模型对文本所做的一样。 PolyGen的总体目标是双重的:首先为3D模型生成一组可能的顶点(可能由图像,体素或类标签来限制),然后生成一系列的面,一个接一个地连接 顶点在一起,为该模型提供了一个合理的表面。

    2.1K10发布于 2020-11-09
  • 来自专栏AI科技大本营的专栏

    苹果发布 AI 生成模型 GAUDI,文字生成 3D 场景

    近日,苹果 AI 团队发布最新 AI 模型 GAUDI,它是基于 3D 场景的神经架构 NeRFs,可以根据文字生成 3D 室内场景。 目前为止,NeRFs 主要用做 3D 模型3D 场景的一种神经存储介质,然后可以从不同的相机视角进行渲染。 2021 年末时,谷歌通过 Dream Fields 首次展示了 3D AI 生成系统,将 NeRF 生成 3D 视图的能力与 OpenAI 的 CLIP 评估图像内容的能力相结合。 Apple GAUDI 是 3D 内饰专家 虽然谷歌致力于使用 Dream Fields 生成单个对象,但将生成 AI 扩展到完全不受约束的 3D 场景仍是一个尚未解决的问题。 对于这个问题,GAUDI 模型的解决方案是:相机姿态解码器对可能的相机位置进行预测,并确保输出是 3D 场景架构的有效位置。

    1.1K20编辑于 2022-12-09
  • 来自专栏我爱计算机视觉

    开源 4D 生成框架 | 4DGen: 基于动态 3D 高斯的可控 4D 生成

    4DGen提出了“Grounded 4D Generation“的形式,通过利用视频序列和可选的3D模型作为4D生成的控制信息,可以实现更为精准的4D内容生成。 用户可通过输入视频序列或3D模型来约束4D结果的运动和外观;当用户仅提供单张图片作为输入时,可借助预训练好的视频生成模型来得到视频序列;当用户未提供3D模型时,可通过单张图片重建3D模型来作为起始点。 方法介绍 4DGen框架的输入起始点为用户给定或者模型生成的视频序列,对于任意的单张图片,借助多视角生成模型(multi-view diffusion model),可以得到不同视角的图片4DGen通过对第一帧多视图进行三维重建,得到初始的静态3D Gaussians作为4D生成的起始点。 由于4D数据的匮乏,需要尽可能的从先验模型中蒸馏信息。 总结 4DGen定义了” Grounded 4D Generation“的任务形式,通过视频序列和可选3D模型的引入提升了4D生成的可控性。

    1.3K10编辑于 2024-01-02
  • 来自专栏为了不折腾而去折腾的那些事

    开源软件 FFmpeg 生成模型使用图片数据集

    分享下如何使用它将各种视频或电影文件,转换成上万张图片数据集、壁纸集合,来让下一篇文章中的模型程序“有米下锅”,这个方法特别适合宫崎骏、新海诚这类“壁纸合集”类电影。 如果采用之前文章中提到的生成模型来制作数据集,比如“Stable Diffusion”或者“Midjourney”,效率恐怕就更不能保障啦,因为即使我使用出图速度比较快的 4090,等我生成够我想要的图片数量 所以,提升转换性能的第一个方案就是,减少不必要的图片数据集的生成。 但是,如果我们随便选择一张图片来看,会发现图片的尺寸依旧是惊人的。 这个尺寸,对于我们后续的处理程序以及模型程序,在解析图片的时候,会有很多不必要的压力。 但是,如果你也和我一样,计划用视频素材来验证一些模型程序,或者实现类似图片搜索引擎的能力验证,还可以选择继续对数据集进行优化。

    1K20编辑于 2023-11-14
  • 来自专栏为了不折腾而去折腾的那些事

    开源软件 FFmpeg 生成模型使用图片数据集

    分享下如何使用它将各种视频或电影文件,转换成上万张图片数据集、壁纸集合,来让下一篇文章中的模型程序“有米下锅”,这个方法特别适合宫崎骏、新海诚这类“壁纸合集”类电影。 如果采用之前文章中提到的生成模型来制作数据集,比如“Stable Diffusion[5]”或者“Midjourney[6]”,效率恐怕就更不能保障啦,因为即使我使用出图速度比较快的 4090,等我生成够我想要的图片数量 所以,提升转换性能的第一个方案就是,减少不必要的图片数据集的生成。 但是,如果我们随便选择一张图片来看,会发现图片的尺寸依旧是惊人的。 挺大个的一张图,或者应该说每一张图 这个尺寸,对于我们后续的处理程序以及模型程序,在解析图片的时候,会有很多不必要的压力。 但是,如果你也和我一样,计划用视频素材来验证一些模型程序,或者实现类似图片搜索引擎的能力验证,还可以选择继续对数据集进行优化。

    79610编辑于 2023-11-14
  • 来自专栏码匠的流水账

    langchai4j结合zhipu-ai生成图片

    序本文主要研究一下怎么通过langchai4j结合zhipu-ai生成图片步骤pom.xml<dependency> <groupId>dev.langchain4j</groupId> < artifactId>langchain4j-community-zhipu-ai</artifactId> <version>1.0.0-beta1</version></dependency> prompt=Beautiful house on country side,就可以得到图片链接小结langchain4j集成了Azure OpenAI Dall·E、OpenAI Dall·E、Google Imagen、Cloudflare Workers AI、ZhiPu AI、Xinference这几种图像大模型。 对于ZhiPu AI来讲,提供了ZhipuAiImageModel,通过generate方法即可生成图片。docimage-modelsZhiPu AI

    44400编辑于 2025-02-25
  • 来自专栏新智元

    3张图片生成一个手办3D模型!南加州大学华人博士提出新模型NeROIC,更真实!

    ---- 新智元报道   编辑:LRS 【新智元导读】通过几张二维照片还原为3D模型一直是一个图形学的一个难题,并且照片的不同光线、相机型号都会影响到最终的生成效果,也限制了模型的实际应用场景 例如给定几张不同角度拍摄的二维图像,神经渲染模型能够生成一个三维模型,而无需任何人工的介入。 在现实场景中,可能你会有一堆手办的照片,如果按照传统的方式都建成3D模型,那需要耗费的工作量,想想都头秃。 除了拍手办以外,游戏从业者还可以利用神经渲染技术,简单地拍摄一些物体的照片,合成3D模型,然后就可以制作出一个完美的游戏场景。 研究人员从NeRF模型出发来改进。NeRF神经网络的训练输入为一张图片,用来推测每个像素的颜色、不透明度和辐射度,并猜测物体中没有出现在二维图像中的小部分的缺失像素。

    1K11编辑于 2022-03-04
  • 来自专栏相约机器人

    gDNA:一种 3D 穿衣人体生成模型

    连续且与分辨率无关的神经 3D 表示推动了 3D 刚体生成建模的最新进展。由于衣服的复杂相互作用、它们的拓扑结构和姿势驱动的变形,为穿着衣服的人建模是一项具有挑战性的任务。 通过学习个人的生成模型,马克斯普朗克智能系统研究所的研究人员希望使 3D 人类化身广泛可用。 这是通过包含一个潜在空间来实现的,用于有条件地生成穿着衣服的人体形状和蒙皮重量。 该团队演示了第一种方法,该方法可以在姿势控制下生成各种 3D 衣服人体形状,并在姿势控制下仅使用姿势扫描。 学习到的蒙皮权重可用于重新定位生成的样本。研究人员对 gDNA 进行了广泛测试,发现它的性能明显优于基线。gDNA 可用于拟合和重新激活 3D 图像,优于当前最先进的 (SOTA) 模型。 结论 马克斯普朗克智能系统研究所的研究人员开发了 gDNA,这是一种 3D 穿衣人体生成模型,可以生成具有精确皱纹和明确姿势控制的各种穿衣人。

    1.3K20编辑于 2022-06-07
  • 来自专栏我爱计算机视觉

    3D生成模型同台竞技,魁首究竟花落谁家!

    近两年,得益于Diffusion模型在2D领域取得的巨大成功以及Objaverse系列大规模3D数据集的开源,3D物体生成领域已经进入迅速发展阶段,3D生成模型数量激增。 同时,为了给社区提供一些直觉上的启发,我们推出3DGen-Arena,一个公开、匿名的评测平台,集成了目前流行的19个开源3D生成模型(包括9个文生3D模型和13个图生3D模型,详情参看下图)。 因此,我们划分为了以下5个独立的维度,进行多维度、全方位的评估,并沿用两两比较的方式,为所有参与的模型确定排名顺序。 几何合理性:一个优秀的3D生成模型需要具备广泛且合理的3D几何先验知识。 另外,为了观察3D生成模型对prompt复杂程度的敏感程度,除了单个物体生成外,我们进一步设计了不同物体间的多种排列组合方式,交互方式,以及一些“微场景”。 3D生成领域是3D视觉领域的重要分支,无论是在学界还是业界,都有着广泛的应用前景和发展潜力。面对生成模型的不断推陈出新,一个全面、有效、鲁棒的评价体系是迫切需要的。

    35910编辑于 2024-05-22
  • 来自专栏媒矿工厂

    2D 扩散模型 + Nerf,实现文本生成 3D 模型

    Nerf(神经辐射场)结合,提出DreamFusion,实现了从文字生成3D模型。 在该方法中,给定文本生成3D 模型可以从任意角度观察,通过任意照明重新点亮,或合成到任何 3D 环境中。 然而,在该任务中,作者们并不希望对像素进行采样;他们只希望学习出一个3D模型,使得该模型在任意视角下看上去像一张好的图片。 下图中给出了该采样方案与扩散模型采样的对比: 这里,作者使用了简单的生成函数 \mathbf{x}=(\operatorname{flip}(\theta), \theta) 作演示(也即生成一个对称的图片 训练设置 硬件方面,作者使用了带有4块显卡的TPUv4的机器,进行每一个文本对应的3D场景进行训练。每一块卡渲染一个独立的视角,并且在每一张卡上的batchsize设置为1。

    3.2K20编辑于 2022-11-07
  • 来自专栏DeepHub IMBA

    4图片就可以微调扩散模型

    稳定扩散模型因其从文本描述生成高质量、多样化图像的能力而获得了极大的关注。但是这些预训练模型生成高度定制或个性化主题的图像时可能会有所不足。 这时就需要我们进行手动的微调。 基础概念 1、生成模型和文本到图像的合成 生成模型是一类机器学习模型,旨在生成与给定数据集相似的新数据实例。他们捕捉潜在的数据分布,产生新的样本。 文本到图像模型生成模型的一个子集,因为它们以极高的准确性和保真度将文本描述转换为相应的视觉表示而特别有趣。 这些模型生成过程可以描述如下: 给定一个文本描述T,模型的目标是生成一个图像I,使联合概率P(I,T)最大化。 我们将使用他来下载上面的4图片 urls = [ "https://huggingface.co/datasets/Entreprenerdly/finetunestablediffusion

    1K10编辑于 2024-02-21
  • 来自专栏智能生信

    arXiv|使用深度生成模型3D空间上生成类药分子

    因此,将分子的三维条件纳入深度生成模型是非常有必要的,但目前在这个方向上的探索相当有限,仍然存在许多问题需要解决。 引入3D信息的一种方法是将现有的基于SMILES的生成模型建立在3D数据上。 然而,这些模型输出的分子不包含3D信息,通常需要一个额外的优化步骤来将分子嵌入到3D空间。一种更理想的方法是直接生成三维坐标。 与之前大多数用于3D分子的自回归模型相比,此方法在一次迭代中生成了所有连接到v∗的原子(图5)。这主要有两个优点。首先,它可以节省计算资源(因为状态编码器对每个步骤只运行一次)。 其次,由于相邻原子的位置是高度相关的,一起生成它们可以隐性地提高模型的性能。 图4:与(a)3D分子生成中的大多数自回归模型不同,模型方法(b)将所有连接到焦点原子上的原子作为一个群生成模型生成的分子为蓝色,测试集分子为灰色。 本文仅列出部分实验结果,详见原文。 四、总结 在这项工作中,作者引入了L-Net,一个新的深度生成3D类药分子的模型

    1.9K20发布于 2021-10-08
  • 来自专栏量子位

    谷歌发布“Vlogger”模型:单张图片生成10秒视频

    嗯,拍一张肖像,录好演讲音频就可以(手动狗头) 用声音控制肖像生成视频 这个框架名叫VLOGGER。 它主要基于扩散模型,并包含两部分: 一个是随机的人体到3D运动(human-to-3d-motion)扩散模型。 另一个是用于增强文本到图像模型的新扩散架构。 其中,前者负责将音频波形作为输入,生成人物的身体控制动作,包括眼神、表情和手势、身体整体姿势等等。 后者则是一个时间维度的图像到图像模型,用于扩展大型图像扩散模型,使用刚刚预测的动作来生成相应的帧。 Audio-to-motion倒是可以音频生成,方式也是将音频编码为3D人脸动作,不过它生成的效果不够逼真。 Lip sync可以处理不同主题的视频,但只能模拟嘴部动作。 网友吐槽 最后,“老规矩”,谷歌没有发布模型,现在能看的只有更多效果还有论文。 嗯,吐槽也是不少的: 画质模型、口型抽风对不上、看起来还是很机器人等等。

    62310编辑于 2024-03-21
  • 来自专栏wayn的程序开发

    炸裂,GPT-4o生成图片已达新高度

    本文旨在收集和展示由 OpenAI 最新的旗舰多模态模型 GPT-4o 生成的精彩、有趣或具有代表性的图片案例。 ⚡️ 生成速度快、交互性强: 相比前代模型,图像响应时间更短,适合实时创作、交互式编辑与灵感迭代。 工具介绍 以下是可以使用 GPT-4o 模型生成图片的应用: ChatGPT: OpenAI 官方出品,可使用 GPT-4o 生成高质量图片,支持多风格、多细节控制,适合创意表达与内容创作。 除了人物采用Q版 3D人物风格,其他环境采用真实写实风格。 需上传参考图片: 一张情侣照片。 案例 7:个性化房间设计 提示词: 为我生成我的房间设计(床、书架、沙发、电脑桌和电脑、墙上挂着绘画、绿植,窗外是城市夜景。可爱 3d 风格,c4d 渲染,轴测图。

    1.3K10编辑于 2025-04-15
领券