2025年以来,AI 生成内容的边界已经从图片、文字扩展到了三维模型与视频。你不再需要懂 Blender 或者 After Effects,一张图片、一段文字,就能换来一个可以导进 Unity 的游戏资产,或者一段媲美专业团队的短片。本文梳理了几个值得关注的站点和开发者,以及目前最值得试用的免费或有免费额度的 3D 模型生成和视频生成工具,附上具体的免费额度和使用限制,帮你做出更直接的判断。
一、混元 3D:腾讯出的开源 3D 资产生成引擎
Hunyuan3D 是腾讯混元团队主导的 AI 三维内容生成系统,也是目前 Hugging Face 下载量最高的开源 3D 生成模型之一,累计下载超过 300 万次。它的核心能力是”从文字或图片一键生成可导入引擎的三维资产”,全流程大约 10–25 秒,输出的模型兼容 Unity、Unreal Engine 和 Blender。
输入方式
- 文字转 3D:用文本描述生成三维模型
- 图片转 3D:单张或多视角参考图 → 三维模型
- 草图转 3D:手绘线稿 → 三维资产
- 肖像转 3D:人物照片 → 三维角色模型
技术架构
Hunyuan3D 采用两阶段解耦流水线:第一阶段用基于 Flow 的 Diffusion Transformer(DiT)生成几何形状,压缩到潜空间向量;第二阶段用专门的 Hunyuan3D-Paint 模块合成贴图。从 v2.1 开始,贴图已升级为全 PBR 材质,可以输出 Albedo、Metallic、Roughness、Normal 四通道贴图,金属反光、皮革纹路、青铜氧化等效果均可正确渲染。
2025 年 9 月发布的 3.0 版本引入了全新的 3D-DiT 架构,在腾讯全球数字生态峰会上亮相,建模精度提升 3 倍,分辨率达到 1536³。配套发布的 HunyuanWorld 1.0 则将生成粒度从单个物体扩展到了大型可交互场景,是首个开源的场景级 3D 世界生成模型。
免费额度与 API
- 网页端:每天 20 次免费生成,无需信用卡
- 腾讯云 API:首次开通赠送 200 免费额度,有效期 1 年;超出后按量付费,余额耗尽自动返回错误,不会静默扣费
- 开源本地运行:完全免费无限次,要求 16GB 以上显存(RTX 20 系列+),训练代码和权重均已开放
目前已有 150+ 家企业落地使用,包括 Unity China 和 Bambu Lab(拓竹科技)。GitHub 地址:github.com/Tencent-Hunyuan,技术报告已在 arXiv 发布(arXiv:2501.12202、arXiv:2506.15442)。
二、MisterPrada:用 WebGPU 在浏览器里跑黑洞
MisterPrada 是一位叫 Alex 的技术主管工程师,有大约 50 个公开仓库。他的起点有些另类——最早用 IDA Pro、x64dbg、Cheat Engine 和 x86 汇编来逆向分析 PC 游戏的内存结构,后来把同一套分析思维转移到了浏览器三维图形上,专注于 Three.js、WebGL、WebGPU 和 GLSL 着色器。
2025 年 5 月他接受了 Codrops 的开发者专访,也是目前他最大规模的公开曝光。他的工作主题是把着色器数学推到浏览器的物理极限——更喜欢用数学函数生成画面,而不是导入预制资产。
代表项目
- Singularity(黑洞模拟):完全用 Raymarching 技术在浏览器里渲染的黑洞,没有任何传统网格,整个视觉由 WebGPU + TSL(Three.js Shading Language)的片段着色器数学函数构成,包含引力透镜效应、Simplex Noise 驱动的吸积盘和辉光后处理。在 webgpu.com 上作为”前沿案例”展示。演示地址:singularity.misterprada.com
- Vortex Glass Sphere(涡旋玻璃球):玻璃材质球内的程序化体积涡旋效果,已在 Codrops 发布逐步教程,展示了 TSL 的模块化着色器组合思路。
- Morph Particles(粒子变形):用自定义 GLSL 顶点着色器驱动的粒子系统平滑变形,是 Three.js 社区里引用率较高的 GPU 粒子变形参考实现,圣诞版演示在 christmas.misterprada.com。
- Matrix Sentinels(矩阵哨兵):用 WebGPU Compute Pipeline 实现的 GPU 粒子拖尾系统,同样配有 Codrops 教程。
- Itachi(宇智波鼬致敬站):他早期的一个创意三维 Web 场景,从 Sketchfab 引入 3D 模型构建沉浸式体验,体现了他将技术与流行文化结合的一贯风格(火影忍者、魔兽世界等都出现在他的项目里)。
从这个 GitHub 主页,能看到一类有代表性的创作者路径:不做产品、不做工具,专注于把浏览器变成一个实时的、计算密集的艺术渲染器。WebGPU 和 TSL 目前还是早期阶段,Alex 已经在上面发布了可以运行的完整 demo,是这个方向值得持续关注的开发者。
三、Kling AI:可灵,快手出的视频生成引擎
地址:kling.ai
Kling AI 由快手科技开发,全球用户已超过 2200 万。2026 年 7 月刚完成约 28–30 亿美元融资,投后估值约 180 亿美元——投资方里包括腾讯、阿里巴巴和百度,竞争对手同时投资同一个视频 AI 公司,多少能说明这个赛道的热度。目前 Kling 正在准备独立运营,预计 2027 年前后启动 IPO。
核心能力
- 文字转视频:可生成最长 15 秒的视频片段,Kling 3.0 的”全知叙事”功能可在单次生成中完成多镜头分镜,包含镜头构图、运镜方式和转场
- 图片转视频:上传静帧作为起始画面,生成动态视频;支持关键帧编辑(指定起始帧和结束帧)
- 视频转视频:风格迁移、元素替换或直接编辑现有视频
- 原生音频生成(Kling 3.0 Omni):同步生成与视频内容匹配的音效、环境音和音乐,多语言对口型,支持不同语言、方言和口音
- “全参考”系统:上传 3–8 秒参考视频或多张参考图来锁定角色外形,解决 AI 生成中角色形态漂移的问题
- Kling Canvas 代理(2026 年初):一键生成故事板、多角度扩展、多轮对话式编辑
版本演进
- Kling 2.6(2025 年末):引入高级动作控制,可复制复杂动作和表情
- Kling 3.0 系列(2026 年初):Video 3.0、Video 3.0 Omni(含音频)、Image 3.0、Image 3.0 Omni(含风格迁移),最高支持 2K/4K 输出
- 2026 年获戛纳国际创意节认可,已进入专业影视制作工作流
免费额度
按积分制,提供每日或每月免费积分,具体额度随地区和活动调整,免费档限 720p 最高画质、标准质量、带水印、最低队列优先级,不含商业授权。付费档解锁 Kling 3.0、专业摄影机控制、角色一致性参考等高级功能。
四、通义千问:阿里的大模型平台
地址:qianwen.com(国际版:qwen.ai)
通义千问(Qwen)是阿里云开发的大型语言模型和多模态 AI 平台,网页端 qianwen.com 提供面向消费者的聊天界面,企业级 API 通过阿里云模型服务(DashScope)接入。
Qwen3 系列
- Qwen3:核心 LLM,支持”思考模式”和”快速模式”切换,复杂问题开启思维链推理,日常对话直接输出
- Qwen3-Omni:低延迟多模态交互,同时处理文字、视觉和音频
- Qwen-VL(视觉语言):图像和视频理解,含三维空间定位能力——能理解物体位置和遮挡关系,但这是”理解”而非”生成”
- Qwen-Audio / Qwen-TTS:音频分析和高质量语音合成
- 模型规模从适配手机端的轻量版到万亿参数企业版,大多数权重已在 Hugging Face 开源
视频生成:万象(Wan)
千问本身主要是理解和推理模型,视频生成能力由配套的万象(Wan)模型系列承担。Wan 2.1 采用 Diffusion Transformer + 专用 3D VAE 架构,VBench 榜单排名靠前,擅长复杂运动(舞蹈、格斗、物理碰撞)。
- 支持文字转视频、图片转视频、参考视频转视频、指令式视频编辑
- 最高 1080p 输出,含同步音频
- 支持视频内渲染可辨识的中英文文字
- 网页端免费”轻松模式”:高峰期排队等待,无使用次数上限
- 本地开源(Apache 2.0):完全免费无限次,16–24GB 以上显存
- 网页入口:wan.video
免费额度
千问聊天(qwen.ai)免费使用,有速率限制;万象视频网页端有免费轻松模式;企业 API 按量计费,提供试用额度,具体数字随地区和活动调整。
五、2025–2026 主流 3D 模型生成工具对比
除了混元 3D,目前值得关注的 3D 生成工具还有以下几个,覆盖云端免费和本地开源两条路径。
| 工具 | 免费额度 | 是否可商用 | 特点 | 适合场景 |
|---|---|---|---|---|
| Meshy AI meshy.ai |
每月 100 积分(约 5 个完整模型) | ❌ 免费版不可商用 | 文字/图片转 3D,含贴图、绑骨和动画;风格化资产质量业内领先 | 游戏美术、独立开发者、卡通风格资产 |
| Tripo AI tripo3d.ai |
每月 200–300 积分(约 8 个模型) | ❌ 免费版不可商用 | 8–30 秒极速生成;网格拓扑干净,适合快速原型 | 快速原型验证、概念设计师 |
| Rodin / Hyper3D hyper3d.ai |
注册赠少量测试额度,迭代不消耗积分 | ❌ 免费版不可商用 | 专注高保真角色,4 秒出几何,支持 1000 万面以上,4K PBR 贴图 | 专业 3D 美术、VFX、游戏角色 |
| Spline AI spline.design |
慷慨的免费套餐,核心功能均可免费使用 | ✅ 可商用 | 浏览器端交互式 3D 设计;可生成嵌入网站的代码片段;集成 Gemini AI | 网页设计师、UI/UX、产品演示 |
| Stability AI SPAR3D HuggingFace 开源 |
开源权重,本地无限运行 | ✅ 年收入 100 万美元以下免费商用 | 单张图 <1 秒生成带 UV 展开的贴图网格;与英伟达联合开发 | 快速单图转 3D、本地流程 |
| TRELLIS 2 microsoft/TRELLIS.2 |
开源,本地无限运行(6–8GB 显存+) | ✅ 视许可证 | 微软研究院出品;SLAT 结构潜变量,可解码为网格、3D Gaussian 或辐射场;写实效果顶级 | 研究者、追求极致写实的本地用户 |
| Hunyuan3D 2.1 本地 / 腾讯云 |
本地开源无限次;网页端每日 20 次 | ✅ 视许可证 | 双阶段 DiT + PBR Paint;完整训练代码开源;生态最成熟的开源 3D 生成系统之一 | 游戏资产、影视、电商、3D 打印 |
六、2025–2026 主流 AI 视频生成工具对比
视频生成这个赛道在 2025 年进入了快速迭代期。以下是目前最主要的免费或有免费额度的工具,按实际可用性和画质排列。
| 工具 | 免费额度 | 水印 | 最高分辨率 | 特点 |
|---|---|---|---|---|
| Hailuo AI / MiniMax hailuoai.video |
每日约 10 次,持续更新 | ✅ 通常无水印 | HD | 运动流体感强,动画/二次元内容表现突出;免费档实际可用性最高 |
| Kling AI kling.ai |
每月约 10–20 次 | ❌ 有水印 | 4K(付费) | 真实人体动作和面部表情业内领先;多镜头分镜;原生音频 |
| Vidu AI vidu.studio |
每日额度,持续更新 | ❌ 有水印 | 1080p | 角色一致性好,参考图支持强;叙事类内容效果优秀 |
| Pika Labs pika.art |
每月约 80 积分 | ❌ 有水印 | 480p(免费) | Pikaffects 特效玩法独树一帜(融化、爆炸、蛋糕化等);社交媒体短内容首选 |
| Runway Gen-4 runwayml.com |
125 积分,一次性不续期 | ❌ 有水印 | 4K(付费) | 专业级电影质感;Motion Brush、摄影机引导、视频修复;导演级控制精度 |
| Wan 2.1 wan.video / 开源 |
网页端”轻松模式”无限次(峰值排队);本地 Apache 2.0 无限次 | ✅ 无水印 | 1080p | VBench 榜单顶级;复杂运动(武打、舞蹈)表现优秀;可渲染可辨识文字;阿里出品 |
| HunyuanVideo 开源 / ComfyUI |
开源本地无限次(14–24GB 显存+) | ✅ 无水印 | 高清 | 商业模型级画质;ComfyUI 工作流支持成熟;腾讯出品 |
| CogVideoX github.com/THUDM/CogVideo |
开源本地无限次 | ✅ 无水印 | 高清 | 清华大学/智谱 AI 出品;完全开源,可微调;适合需要完整控制权的开发者 |
| Google Veo 3.1 AI Studio API |
有限 API 预览额度 | — | 4K | 原生 48kHz 音频生成;Gemini 企业生态集成;主要面向企业和开发者 |
| OpenAI Sora — |
❌ 已停止 | — | — | 2026 年 4 月 26 日关停消费者应用,API 预计 2026 年 9 月停用 |
七、怎么选:按需求选工具
从上面这些工具来看,没有哪一个能做所有事情,更实际的方法是按你当前的具体需求来拆分。
如果你想生成 3D 模型
- 没有本地 GPU、想直接上手:Meshy AI 或 Tripo AI,每月免费额度够基本测试,注意免费档不含商业授权
- 有本地 GPU(16GB+ 显存)、想无限次生成:Hunyuan3D 2.1 或 TRELLIS 2,完全免费,画质可以达到商业水准
- 做网页交互 3D:Spline AI,核心功能免费,可以直接导出嵌入网站的代码
- 要最高保真人物角色:Rodin/Hyper3D,付费方向里效果最稳定
如果你想生成 AI 视频
- 想每天都有免费额度、基本无水印:Hailuo AI(MiniMax),日常使用最实际
- 拍人物、需要真实肢体运动:Kling AI,这是它最大的优势
- 想做社交媒体创意特效:Pika Labs,Pikaffects 玩法独特,每月 80 积分可以出不少内容
- 有 GPU、想要无限次且无水印:Wan 2.1(Apache 2.0 开源)或 HunyuanVideo(腾讯开源)
- 做专业影视级内容:Runway Gen-4 或 Kling AI 付费档,Runway 的运镜控制精度目前最细腻
关于 Sora 的注意
OpenAI Sora 已于 2026 年 4 月 26 日关停消费者应用,API 预计 2026 年 9 月停用。如果你之前用过 Sora,目前实际可用的替代方向是 Kling AI 或 Google Veo 3.1。
八、小结
这一轮 3D 和视频生成工具的成熟速度比预期快。腾讯混元 3D 和万象视频两个开源项目同时出现在 VBench 和 3D 生成基准的顶部,意味着本地部署不再是退而求其次的选择;Kling AI 的 180 亿美元估值和戛纳认可,说明视频生成已经被专业制作工作流接受。对于普通用户,Hailuo 的每日免费额度和 Kling 的小额免费档是最低成本的入口;对于开发者和内容工作室,Wan 2.1 和 Hunyuan3D 的 Apache 开源策略,值得在本地流程里认真测试一次。MisterPrada 的案例则提醒了另一个方向:不是所有”3D”都要靠生成模型,WebGPU 着色器在浏览器端能做到的事情,比很多人想象的还要走得更远。