用户手册
手册不讲功能清单,讲一件具体的事怎么做完。每一步都有产品里真实截下来的图,你照着点就行。
案例一
手冲特写、店内环境、外带杯静物。三张的色调、光线、质感要像出自同一次拍摄。
单张生图工具做不到这件事——同一句提示词两次出来的风格能差很远。这个案例的重点是:画布上第一张图可以当后面几张的风格参考。
最后一步会把「用了风格参考」和「没用风格参考」的结果摆在一起,差别一眼能看出来。
四张图共用 Midjourney V7,每张 10 积分,合计 40 积分。
步骤
左侧点「新建 Project」,填名称,类型选 Canvas。
对话框里一次定完四件事:归到哪个 Studio、Project 叫什么、用哪种 Space、地址里的 Slug。类型有三种,Canvas 是「无限画布 + 节点」,Document 是「富文本 + 协作」,Timeline 标着「未实现」点不了。
Slug 不会自动填上,得自己写;留空也能创建。
画布中间写着「画布是空的」「拖入素材到画布,或从左侧菜单选择节点类型创建」。
左边竖排的是创建菜单,右下角是视口工具(撤销重做、缩放、适应窗口、网格吸附、缩略图)。左侧整块是 Agent 面板。
点创建菜单最上面的「节点库」。
只有四种节点:文本、图片、音频、视频。这个案例要出图,选「图片」。
节点上写着「双击上传」「右键可生成等更多」——两条路:手头有图就双击上传,要 AI 画就右键。
菜单里除了「生成」「上传」,还有「重置为空图片」「历史记录」,以及复制、重命名、锁定、删除。工具那一项是灰的。
面板挂在节点下方,从上到下:
| 位置 | 是什么 |
|---|---|
| 左上三个按钮 | 三个参考位:参考、聚焦、风格 |
| 中间大框 | 提示词,占位文字写着「描述你想要生成的画面内容,@ 引用参考」 |
| 底部左起 | 生成模式(Text to Image)、模型(Midjourney V7)、比例与分辨率(1:1 · 2k) |
| 底部右侧 | 联网搜索(灰的)、这次要花的积分(10)、生成按钮 |
换模型会改整个面板,不只是价格——分辨率档位、可用的参考位、多出来的选项都会变。这个案例全程用 Midjourney V7,因为它的风格参考位可用。
第一张写的是:
后面两张会跟着这张的风格走,所以第一张的光线和质感要写清楚——「晨光从侧面」「暖色调」「胶片质感」这几个词决定了整组图的样子。
一杯手冲咖啡的特写,深色木桌,晨光从侧面窗户照进来,蒸汽在光里升起,背景虚化,暖色调,胶片质感
节点变成灰色渐变,左上角出现一个绿色标签,写着谁在占用这个节点。多人协作时,这个标签让别人知道这个节点正在被人用。
Midjourney V7 出图要等。实测这个案例的四张,多数在一分钟上下,最慢的一张超过两分半。这段时间可以去建下一个节点,不用干等。
节点右上角标着 1024×1024。这张就是整组图的风格源头。
同样走节点库、图片。
新节点固定落在画布正中间,所以第二个开始必然压住已有的图。这不是出错,拖开就行。
按住节点拖到空白处。两个节点并排,接下来选风格参考时才点得到第一张。
面板打开后点左上角的「风格」。界面进入拾取模式:画布顶部出现一条「从画布选择风格参考」,旁边有定位按钮和「退出」。这时候画布上的图片节点都可以点。
不需要连线。直接点画布上的那张图就行。
「风格」按钮的位置变成了第一张图的缩略图,右上角有个 × 可以撤掉。拾取模式自动退出。
第二张写的是:
画面内容换了,但风格描述沿用第一张的说法。加上左上角挂着的风格参考,两重保险。
咖啡店店内环境,木质吧台和吊灯,几位客人在窗边,晨光斜射进来,暖色调,胶片质感
内容完全不同——一张是桌面特写,一张是店内空间——但暗背景、暖色逆光、胶片颗粒是一样的。
再建一个节点、拖开、右键生成、点风格选第一张图,提示词换成:
三张摆在一起,是同一家店、同一个时间、同一台相机拍的。
一只外带咖啡纸杯的静物特写,放在木质台面上,旁边有咖啡豆散落,侧逆光,暖色调,胶片质感
最后再建一个节点,不点风格参考,用跟第三张一模一样的提示词。
左下和右下是同一句提示词的两个结果:左下用了风格参考,右下没用。
| 对比项 | 有风格参考 | 没有 |
|---|---|---|
| 背景 | 暗,看不清 | 亮,灰白墙面 |
| 光 | 逆光,一道光切进来 | 平光,均匀 |
| 整体 | 像前两张的同一次拍摄 | 一张单独的产品照 |
提示词里明明写了「侧逆光」「暖色调」「胶片质感」,右下这张还是走了另一个方向。文字描述控不住风格,一张参考图能。
| 遇到什么 | 怎么回事 |
|---|---|
| 中文 Project 名不生成 Slug | 自己填,或者留空 |
| 新建的节点总压在已有节点上 | 固定落在画布正中,拖开即可 |
| 节点拖到画布右下角,「生成」按钮点不到 | 生成面板挂在节点下方,会被右下角的视口工具栏或缩略图盖住。把节点往上、往左挪 |
| 等了两分钟还在转 | Midjourney V7 就是这个速度,等到图出现在节点上为止 |
| 想让四张图都进一屏 | 右下角视口工具的「适应窗口」 |
@ 引用、聚焦参考位、参考参考位、图生视频、Document、Agent 面板。它们留给后面的案例——一篇只讲一件事。@ 引用是这个产品的另一个核心交互,值得单独一个案例。
支持的模型
先选做什么——文生图、图生视频、转写——选择器再给出这件事能用的模型。积分按次扣;耗时是配置里的最坏情况,不是平均值。
| 模型 | 能做什么 | 积分 | 约耗时 |
|---|---|---|---|
| Background Remover | 去背景 AI 抠图,输出带 alpha 通道的透明 PNG | 1 | 15s |
| Midjourney V7 | 文生图 画面观感最好,偏艺术和电影感 | 10 | 60s |
| Nano Banana Pro | 文生图 旗舰画质,支持 4K 与镜头参数 | 7 | 50s |
| Nano Banana 2 | 文生图 快且好,日常出图的默认选择 | 4.5 | 25s |
| Nano Banana Pro Edit | 图生图 · 编辑 旗舰编辑,最多 14 张参考图 | 7 | 50s |
| Nano Banana 2 Edit | 图生图 · 编辑 快速编辑,带联网检索 | 4.5 | 25s |
| Seedream 5.0 Lite | 文生图 最新,带推理与联网检索 | 4 | 20s |
| Topaz Upscale | 放大 放大到 2K、4K 或 8K | 7 | 30s |
| 模型 | 能做什么 | 积分 | 约耗时 |
|---|---|---|---|
| Kling O3 Pro | 文生视频 可灵最新旗舰,质量最好 | 56 | 120s |
| Kling O3 Pro I2V | 图生视频 · 首尾帧 可灵 O3,图生视频 | 56 | 120s |
| Kling O3 Pro Ref | 参考生视频 可灵 O3,参考图生视频 | 56 | 120s |
| Kling O3 Pro Edit | 编辑 可灵 O3,视频编辑 | 84 | 180s |
| Kling V3 Pro Motion | 动作控制 可灵 V3,动作控制 | 84 | 180s |
| OmniHuman 1.5 | 数字人口播 一张肖像加一段音频,生成口播 | 25 | 180s |
| Video Upscale Pro | 放大 视频放大,带细节重建 | 15 | 120s |
| RIFE Frame Interpolation | 补帧 帧率翻倍,动作更顺 | 5 | 30s |
| Seedance 1.5 Pro I2V | 图生视频 · 首尾帧 即梦 1.5,图生视频 | 60 | 120s |
| Seedance 2.0 | 文生视频 字节最新,支持多模态参考 | 80 | 180s |
| VEO 3.1 | 文生视频 谷歌最新,自带音轨 | 100 | 180s |
| VEO 3.1 I2V | 图生视频 VEO 3.1,图生视频 | 100 | 180s |
| VEO 3.1 Extend | 视频延长 把已有视频接着往下生成 | 100 | 180s |
| VEO 3.1 Fast | 文生视频 VEO 3.1 快速版 | 80 | 120s |
| VEO 3.1 Lite | 文生视频 谷歌视频里最便宜的一档 | 30 | 90s |
| Wan 2.2 Animate | 图像动画 万相 2.2,让图动起来 | 20 | 120s |
| 模型 | 能做什么 | 积分 | 约耗时 |
|---|---|---|---|
| ElevenLabs SFX V2 | 音效 文字生音效,0.5 到 22 秒 | 5 | 30s |
| MiniMax Music 2.5 | 文生音乐 录音室级,100 多种乐器 | 50 | 180s |
| MiniMax Music 01 | 音频生音乐 声音克隆与风格迁移 | 10 | 120s |
| AI Vocal Remover | 人声分离 把人声和伴奏分开 | 2 | 30s |
| 模型 | 能做什么 | 积分 | 约耗时 |
|---|---|---|---|
| ElevenLabs V3 | 文本转语音 最自然,能带情绪 | 10 | 30s |
| F5 TTS | 声音克隆 一条样本就能克隆声音 | 5 | 30s |
| Fish S2 Pro | 文本转语音 TTS-Arena 第一,80 多种语言 | 3 | 10s |
| 模型 | 能做什么 | 积分 | 约耗时 |
|---|---|---|---|
| Hunyuan3D V3 | 文生 3D 腾讯混元,三档质量可选 | 25 | 120s |
| Hunyuan3D V3 Image-to-3D | 图生 3D 多视角输入,支持 PBR 材质 | 23 | 120s |
| Hunyuan3D V3.1 Rapid | 图生 3D 最快最便宜的图生 3D | 2 | 30s |
| Meshy 6 Text-to-3D | 文生 3D 质量最好,带 PBR 贴图 | 80 | 600s |
| 模型 | 能做什么 | 积分 | 约耗时 |
|---|---|---|---|
| Gemini Flash Image | 看图 最便宜的看图 | 1 | 10s |
| Gemini Flash Video | 看视频 最便宜的看视频 | 3 | 30s |
| Gemini Flash Audio | 听音频 最便宜的听音频 | 2 | 20s |
| Gemini Pro Image | 看图 看图最准 | 5 | 15s |
| Gemini Pro Video | 看视频 看视频最准 | 10 | 45s |
| Gemini Pro Audio | 听音频 听音频最准 | 5 | 30s |
| Whisper Large V3 Turbo | 转写 最快的语音转写,便宜 30% | 1 | 15s |
一次部署只提供它配了 API key 的模型,所以你在产品里看到的可能少于这份名单。
我们替你选的
其余地方模型都由你选。这三处跑在我们设定的模型上,你的文字送到它那里,跟送到其他厂商是一样的。
deepseek/deepseek-chat google/gemini-2.5-flash deepseek/deepseek-v4-pro 这份手册的现状
Breatic 还没发布,手册跟着产品走:界面改了就重截图,步骤文字跟着改。现在只有一个案例,@ 引用、图生视频、Document 会一个一个补上。