使用者手冊
手冊不列功能清單,而是把一件具體的事從頭做到尾。每一步都有產品裡真實截下來的畫面,你照著點就行。
案例一
手沖特寫、店內環境、外帶杯靜物。三張的色調、光線、質感要像出自同一次拍攝。
單張生圖工具做不到這件事——同一句提示詞兩次出來的風格可以差很遠。這個案例的重點是:畫布上第一張圖可以當後面幾張的風格參考。
最後一步會把「用了風格參考」和「沒用風格參考」的結果擺在一起,差別一眼就看得出來。
四張圖都用 Midjourney V7,每張 10 點數,合計 40 點數。
步驟
左側點「新增 Project」,填名稱,類型選 Canvas。
對話框裡一次定完四件事:歸到哪個 Studio、Project 叫什麼、用哪種 Space、網址裡的 Slug。類型有三種,Canvas 是「無限畫布 + 節點」,Document 是「富文本 + 協作」,Timeline 標著「未實作」點不了。
Slug 不會自動填上,得自己寫;留空也能建立。
畫布中間寫著「畫布是空的」「拖入素材到畫布,或從左側選單選擇節點類型建立」。
左邊直排的是建立選單,右下角是視埠工具(復原重做、縮放、符合視窗、格線貼齊、縮圖)。左側整塊是 Agent 面板。
點建立選單最上面的「節點庫」。
只有四種節點:文字、圖片、音訊、影片。這個案例要出圖,選「图片」。
節點上寫著「雙擊上傳」「右鍵可生成等更多」——兩條路:手上有圖就按兩下上傳,要 AI 畫就按右鍵。
選單裡除了「生成」「上傳」,還有「重設為空白圖片」「歷史記錄」,以及複製、重新命名、鎖定、刪除。工具那一項是灰的。
面板掛在節點下方,從上到下:
| 位置 | 是什麼 |
|---|---|
| 左上三個按鈕 | 三個參考位:參考、聚焦、風格 |
| 中間大框 | 提示詞,佔位文字寫著「描述你想要生成的畫面內容,@ 引用參考」 |
| 底部左起 | 生成模式(Text to Image)、模型(Midjourney V7)、比例與解析度(1:1 · 2k) |
| 底部右側 | 網路搜尋(灰的)、這次要花的點數(10)、生成按鈕 |
換模型會改整個面板,不只是價格——解析度檔位、可用的參考位、多出來的選項都會變。這個案例全程用 Midjourney V7,因為它的風格參考位可用。
第一張寫的是:
後面兩張會跟著這張的風格走,所以第一張的光線和質感要寫清楚——「晨光從側面」「暖色調」「底片質感」這幾個詞決定了整組圖的樣子。
一杯手沖咖啡的特寫,深色木桌,晨光從側面窗戶照進來,蒸汽在光裡升起,背景虛化,暖色調,底片質感
節點變成灰色漸層,左上角出現一個綠色標籤,寫著誰在占用這個節點。多人協作時,這個標籤讓別人知道這個節點正在被人用。
Midjourney V7 出圖要等。實測這個案例的四張,多數在一分鐘上下,最慢的一張超過兩分半。這段時間可以去建下一個節點,不用乾等。
節點右上角標著 1024×1024。這張就是整組圖的風格源頭。
一樣走节点库、图片。
新節點固定落在畫布正中間,所以第二個開始必然壓住已有的圖。這不是出錯,拖開就行。
按住節點拖到空白處。兩個節點並排,接下來選風格參考時才點得到第一張。
面板打開後點左上角的「風格」。介面進入挑選模式:畫布頂部出現一條「從畫布選擇風格參考」,旁邊有定位按鈕和「退出」。這時候畫布上的圖片節點都可以點。
不需要連線。直接點畫布上的那張圖就行。
「風格」按鈕的位置變成了第一張圖的縮圖,右上角有個 × 可以撤掉。挑選模式自動結束。
第二張寫的是:
畫面內容換了,但風格描述沿用第一張的說法。加上左上角掛著的風格參考,兩重保險。
咖啡店店內環境,木質吧台和吊燈,幾位客人在窗邊,晨光斜射進來,暖色調,底片質感
內容完全不同——一張是桌面特寫,一張是店內空間——但暖光、深色木質和淺景深是一樣的。
再建一個節點、拖開、按右鍵生成、點风格選第一張圖,提示詞換成:
三張擺在一起,是同一家店、同一個時間、同一台相機拍的。
一只外帶咖啡紙杯的靜物特寫,放在木質檯面上,旁邊有咖啡豆散落,側逆光,暖色調,底片質感
最後再建一個節點,不點風格參考,用跟第三張一模一樣的提示詞。
右下和左下是同一句提示詞的兩個結果:右下用了風格參考,左下沒用。
| 對比項 | 有風格參考 | 沒有 |
|---|---|---|
| 背景 | 虛化成暖褐,看不清細節 | 灰白的牆,看得一清二楚 |
| 光 | 側逆光,跟第一張同一個方向 | 平光,沒有方向 |
| 整體 | 像前兩張的同一次拍攝 | 一張單獨的產品照 |
提示詞裡明明寫了「側逆光」「暖色調」「底片質感」,左下這張還是走了另一個方向。文字描述控不住風格,一張參考圖能。
| 遇到什麼 | 怎麼回事 |
|---|---|
| 中文 Project 名不產生 Slug | 自己填,或者留空 |
| 新建的節點總壓在已有節點上 | 固定落在畫布正中,拖開即可 |
| 節點拖到畫布右下角,「生成」按鈕點不到 | 生成面板掛在節點下方,會被右下角的視埠工具列或縮圖蓋住。把節點往上、往左挪 |
| 等了兩分鐘還在轉 | Midjourney V7 就是這個速度,等到圖出現在節點上為止 |
| 想讓四張圖都進一個畫面 | 右下角視埠工具的「適應視窗」 |
@ 引用、聚焦參考位、參考參考位、圖生影片、Document、Agent 面板。它們留給後面的案例——一篇只講一件事。@ 引用是這個產品的另一個核心互動,值得單獨一個案例。
支援的模型
先選要做什麼——文生圖、圖生影片、轉寫——選擇器再給出這件事能用的模型。點數按次扣;耗時是設定裡的最壞情況,不是平均值。
| 模型 | 能做什麼 | 點數 | 約耗時 |
|---|---|---|---|
| Background Remover | 去背景 AI 去背,輸出帶 alpha 通道的透明 PNG | 1 | 15s |
| Midjourney V7 | 文生圖 畫面觀感最好,偏藝術和電影感 | 10 | 60s |
| Nano Banana Pro | 文生圖 旗艦畫質,支援 4K 與鏡頭參數 | 7 | 50s |
| Nano Banana 2 | 文生圖 快又好,日常出圖的預設選擇 | 4.5 | 25s |
| Nano Banana Pro Edit | 圖生圖 · 編輯 旗艦編輯,最多 14 張參考圖 | 7 | 50s |
| Nano Banana 2 Edit | 圖生圖 · 編輯 快速編輯,帶聯網檢索 | 4.5 | 25s |
| Seedream 5.0 Lite | 文生圖 最新,帶推理與聯網檢索 | 4 | 20s |
| Topaz Upscale | 放大 放大到 2K、4K 或 8K | 7 | 30s |
| 模型 | 能做什麼 | 點數 | 約耗時 |
|---|---|---|---|
| Kling O3 Pro | 文生影片 可靈最新旗艦,品質最好 | 56 | 120s |
| Kling O3 Pro I2V | 圖生影片 · 首尾影格 可靈 O3,圖生影片 | 56 | 120s |
| Kling O3 Pro Ref | 參考生影片 可靈 O3,參考圖生影片 | 56 | 120s |
| Kling O3 Pro Edit | 編輯 可靈 O3,影片編輯 | 84 | 180s |
| Kling V3 Pro Motion | 動作控制 可靈 V3,動作控制 | 84 | 180s |
| OmniHuman 1.5 | 數位人口播 一張肖像加一段音訊,生成口播 | 25 | 180s |
| Video Upscale Pro | 放大 影片放大,帶細節重建 | 15 | 120s |
| RIFE Frame Interpolation | 補幀 幀率翻倍,動作更順 | 5 | 30s |
| Seedance 1.5 Pro I2V | 圖生影片 · 首尾影格 即夢 1.5,圖生影片 | 60 | 120s |
| Seedance 2.0 | 文生影片 字節最新,支援多模態參考 | 80 | 180s |
| VEO 3.1 | 文生影片 Google 最新,自帶音軌 | 100 | 180s |
| VEO 3.1 I2V | 圖生影片 VEO 3.1,圖生影片 | 100 | 180s |
| VEO 3.1 Extend | 影片延長 把已有影片接著往下生成 | 100 | 180s |
| VEO 3.1 Fast | 文生影片 VEO 3.1 快速版 | 80 | 120s |
| VEO 3.1 Lite | 文生影片 Google 影片裡最便宜的一檔 | 30 | 90s |
| Wan 2.2 Animate | 圖像動畫 萬相 2.2,讓圖動起來 | 20 | 120s |
| 模型 | 能做什麼 | 點數 | 約耗時 |
|---|---|---|---|
| ElevenLabs SFX V2 | 音效 文字生音效,0.5 到 22 秒 | 5 | 30s |
| MiniMax Music 2.5 | 文生音樂 錄音室級,100 多種樂器 | 50 | 180s |
| MiniMax Music 01 | 音訊生音樂 聲音複製與風格遷移 | 10 | 120s |
| AI Vocal Remover | 人聲分離 把人聲和伴奏分開 | 2 | 30s |
| 模型 | 能做什麼 | 點數 | 約耗時 |
|---|---|---|---|
| ElevenLabs V3 | 文字轉語音 最自然,能帶情緒 | 10 | 30s |
| F5 TTS | 聲音複製 一條樣本就能複製聲音 | 5 | 30s |
| Fish S2 Pro | 文字轉語音 TTS-Arena 第一,80 多種語言 | 3 | 10s |
| 模型 | 能做什麼 | 點數 | 約耗時 |
|---|---|---|---|
| Hunyuan3D V3 | 文生 3D 騰訊混元,三檔品質可選 | 25 | 120s |
| Hunyuan3D V3 Image-to-3D | 圖生 3D 多視角輸入,支援 PBR 材質 | 23 | 120s |
| Hunyuan3D V3.1 Rapid | 圖生 3D 最快最便宜的圖生 3D | 2 | 30s |
| Meshy 6 Text-to-3D | 文生 3D 品質最好,帶 PBR 貼圖 | 80 | 600s |
| 模型 | 能做什麼 | 點數 | 約耗時 |
|---|---|---|---|
| Gemini Flash Image | 看圖 最便宜的看圖 | 1 | 10s |
| Gemini Flash Video | 看影片 最便宜的看影片 | 3 | 30s |
| Gemini Flash Audio | 聽音訊 最便宜的聽音訊 | 2 | 20s |
| Gemini Pro Image | 看圖 看圖最準 | 5 | 15s |
| Gemini Pro Video | 看影片 看影片最準 | 10 | 45s |
| Gemini Pro Audio | 聽音訊 聽音訊最準 | 5 | 30s |
| Whisper Large V3 Turbo | 轉寫 最快的語音轉寫,便宜 30% | 1 | 15s |
一次部署只提供它設了 API key 的模型,所以你在產品裡看到的可能少於這份名單。
我們替你選的
其餘地方模型都由你選。這三處跑在我們設定的模型上,你的文字送到它那裡,跟送到其他廠商是一樣的。
deepseek/deepseek-chat google/gemini-2.5-flash deepseek/deepseek-v4-pro 這份手冊的現狀
Breatic 還沒發佈,手冊跟著產品走:介面改了就重截圖,步驟文字跟著改。現在只有一個案例,@ 引用、圖生影片、Document 會一個一個補上。