Kristy Shi·Dec 11, 2025
一位電影攝影師朋友曾告訴我:「我能看懂任何場景,把 DP 的每一個操作寫下來。但如果讓我把它变成 AI 提示詞,我就僵住了。」
他不是一個人。大多數人被動地消費視頻——感受到情绪、註意到氛圍、記得自己喜不喜歡。但無法說清為什麼這個鏡頭有效。如果你無法描述一個鏡頭為什麼有效,你就無法告訴 AI 去重現它。
Lovart is the AI design agent trusted by 10M+ creators. Try Lovart Free →
Related: 如何 Build a 設計 System with AI — Components, Tokens & Consiste | 「向量化」切換開關:將AI藝術轉換為可縮放圖形
本指南提供了一套可復用的框架,用於將任何視頻——YouTube 广告、電影鏡頭、TikTok 剪辑、產品演示——反向工程為結構化的 AI 視頻提示詞。你將學會提取哪些視覺元素、如何將其轉化為提示詞語法,以及如何迭代直到 AI 輸出匹配你的参考。
大多數人凭想象力編寫 AI 視頻提示詞。這有時可行。但速度慢、結果不穩定,而且受限於你的詞汇量。你可能感覺到自己想要什麼,却難以描述出來。
反向工程解决了這個問題。不需要盯著空白的提示詞框苦思冥想鏡頭運動,你只需觀看一段参考視頻,提取精確的参數:
- 鏡頭實際做了什麼?
- 光从哪裡來?
- 主體在做什麼,速度如何?
- 這個鏡頭持續了多久?
- 有哪些聲音?
你不是在復製視頻。你是在提取它的視覺語言——就像攝影師在拍攝前研究参考場景一样。輸出是一個提示詞模板,你可以將其适配到自己的主體、品牌或產品上。
這种方法尤其适合: - 想要特定電影風格的品牌視頻 - 匹配競品視覺風格的產品演示 - 需要呈現特定創作者美學的社交媒體内容 - 用經過驗證的、可重復的結果構建個人提示詞庫 - 想要特定電影風格的品牌視頻
- 匹配競品視覺風格的產品演示
- 需要呈現特定創作者美學的社交媒體内容
- 用經過驗證的、可重復的結果構建個人提示詞庫
每個視頻鏡頭都可以分解為五個层次。提取每一层,然後重組為提示詞:
Layer
What to Extract
Prompt Translation
1. Camera
Movement type, speed, angle, lens
"Slow dolly-in," "overhead crane shot," "handheld tracking"
2. Subject & Action
What/who is in frame, what they're doing, direction, speed
"Barista pouring latte art," "model walking toward camera"
3. Environment
Location, time of day, weather, set details
"Sunlit loft apartment," "rain-soaked Tokyo street at night"
4. Lighting & Color
Light source, direction, quality, color temperature, grade
"Warm golden hour backlight," "cool blue moonlight, high contrast"
5. Audio & Duration
Sounds, music, ambient noise, clip length
"Gentle birdsong, distant traffic, 6 seconds"
該框架按順序工作。先不暂停地完整看一遍視頻——感受整體氛圍。然後重看,每两秒暂停一次,逐层提取。第三遍下來,你就有了一個完整的提示詞。
鏡頭運動是 AI 視頻提示詞中最容易被忽視的元素。多數人描述了主體却完全忘記了鏡頭。但鏡頭行為才是区分靜態幻燈片和電影級鏡頭的關鍵。
運動類型。 鏡頭在動,還是鎖定?如果在動,怎麼動?常見模式:
- 推轨(Dolly)——鏡頭物理靠近或遠離主體(創造深度)
- 跟拍(Tracking)——鏡頭與主體平行移動(跟隨動作)
- 升降/搖臂(Crane/jib)——鏡頭垂直上升或下降(揭示規模)
- 搖鏡/俯仰(Pan/tilt)——鏡頭在固定點旋轉(掃描環境)
- 環绕(Orbit)——鏡頭圍绕主體旋轉(產品鏡頭、hero 展示)
- 手持(Handheld)——輕微晃動(纪錄片感、亲密感、緊迫感)
- 靜態(Static)——無運動(緊張、觀察、ASMR 風格)
速度與節奏。 運動是緩慢从容,還是快速有力?緩慢的推轨製造期待。快速甩鏡製造能量。描述節奏:緩慢、逐漸、快速、突然、平滑、急促。
角度與構圖。 鏡頭相對於主體的位置?
- 視線高度(Eye-level)——中性、亲切
- 低角度(Low angle)——力量、戲剧、英雄感
- 高角度/鳥瞰(High angle/bird's eye)——全貌、脆弱感、圖案感
- 荷兰角(Dutch angle)——緊張、不安、迷失方向
鏡頭特性。 背景是模糊(浅景深)還是清晰(深焦)?是否有广角畸变或長焦壓縮?常見鏡頭参考:35mm, 50mm, 85mm, 变形寬銀幕, 微距, 广角。
將運動類型 + 速度 + 角度組合成一個短語:
What You See
Prompt Translation
Camera slowly pushes toward a person's face
"Slow push-in close-up"
Camera follows someone from behind through a crowd
"Tracking shot from behind, handheld"
Camera rises above a city skyline
"Slow crane-up, extreme wide"
Camera circles a product on a pedestal
"Smooth 360° orbit, medium shot"
Static shot of rain on a window
"Static close-up, shallow DOF"
打開任何一個 Apple 產品視頻。關掉聲音看前 10 秒。每 2 秒暂停一次,寫下鏡頭在做什麼。你會发現規律:几乎每個鏡頭都有刻意的鏡頭運動——緩慢推轨、平滑環绕、輕柔推進。Apple 从不對主打產品使用靜態鏡頭。這是一個你現在可以清晰表達并復現的選擇。
主體是填充畫面的内容。動作是鏡頭持續時間内发生变化的内容。两者共同定义了提示詞的時間内容。
主體識别。 焦點是誰或什麼?要具體:不是「一個人」而是「一位 30 多岁的女性,自然妝容,亞麻衬衫」。不是「一辆車」而是「一辆哑光灰的復古保時捷 911」。
動作描述。 主體在做什麼,怎麼做?三個維度很重要:
- 方向——朝向鏡頭、遠離鏡頭、从左到右、環形
- 速度——緩慢、从容、正常、快速、爆发性
- 質感——平滑、急促、优雅、機械、有機
单一 vs. 多個主體。 有一個明確的主體,還是多個?AI 視頻模型能處理好 1-2 個主體。三個或以上會引入復杂性和不一致性。
主體状態变化。 主體在鏡頭中會变化嗎?花朵绽放、液體倾倒、門打開——這些時間性变化正是視頻区别於靜態圖像的關鍵。
普通:「一個女人走在街上。」 更好:「一位身穿飄逸紅色大衣的女性沿鵝卵石小巷緩緩走向鏡頭,大衣在風中輕輕飄揚。」
区别:第二個提示詞告訴了 AI她穿什麼、往哪個方向移動、多快以及畫面中還有什麼在变化。每增加一個細節,就减少 AI 猜测的必要——猜测產生的是通用結果。
找一段烹饪視頻。看一個 5 秒片段,觀察厨師倒東西的動作。寫下: - 到底在倒什麼?(不是「液體」——而是「从玻璃調味瓶中倒出的金色橄榄油」)
- 它是怎麼動的?(不是「倒」——「緩慢、穩定的細流,捕捉著光線」)
- 畫面中還有什麼?(不是「厨房」——「質朴的木製台面,散落的新鮮香草,从左侧窗户照進的柔和晨光」)
現在你有了不會生成 stock footage 的提示詞素材。
環境决定了氛圍、上下文和製作質感。一块在白色虚空中的奢侈手表和同一块在金色時刻遊艇甲板上的手表,感覺完全不同——即便鏡頭運動完全相同。
地點類型。 室内還是室外?自然還是人造?具體還是抽象?
時間。 金色時刻(溫暖、電影感),藍色時刻(冷調、情绪化),正午(刺眼、高對比),夜晚(人造光源),黎明(柔和、散射)。
天氣與氛圍。 雨、雾、雪、灰塵、煙雾——氛圍元素增加深度和製作質感。松林中翻滾的薄雾比一片松林更有視覺衝擊力。
場景細節。 哪些具體的物體或材質定义了空間?水泥地面、天鵝绒窗帘、霓虹招牌、大理石台面、裸露砖墙。通用環境產生通用結果。
背景深度。 主體背後有深度,還是背景扁平?靠著墙的主體與置身广阔風景中的主體感覺完全不同。描述背景關系:「背景柔和虚化」、「透過窗户可見深邃背景」、「主體孤立於黑色虚空之前」。
从寬泛到具體堆叠環境細節:
"In a sunlit Parisian café, morning — marble tabletops, brass fixtures, steam rising from an espresso machine, rain-streaked windows, soft jazz playing, patrons reading newspapers in the background, shallow DOF keeping focus on the subject."
這給 AI 一個完整的世界,而不仅仅是一块背景布。
光線决定了視頻看起來昂贵——還是廉价。這也是大多數人在寫提示詞時完全忽略的東西。用頂部惨白荧光燈照明的場景和金色時刻从窗户照進溫暖侧光的場景,可能有相同的主體、相同的鏡頭運動、相同的環境——看起來却完全不同。
光的方向。 主光源在哪裡?
- 正面光——扁平、消除陰影、临床感
- 侧光——創造深度、紋理、戲剧感
- 背光——創造剪影、輪廓光、與背景分離
- 頂光——戲剧性陰影、舞台感
- 底光——不自然、恐怖、令人不安
Light quality.
- 硬光——锐利陰影、高對比、戲剧性
- 軟光——散射陰影、柔和、討喜、自然
色溫。
- 暖色(2700K-3500K)——金色、舒适、浪漫、日落
- 中性(4000K-5000K)——自然、干净、正午
- 冷色(5500K-7000K)——临床、情绪化、月光、科技感
色彩調色。 看整體的色彩調色板:
- 青橙調——好莱坞大片調色
- 去飽和——情绪化、严肃、編辑風
- 高飽和——鮮艳、充滿活力、社交媒體風
- 单色/近单色——藝术感、永恒
在一句話中組合方向 + 質量 + 色溫 + 調色:
「來自相機左侧的金色時刻暖侧光,柔和陰影,丰富的青橙色調。」
「來自上方的冷藍色月光,硬陰影,去飽和并壓暗黑色。」
看任何韦斯·安德森的鏡頭。註意光線几乎总是:均匀、柔和、正面或微侧光;飽和的粉彩色調;深焦(全部清晰);對稱構圖。
再看任何克裡斯托弗·诺兰的鏡頭:有方向的侧光或背光;去飽和的冷色調;浅景深;不對稱的動態構圖。
同样的主體,完全不同的感覺——因為光線和色彩語言不同。這种語言正是你在學習提取和復現的。 - Even, soft, front or slight-side light
- 飽和的粉彩色調
- 深焦(全部清晰)
- 對稱構圖
Now watch any Christopher Nolan shot: - 有方向的侧光或背光
- 去飽和的冷色調
- 浅景深
- 不對稱的動態構圖
同样的主體,完全不同的感覺——因為光線和色彩語言不同。這种語言正是你在學習提取和復現的。
音頻占了體驗的一半。Veo 3.1 可以在生成視頻的同時生成原生音頻,讓這一层在你的提示詞中可操作——而不仅仅是後期製作的附加項。
對話。 有人在說話嗎?在說什麼?聲音在畫内還是畫外?描述語氣:低語、喊叫、平靜、急促、回响。
環境聲。 背景噪音是什麼?風吹過树林、遠處車流、咖啡館交談聲、雨打玻璃、室内底噪。
擬音效果。 與動作相關的具體、獨立的聲音:碎石上的脚步聲、钥匙在鎖中轉動、倒咖啡、布料沙沙聲、關門聲。
音樂配樂。 有音樂嗎?什麼風格、節奏、樂器?鋼琴獨奏、氛圍合成器铺底、管弦樂漸強、lo-fi 節奏。
時長。 這個鏡頭持續多久?數秒數。AI 視頻工具通常生成 5-8 秒片段。如果你的参考鏡頭是 3 秒,匹配它。如果是 15 秒,你需要拆分成多個提示詞或使用場景擴展。
在提示詞中添加「Audio:」部分:
「Audio:窗户玻璃上輕柔的雨聲,屋内低沉的爵士鋼琴,每 8-10 秒遠處的雷聲,咖啡師輕聲叫著一個名字。」
這告訴 Veo 3.1 在視頻旁邊具體生成什麼。
你已經提取了全部五個层。現在按照這個結構將它們組裝為提示詞:
*[Camera movement + framing] of [subject + action] in [environment], [lighting + color], [duration]. Audio: [sound description].*
参考視頻:Nike 跑步广告——6 秒鏡頭,一名運動員在黎明時分跑過城市。
层級提取: - 鏡頭:緩慢侧向跟拍,視線高度,50mm 鏡頭感覺,浅景深
- 主體與動作:女性跑者,運動體型,專註表情,以穩定速度向畫面右侧奔跑,皮肤可見汗水
- 環境:黎明時分空旷的城市街道,夜雨後潮濕的路面,背景中的摩天大楼,路燈仍亮著
- 光線與色彩:來自上方的冷藍色黎明光,暖橙色路燈創造輪廓光,青橙色調,高對比
- 音頻與時長:6 秒。潮濕路面上的脚步聲,沉重的呼吸聲,遠處城市蘇醒,微妙的驱動節拍
組裝後的提示詞:
*"Slow tracking shot from side, eye-level, following a focused female runner as she strides through an empty rain-slicked city street at dawn, wet pavement reflecting streetlights, skyscrapers looming in background, cool blue ambient light from above with warm orange rim light from streetlamps, sweat visible on skin, teal-and-orange grade, 50mm lens, shallow DOF, 6 seconds. Audio: rhythmic footsteps on wet pavement, steady breathing, distant city waking up, subtle driving percussion."*
這個提示詞將產生遠比「電影感跑步視頻,Nike 風格,4K」更接近参考的效果。
你不需要專業軟件。以下工具就能用:
- YouTube: Press `.` (period) to advance one frame, `,` (comma) to go back. Press `Shift+.` to slow down playback.
- VLC: Press `E` to advance frame by frame. Use the "Scene Filter" or take snapshots.
- QuickTime: Use arrow keys for frame-by-frame.
- Screen recorder + pause: Record the video, then scrub through frame by frame in any editing tool.
分析時保持這個模板打開:
視頻標題/來源:
鏡頭時長:
鏡頭:
- Movement:
- Speed:
- Angle:
- Lens:
主體與動作:
- Subject:
- Action:
- Direction:
- Speed:
環境:
- Location:
- Time of day:
- Weather:
- Key details:
光線與色彩:
- Direction:
- Quality:
- Temperature:
- Grade:
音頻:
- Dialogue:
- Ambient:
- Foley:
- Music:
組裝後的提示詞:
用三個不同的参考視頻填寫。填到第三個時,你就能在腦子裡完成了。
錯誤 1:描述視頻而不是提取参數。
錯誤 2:復製主體而不是視覺語言。
錯誤 3:忽略音頻。
錯誤 4:過度描述。
錯誤 5:不迭代。
問: Can I reverse-engineer any video, or only certain types?
任何視頻都可以。該框架提取的是通用視覺参數——鏡頭運動、光線、主體動作——适用於从好莱坞電影到 TikTok 剪辑再到產品演示的所有内容。唯一区别是各层的復杂度:TikTok 可能光線簡单但動態圖形復杂;電影鏡頭可能光線復杂但構圖靜態。
問: How do I handle videos with rapid cuts or montages?
不要一次反向工程整個蒙太奇。選擇一個代表性鏡頭——通常是視覺語言最強的 hero 鏡頭——从单個鏡頭提取。將生成的提示詞模板应用到自己的内容上,然後在剪辑中拼接多次生成結果。
問: What if the reference video uses VFX or CGI that AI can't reproduce?
聚焦於 AI 能復現的内容:鏡頭運動、光線、構圖、色彩調色。如果参考視頻有 CGI 恐龍,提取場景的鏡頭行為和光線,而不是恐龍。即使主體不同,你的提示詞也能產生視覺上相似的風格。
問: Do different AI video tools interpret prompts differently?
是的。Veo 3.1、Seedance、Kling 和 Runway 對相同的提示詞語言有略微不同的解讀。一個在 Veo 3.1 上完美運行的提示詞可能在 Seedance 上需要微調。提取框架是工具無關的,但你应在自己的具體工具上测試組裝好的提示詞并迭代。
問: How many reference videos should I reverse-engineer before I get good at this?
从三個開始。選一個產品广告、一個電影叙事鏡頭、一個社交媒體剪辑。到第三個提取時,你會发現三者的共同規律——你會開始把看的每一個視頻都看作一組可提取的参數。那時就真正開窍了。
問: Can I use this framework to build a reusable prompt library?
是的——這就是終极目標。將每次提取保存為提示詞模板,用方括号替换主體特定細節。10 次提取後,你將擁有一個涵盖每种常見鏡頭類型的驗證過的提示詞庫:產品環绕、生活方式跟拍、電影級開場、社交釣饵、采訪設置等等。
問: What if I can't identify the camera movement or lighting?
一開始這很正常。从你能識别的内容開始——主體、環境、時長——然後逐步擴展。使用鏡頭語言速查表(見我們的電影感視頻提示詞指南)作為参考。練得越多,識别得越多:「那是 35mm 鏡頭,浅景深,暖色侧光」。
打開 YouTube。找一条你看過一百遍的广告——Apple 广告、Nike 短片、香水广告。關掉聲音看前 5 秒。每 2 秒暂停一次。
對每個 2 秒片段寫下:
鏡頭在做什麼?
光从哪裡來?
主體在做什麼?
鏡頭在做什麼?
光从哪裡來?
主體在做什麼?
然後打開 Google AI Studio,選擇 Veo 3.1,將這些觀察組裝成提示詞。把原始主體替换為你自己的——你的產品、你的品牌、你的想法。
生成。對比。
你剛剛把一条价值百萬美元的广告反向工程成了 AI 提示詞。再做十次,你就再也不會對著空白的提示詞框发呆了。
AI視頻提示指的是用戶希望影片在視覺、音效和敘事方面呈現的書面輸入內容。這些提示指導AI創作相關的媒體素材,例如場景、轉場、音樂、旁白和效果。AI通過將描述性短語(如「夕陽海灘配以舒緩音樂」或「都市夜晚的航拍鏡頭」)翻譯成相應的影片內容。透過處理這些指令,AI視頻創作工具自動化整個製作流程,從而節省時間和精力,並減少手動編輯的需求。無論專業與否,任何人都能根據簡單的文字描述創作高質量且專業的視頻。
編寫有效的提示對於最大化AI視頻創作工具的潛力至關重要。透過提供清晰且具針對性的指示,可以引導 AI 產生與您的願景緊密契合的結果。
撰寫清楚且具描述性的提示: 提示越詳細,AI 越能準確理解您的願景。與其僅寫「製作旅遊影片」,不如描述具體細節,例如「山峰上的五彩斑斕落日,展望寬廣的地平線,旁有鳥群飛過。」這有助於 AI 創造更準確且相關的影片。
使用正確的關鍵字: 關鍵字幫助 AI 辨識影片的情感、活動和視覺元素。例如「動作滿滿」、「日出」或「縮時」等描述可指導 AI 選擇特定的片段或元素。加入這些關鍵字可確保生成的影片符合偏好的語調和內容。
嘗試並保持創意: 請勇於在您的提示中混合獨特元素。例如,融合「賽博朋克都市風貌」與「自然之美」或「未來感服飾」。玩味各種創意通常能帶來意想不到又刺激的結果,使您的內容脫穎而出。
添加所需視覺美學: 建議具體的視覺風格,例如「復古膠片」、「霓虹燈光」或「3D 動畫」,可為 AI 提供清晰指示,使您的影片在視覺上更符合期待。如果您希望您的影片呈現更具電影感或藝術感的效果,請根據您的想法指定風格。
添加明確的行動呼籲:如果您的影片有特定的目的,請在提示中添加一個明確的行動呼籲,例如「立即註冊即可享有專屬權益」或「關注以獲取更多技巧」,以便為影片的目標引導方向。無論是創建宣傳內容、教學內容還是社交媒體內容,有效的行動呼籲能激發觀眾回應並增加互動。
以下是一些您可以搭配CapCut Web的AI使用的提示範例,用於創造各類型的影片,每個範例都旨在激發創意並產生有趣、高品質的具體主題內容:
旅遊影片提示:「一段令人驚嘆的巴黎夕陽鳥瞰景象,包括閃耀的艾菲爾鐵塔、塞納河水流以及古樸的石板街道,搭配舒緩的鋼琴音樂,以及溫柔且熱情的旁白宣告:『感受巴黎的魅力——立即預訂您的旅程!』,以9:16直豎比例製作用於社交媒體。」
產品展示影片提示:「一段極簡風格、30秒的無線耳機展示影片,耳機在純黑背景前旋轉,並展示近距離拍攝的細節。彩色文字圖形顯示『20小時電池續航』和『降噪功能』,配上快速的電子音樂節拍,最後一個行動呼籲:『現在購買!』」
激勵影片提示:「一段1分鐘的多文化背景人群實現夢想的蒙太奇畫面,例如完成馬拉松、大學畢業以及創業,搭配啟發人心的管弦樂背景音樂、充滿力量的激勵文字如『不斷前進』,以及畫面淡入日出景象,配有文字『您的旅程現在開始』。」
料理 影片提示:「一段愉快的45秒烘焙巧克力蛋糕教程,場景為整潔且現代的廚房,特寫展示濃郁的蛋糕混合料、色彩繽紛的成分如草莓、柔和的光線,搭配友好的旁白描述步驟,並加上『在家試試這個食譜吧!』的趣味文字。」
CapCut Web 是內容創作者的變革者,提供強大的免費線上AI影片製作工具,能輕鬆將文字提示轉換成動態影片。其直觀介面和強大的 AI 功能,例如自動生成腳本、智能媒體選擇以及無縫整合配音,使整個製作流程更加順暢。無論是社交媒體短片、行銷廣告,或教育教程,它都非常適合追求專業結果且無需剪輯專業的創作者、行銷人員和教育者。從製作爆紅 TikTok 影片到精緻的商業宣傳片,CapCut Web 讓每個人都能輕鬆創作。讓我們來探討 CapCut Web 如何以其直觀工具幫助簡化您的創作流程。
使用 CapCut Web 將您的創意願景轉化為吸引人的影片非常簡單。按照以下簡易步驟,使用最先進的提示式影片 AI 工具,輕鬆創作。
步驟 1
輸入您的文字或使用 AI 創作
點擊上方的鏈接登入 CapCut Web。在首頁選擇「免費 AI 影片製作」以開始使用提示創建影片的旅程。
當您進入新頁面時,選擇「即時 AI 影片」以顯示設定指引面板。在此,您將針對您的項目選擇理想的長寬比例和視覺風格,無論是用於社群媒體的短片、具有影響力的行銷活動,或是產品展示。接下來,塑造您的影片故事:您可以直接輸入腳本,或者讓 CapCut Web 的高級 AI 根據您的主題生成一個腳本。
最後,在同一面板中微調配音設置。通過下拉選單探索多樣的配音選項,使用耳機圖標預覽各選項,找到最完美的聽覺匹配。當您的視頻的時長、風格、腳本來源和配音設置完成後,點擊「Create」。CapCut Web 的 AI 將根據您的輸入生成專業品質的視頻。
步驟 2
生成相關的 AI 媒體內容
稍等片刻,然後在窗口中預覽您的視頻,以便編輯 AI生成的腳本並添加化身,使其更具個人特色。您可以利用 CapCut Web 廣泛的高品質視頻片段庫來提升內容品質。在「Scenes」菜單中使用「Match stock media」選項,將庫存影像與您的腳本同步以改善節奏,或者選擇「Match your media」上傳並調整您自己的素材。
如果您想更改視頻風格,只需點擊「Generate AI media」即可調整畫面比例和視覺主題。
步驟 3
進一步編輯或匯出影片
通過左側面板中的「元素」標籤提升您的影片「AI編輯」選項會自動強調關鍵字,並以一鍵方式添加音樂、貼紙和效果,簡化編輯過程接著,前往「音樂」標籤添加符合影片氛圍的背景音軌使用「字幕模板」模式可創建與影片和音樂同步的字幕最後,若對結果感到滿意,請點擊「匯出」完成您的影片,或選擇「進一步編輯」以使用更多專業編輯功能
點擊「進一步編輯」將引導您前往CapCut Web的高級編輯工作室,讓您自由精緻所有細節添加濾鏡、效果、轉場,調整播放速度,並根據您的創意目標調整視覺效果自訂每個畫面以符合您的品牌或願景。完成後,點擊「匯出」下載或直接將您的影片發佈於 TikTok、YouTube 等網站。
內建影片提示 AI 發電機:CapCut Web 的整合 AI 可讓您即刻將您的想法轉化為影片腳本。只需輸入您的主題、風格和期望的時長,即可自動生成完整的腳本大綱。這項智能工具簡化了內容創作,讓您在幾分鐘內輕鬆實現您的願景。
AI 虛擬人與旁白:此平台包含AI 虛擬人與旁白,能依您的影片調性進行調整。創作者可以使用此功能為影片添加有趣的角色和旁白,無需錄製或外部資源,從而提升影片的敘事性。
可自訂的範本:CapCut Web 提供多樣化的範本,無論是社群媒體、廣告還是個人用途,都能輕鬆創建各類型影片這些範本為用戶快速創作獨特影片提供了良好的基礎,同時保持專業的外觀
一鍵生成字幕:CapCut Web 可在一鍵操作中自動同步音樂與影片的字幕此外,您還可以從多種樣式中進行選擇,使字幕在視覺上更易讀,並且更容易為您的觀眾所理解
社群媒體無縫分享整合:CapCut Web 允許用戶將完成的影片直接上傳至 TikTok、YouTube、Instagram 和 Facebook 等熱門平台,簡化了分享流程這種整合非常適合希望快速將影片分享到首選渠道的創作者,而無需離開編輯工具
不合適的媒體匹配:有時候,AI 可能會根據您的提示提供不匹配或無關的媒體為避免這種情況,請通過使提示更加明確和具體來優化,或者直接從 CapCut Web 的資料庫中選擇更合適的媒體,確保能匹配到您希望的內容
語音旁白誤解:AI 語音旁白並不總是能捕捉到您期望的語調或風格,因此旁白聽起來不對勁。解決方案是從選項中選擇不同的語音風格,或者調整 AI 創建的文本以更好地適應您目標的語調,使腳本適配於您偏好的語音風格。
突然的轉場或不自然的節奏:AI 生成的內容可能存在突然或不自然的節奏或轉場。您可以通過使用 CapCut Web 的編輯功能手動修正轉場和節奏以達到更流暢的效果,或者進一步調整 AI 提案以呈現更自然的節奏。
視覺品質較差:AI 視頻有時在視覺品質上可能較低,特別是在處理複雜的動畫或圖像時。以更高的解析度導出,或在提示中指定高品質媒體以提升視覺輸出,從而獲得更清晰、銳利的結果。
在處理複雜提示時創造力有限:AI 在面對極其複雜或抽象的提示時可能會遇到困難,通常會導致乏味或跑題的結果。將提示拆解或簡化,使 AI 更容易處理。然後,通過 CapCut Web 的編輯器手動拼接這些部分,創建更精緻且具創意的輸出。
音頻同步問題:有時 AI 生成的音頻與視頻不同步,並存在不連貫的內容片段。手動調整CapCut Web時間軸中的音訊軌道,或使用內建的音訊同步功能,以改善音訊與影片的同步性,使之更一致。
在本指南中,我們介紹了影片提示AI的革命性能力,並說明了如何通過簡單的文字指令讓您的內容創作煥然一新。從了解AI看世界的方式,到使用精確的關鍵字和期望的結果來打造成功的提示,您現在擁有創作美麗影片的專業知識,輕鬆完成創作。CapCut Web 提供了一個輕鬆的平臺,將創意概念轉化為頂尖視覺效果,配備可定制的模板和AI語音功能。無論是設計社交媒體貼文、產品演示,還是激勵性影片,CapCut Web操作簡單的功能都讓製作影片的過程輕而易舉。準備好將您的想法化為現實了嗎?立即使用CapCut Web創作吸引人的影片,釋放您的創意潛力!
1
影片提示 AI 的準確程度如何,能否根據文字提示生成功能影片?
影片提示 AI 根據文字提示的準確性取決於輸入的清晰度和詳細性;更具體的提示會產生更好的結果。雖然 AI 不斷進化,但可能需要一些手動調整以完美符合您的構想。然而,CapCut Web 精確的提示解讀有助於實現高度準確的初步生成。
2
我可以自訂通過 影片提示 AI生成的影片嗎?
是的,完全可以自訂使用提示影片 AI 製作的影片。可以使用 CapCut Web 修改視覺效果,運用特效,調整過場,並更改旁白。您完全可以掌控最終影片的外觀和感受,並根據您的偏好和訊息進行製作。
3
什麼是最佳的AI 提詞影片工具適合初學者?
對於初學者來說,最好的影片提詞工具應該易於使用,同時又足夠強大,可以製作專業的影片。CapCut Web 提供直觀的介面和一系列 AI 驅動功能,使影片創作變得簡單。即使沒有高級編輯技能,初學者也能快速將自己的想法轉化為精緻且高質量的影片。
AI 影片生成已經走過了「一句簡單句子就能產出實用結果」的階段。像「一個男人在城市裡行走」這樣的短語,或許能生成一段會動的片段,但很少會帶來真正有電影節奏、光線、臉部表情、運鏡或敘事邏輯的畫面,也不太會讓影片有「刻意設計過」的感覺。這正是為什麼提示詞撰寫如此重要,尤其對於像 HappyHorse 1.0 這樣,以富表現力的視覺製作、鏡頭掌控、逼真人物角色與彈性多模態創作為核心設計的模型而言,更是如此。
本指南會用一個簡單實用的公式:場景 + 主體 + 動作 + 音訊 / 鏡頭 / 風格,來說明如何為 HappyHorse 風格的影片生成 撰寫更有力的提示詞。無論你是在測試新的 AI 影片產生器、嘗試 文字轉影片 AI、創作短篇戲劇片段,或是製作社群媒體短片,這個結構都能將模糊的想法轉化成具體的製作指令。
對於希望在撰寫影片提示詞前先準備概念圖像的創作者來說,Flyne AI 的 AI Image Generator 可以用來建立靜態畫格、角色參考、視覺氛圍或分鏡概念。一旦相關模型在該平台上線,這種「先圖像、後影片」的工作流程,會讓電影級影片提示的撰寫變得更加輕鬆。
HappyHorse 提示詞有什麼不一樣
一個好的 HappyHorse 提示詞 並不只是描述畫面上出現了什麼,它更像是一則迷你導演說明。它不只指出主體是誰,還會告訴模型主體位在何處、正在做什麼、鏡頭該如何移動、光線氛圍如何,以及這個鏡頭應該承載什麼情緒基調。
例如,較弱的提示詞可能是:
一位女性走在城市裡。
這樣的提示詞提供了主體與基本動作,但留下了太多模糊空間。什麼樣的城市?一天中的什麼時間?氛圍是浪漫、緊張、未來感、孤獨,還是充滿能量?鏡頭是靜止的、手持的、特寫,還是從她身旁平移跟拍?場景需要雨、水面上的霓虹反射、柔和陽光、背景車流,或是戲劇性的陰影?
更有力的 Happy Horse AI 提示詞會這樣寫:
一位時髦的年輕女子在夜晚的東京雨街上行走,霓虹招牌倒映在濕潤路面上,中景側向跟拍鏡頭,柔和藍色與洋紅色燈光,電影感氛圍,細膩城市環境音,逼真的短片風格。
差異一目了然。第二個版本為模型提供了視覺結構:它定義了場景、主體、動作、運鏡、光線與情緒。這就是更好 AI 影片提示詞 的基礎:不要只描述概念,而要描述「這個概念應該如何被拍攝」。
HappyHorse 1.0 尤其適合這種提示方式,因為它的設計重點就在於電影級光線、流暢運鏡、富表情的臉部、逼真的中景與特寫,以及彈性的影片剪輯能力。這意味著,好的提示詞不應該像搜尋關鍵字,而應該像一份簡短的製片說明。
基本公式:場景 + 主體 + 動作 + 音訊 / 鏡頭 / 風格
要為 文字轉影片產生器 寫出更好的提示詞,最簡單的方法就是使用固定公式。你不需要每次都寫冗長複雜的段落,只要用「堆疊」的方式逐層建構提示詞即可。
核心結構是:
場景 + 主體 + 動作 + 鏡頭 + 風格 + 音訊或氛圍
場景 告訴模型一切發生的地點。它可以是寫實的,例如巴黎咖啡館、現代辦公室、山間步道或城市街道;也可以是幻想的,例如漂浮島嶼、外星市集或水下宮殿。
主體 是影片的主要焦點。可能是一個人、動物、產品、奇幻生物、數位分身、機器人或物件。主體定義得越清楚,模型越容易安排構圖與鏡頭。
動作 說明影片中會發生什麼變化。AI 影片生成不只是讓靜態畫面動起來,而是選擇「正確的動態」。主體可以行走、轉身、微笑、跳舞、奔跑、說話、舉起手、打開門,或與另一個角色互動。環境也可以有動態:咖啡升起的蒸氣、雨滴落在窗上、風中搖曳的樹葉,或遠處閃爍的燈光。
鏡頭 描述觀眾如何看見這個場景。緩慢推鏡會製造緊張感;廣角鏡頭會營造規模感;跟拍鏡頭會增加動感;靜態中景則帶來冷靜的寫實感。撰寫 電影感 AI 影片 提示詞時,鏡頭語言往往是影響最顯著的部分。
風格 定義畫面外觀,包括光線、色調、類型、質感、寫實度以及情緒氛圍。提示詞可以是寫實、商業感、黑色電影、奇幻、類動畫風、紀錄片風、懷舊、奢華或超現實等。
音訊或氛圍 層,則能包含台詞、背景聲音、音樂方向或環境音。即使影片生成工具在最終流程中尚未完全產出音訊,音訊提示仍能幫助塑造場景的情緒方向。
一個簡單可重複使用的句型是:
在【場景】中,【主體】正在【動作】,以【鏡頭運動】拍攝,搭配【風格或光線】,並有【音訊或氛圍】。
例如:
在日落時分安靜的豪華列車包廂內,一位年長偵探凝視著一個封好的信封,旁邊一位年輕女子緊張地看著他,鏡頭以緩慢推進拍攝,從中景推到特寫,窗外灑入溫暖金色光線,緊張的懸疑劇氛圍,背景有柔和列車行進聲。
這個公式之所以有效,是因為它在不混亂的前提下,給了模型完整的視覺計畫,同時足以應付戲劇、產品廣告、社群短片、奇幻場景、AI 分身與短篇敘事等不同用途。
如何清楚描述鏡頭運動
鏡頭運動是強大 影片提示詞生成器 工作流程中最重要的一環之一。許多使用者會描述主體與場景,卻忘了告訴模型鏡頭該如何拍攝,結果畫面也許好看,卻顯得隨機或平淡。
要讓提示更具電影感,可以使用簡單直接、會影響影片結果的鏡頭術語。特寫 用於呈現情緒、臉部細節、產品質感或戲劇張力;中景 很適合對話、社群頭像式講話影片與自然手勢;大全景 則適合風景、動作場面、奇幻規模與環境敘事。
運動描述同樣重要。緩慢推鏡 讓場景更親密或更懸疑;拉遠鏡頭(dolly-out) 可以揭示更多環境並帶來驚喜;跟拍鏡頭 追隨主體,增添能量;低角度鏡頭 讓主體顯得強大;頂拍鏡頭 帶來設計感、編輯風格;手持鏡頭 則營造緊張或寫實感。
在 HappyHorse 風格提示 中,鏡頭運動應該與動作相配。如果主體在行走,跟拍鏡頭通常比靜止鏡頭更合適;如果兩個角色在緊張對話,緩慢推鏡或交替特寫能讓情緒更強烈;若是在介紹產品,微距特寫或緩慢繞圈鏡頭可以凸顯質感與細節。
以下是一個較弱的版本:
一個跑者在街上奔跑。
以下是較強版本:
一位年輕跑者在日出時分奔跑於空蕩的城市街道,鏡頭在腰部高度平行跟拍,帶有輕微手持晃動,溫暖陽光灑在建築物上,節奏快速但運動流暢,逼真的運動廣告風格。
第二個提示詞不只是描述發生了什麼,它在告訴模型「要怎麼拍」。這正是普通 文字轉影片 AI 結果與更專業畫面之間的差異。
若你不確定該怎麼想像構圖,可以先用 Flyne AI 的 AI Image Generator 做一張靜態參考圖,幫助你釐清鏡頭角度、光線方向、背景佈局與角色姿勢,再將這個構想轉成動態提示。
如何加入光線、氛圍與電影感風格
光線與氛圍是讓 AI 影片令人難忘的關鍵。沒有這兩者,即便技術上畫面正確,也可能顯得普通。強而有力的 文字轉影片產生器 提示詞,應該使用少量且精準的風格描述,而不是堆疊一大串彼此無關的形容詞。
先從光線開始。常見的電影光線術語包括:黃金時刻光、柔和背光、燭光、霓虹光暈、月光、硬質棚燈、陰天日光、溫暖室內光、冷調藍光、高反差黑色電影陰影等。這些字詞有助於定義場景的「情緒溫度」。
接著加入氛圍。場景可以是緊張、浪漫、懷舊、神秘、充滿希望、孤獨、奢華、俏皮、夢境般、恐怖或充滿活力。氛圍有助於模型選擇表情、節奏、色彩與視覺韻律。
最後是視覺風格。一個 電影感 AI 影片 提示詞可以使用「寫實短片」、「時尚大片」、「奢華廣告」、「奇幻冒險」、「偵探黑色電影」、「復古科幻」、「社群 vlog」、「紀錄片寫實」、「高級產品廣告」等描述。
例如:
一只奢華香水瓶立在黑色鏡面平台上,頭頂柔和聚光燈打下來,淡淡霧氣在瓶身周圍飄散,微距特寫,鏡頭緩慢繞著香水瓶旋轉,優雅的美妝廣告風格,溫暖高光與深沉陰影。
這個提示有效,是因為每個細節都在支撐同一個方向:產品、光線、運鏡與氛圍共同指向「高級商業廣告」的畫面。
常見的錯誤是混合太多互相衝突的風格。例如:「寫實紀錄片、動畫奇幻、恐怖黑色電影、明亮喜劇、賽博龐克時尚廣告」,會給模型過多矛盾信號。請選擇一種主要風格,再搭配兩三個輔助描述即可。
在撰寫 HappyHorse 1.0 提示詞 時,可以把風格想像成一個聚焦的視覺承諾:你要影片像電影場景、產品廣告、社群短片、奇幻預告,還是寫實講頭影片?一旦確定方向,提示詞中的每一個字都應支援這同一個目標。
常見提示詞錯誤要避免
在 AI 影片提示詞 中最常見的問題是「太模糊」。像「漂亮」、「酷」、「很棒」、「電影感」這類字詞可以幫忙,但單獨使用並不夠。當提示詞能解釋「漂亮」或「電影感」在這個場景中的具體意義,例如:金色光線、淺景深、雨中倒影、緩慢運鏡、富表情的特寫或戲劇性構圖時,力量就會大得多。
另一個常見錯誤是塞入過多動作。AI 影片片段通常很短,因此提示詞不該嘗試在十秒中塞進整部電影。與其要求角色「醒來、跑到外面、跟怪物戰鬥、飛上天空、再發表演說」,不如聚焦在一個清楚的瞬間。
互相矛盾的指令也會降低品質。像「角色完全不動,同時快速奔跑」就會產生混淆;「靜止鏡頭搭配劇烈手持運動」也一樣。在為 Happy Horse AI 工作流程撰寫提示時,請保持動作與運鏡邏輯一致。
還有一個常見問題是,許多人會過度描述靜態細節,卻忘了「動態」。但對影片而言,動態是不可或缺的。漂亮的房間描述很有用,但提示詞仍應說明有哪些東西在動:人物轉身、窗簾搖曳、蒸氣升起、鏡頭後退,或陰影在牆上移動。
較弱的提示可能是:
一個很酷的女孩在城市裡,電影感,高品質。
比較好的提示會是:
一位時髦的年輕女子在夜晚的現代城市街道上行走,霓虹倒映在濕潤路面上,她的外套在風中微微擺動,中景跟拍鏡頭,冷調藍色與洋紅色光線,自信的情緒,寫實電影風格。
較好的版本並沒有難寫太多,卻給了模型清楚得多的計畫。這就是提示詞撰寫的真正目標:降低模型的猜測空間。
可直接複製的 HappyHorse 提示詞範例
以下範例可用於調整成各式 HappyHorse 風格提示,用來展示如何在不同場景下運用公式。
電影戲劇類提示
在日落時分安靜的巴黎咖啡館裡,兩位曾經相愛的戀人重逢。溫暖金色光線從拱形窗灑入,他們面前放著喝到一半的咖啡杯,兩人一開始都刻意避免對上視線。鏡頭從中廣角慢慢推近到特寫,直到女子終於抬頭,露出一絲若有似無的微笑。背景有柔和談話聲,淺景深,優雅的浪漫劇風格,35mm 膠片質感。
這個提示之所以有效,是因為它同時包含場景、主體、情緒、動作、鏡頭、光線與聲音氛圍,在細節充分的同時仍然專注在一個戲劇瞬間。
都市動作類提示
一位年輕男子在雨夜的霓虹小巷中奔跑,腳步踩過水坑濺起水花,紅藍色招牌倒映在地面。鏡頭在旁側帶有微微手持晃動地跟拍,接著短暫切到低角度鏡頭,拍攝他急轉彎的瞬間。節奏快速,冷調賽博龐克光線,寫實動作電影風格,遠處車流與雨聲環繞。
這種結構很適合作為動作場景,因為鏡頭與主體一同運動,風格清楚,同時不會在短時間內塞入太多故事事件。
奇幻場景提示
一位銀髮女法師站在黎明時分的古老森林裡,薄霧在高大的樹木間飄散,發光粒子在她的雙手周圍聚集。她的斗篷在微風中輕輕飄動,同時緩緩舉起木杖指向天空。鏡頭慢慢繞著她環繞,柔和金色晨光穿過樹枝灑落,空靈奇幻氛圍,背景有細微魔法嗡鳴聲。
這個例子展示了奇幻提示也可以很穩健:與其堆疊大量魔法效果,不如聚焦在一個主體、一個動作與一個運鏡。
產品廣告類提示
一只奢華香水瓶在黑色光滑反射平台上緩慢旋轉,頭頂柔和聚光燈打下來,淡淡霧氣圍繞瓶身底部,微距特寫顯示玻璃質感與內部金色液體。鏡頭緩慢向前推進,亮點在瓶身表面移動。優雅高級美妝廣告風格,乾淨棚拍背景,安靜而奢華的氛圍。
產品提示要維持清晰:主體必須始終清楚可見,動作應受控,光線要用來強調質感。
社群講頭影片提示
一位開朗的保養品創作者坐在明亮現代的錄影棚裡,手上拿著一小瓶產品置於臉旁。她自然微笑,一手比畫,一邊對鏡頭說話。中近景拍攝,柔和美肌燈光,背景乾淨,充滿活力的社群影片語氣,逼真臉部表情,精緻的網紅影片風格。
對社群內容來說,自然表情與清楚構圖比複雜運鏡更重要。這個提示保持畫面直接而實用。
短篇戲劇對話提示
在日落時分昏暗的私人噴射機艙內,一位身穿黑色西裝的年長企業家坐在一位緊張的年輕競爭者對面。窗外是泛著金紅色的雲海。年長男子緩緩晃動手中的威士忌杯,身子前傾,用平靜卻帶威脅的語氣說:「你只有兩條路,其中一條能讓你保持自由。」鏡頭從側面慢慢推進,緊繃的氛圍,奢華驚悚片風格。
這個範例利用對話、場景對比與緩慢運鏡營造人物張力,特別適合短篇戲劇或電影感廣告概念。
提示詞撰寫重點整理
最好的 HappyHorse 提示詞 不一定是最長的,而是最清楚的。先決定場景,再定義主體,描述一個主要動作,加上鏡頭指示,最後補上光線、氛圍與風格,需要時再加入聲音、台詞或環境音。
思考方式要像導演,而不是像蒐集關鍵字的人。與其一味堆疊熱門字詞,不如先問自己:觀眾在第一秒應該看到什麼?在這段影片中應該發生什麼變化?最後希望觀眾留下什麼情緒印象?
對於正在尋找實用 影片提示詞生成器 方法的使用者,可以把公式簡化成五個問題:
在哪裡?有誰?發生什麼?怎麼拍?感覺如何?
當這五個問題都有答案時,對任何一個 AI 影片生成器 來說,提示詞都會變得容易理解得多。
推薦工具:先用 Flyne AI 準備視覺參考
在生成影片之前,許多創作者會先準備靜態畫面。強而有力的參考圖像能夠釐清角色設計、產品角度、光線氛圍、背景構圖或整體美術方向。這也是為什麼 Flyne AI 的 AI Image Generator 是 HappyHorse 風格提示規劃 的實用搭檔,尤其適合那些想用 AI image generator 先建立概念畫格,再進入影片製作的創作者。
你可以用它為短片、產品廣告、奇幻場景、社群視覺或角色造型建立概念畫格。之後再為這些靜態概念加入動作、運鏡與氛圍,轉寫成更完整的動態提示。一旦相關模型在 Flyne AI 上線,這種「圖轉影」的規劃流程,對於想要從概念到最終影片都維持流暢工作流程的創作者而言,會更加有用。
更多可探索的模型與工具
如果你想持續嘗試各種視覺 AI 工作流程,Flyne AI 作為模型與工具平台值得關注。除了影像生成流程之外,使用者還可以探索用於概念開發的 Nano Banana AI、適合更多影像生成實驗的 Nano Banana 2,以及用來建立可直接寫入提示詞的視覺素材的 AI Image Generator。
這些工具可以幫助創作者在進入影片提示之前,先建立更扎實的視覺基礎。更清楚的靜態圖像往往帶來更清楚的影片構想,而更清楚的影片構想,通常就會導向更好的提示詞
作者 : 資訊組 發布日期 : 2026-06-17
來源:OpenAI Help Center、Google Workspace Learning Center、Canva 說明中心、Adobe Content Authenticity、Content Credentials
威脅對象:使用 GPT、Gemini、Canva、NotebookLM、Claude、Chat Everywhere 等 AI 工具撰寫影片文案、分鏡腳本、旁白草稿、字幕內容,並製作活動開場影片、宣導短片、課程情境影片或社群短影音之教職員工與學生
【主題面向簡介】
AI 已經不只可以幫忙寫文章,也開始進入影片文案、分鏡腳本、字幕草稿與宣傳短片製作流程。老師可能用 GPT、Gemini 或 Claude 發想課堂引導短片,行政同仁可能用 AI 協助撰寫活動宣傳影片文案,處室也可能把活動照片、簡報素材或文字說明放進 Canva,製作官網、簡報或社群使用的短影音。
不過,AI 影片和一般公告不同。公告是文字,改錯字、調語氣比較直覺;影片牽涉時間、鏡頭、畫面節奏、字幕位置、旁白語氣、後製空間與發布審稿。如果只輸入「幫我做一支校園宣導影片」,AI 很容易自由發揮,做出看起來漂亮但不一定能用的內容。
更重要的是,AI 不是萬能。AI 可以協助產生影片文案、分鏡構想、旁白草稿、字幕內容或短片段畫面,但不代表輸入一句話就能得到可直接發布的成品。實務上常會遇到提示詞寫得很清楚,AI 仍然跑題;要求它改東邊,它可能改到西邊;只想調整一個畫面,結果整體風格被重新洗掉;甚至遇到排隊、額度不足、輸出失敗、畫面品質不穩或工具暫時無法使用的狀況。
因此,AI 影片製作真正需要被看見的,不只是工具功能,還有時間成本、工具成本、溝通成本、試錯成本、等待成本、修改成本與審稿成本。AI 不是免費影片工廠,也不是按一下就能交片的魔法工具。
OpenAI 的提示詞教學提醒,好的提示需要清楚、具體並提供足夠脈絡,提示也常需要反覆調整;Google Workspace 的 Gemini 提示教學也強調,提示要提供情境、清楚說明需求,複雜任務可以拆開處理。Canva 的 Magic Video 可從使用者提供的片段或照片建立 60 秒多場景直式影片,並自動加入範本、轉場與音樂。這些工具的共同提醒是:AI 影片製作的第一步,不一定是直接生成完整影片,而是先把影片目的、秒數、分鏡與後製需求寫清楚。
所以本篇不是介紹哪個 AI 影片工具最強,而是教大家一個更實用的方法:把 AI 影片提示詞寫成「簡短分鏡腳本」。先寫清楚影片要做什麼、給誰看、要幾秒、前中後畫面怎麼安排、哪些內容不要出現,後續再用 Canva 或剪輯工具加入正式標題、日期、字幕與校內資訊。
它是怎麼發生的?
常見問題是,使用者把 AI 當成「自動完成整支影片」的工具,只給一句很模糊的指令。
例如:
請幫我做一支閱讀活動影片。
這句話太空泛,AI 不知道影片要幾秒、給誰看、要放在哪裡、畫面要活潑還是正式、要不要留標題位置、能不能出現人物、能不能有文字。結果常見狀況是:畫面很好看,但沒有地方放活動名稱;影片節奏太快,不適合學校公告;AI 自己生成錯字;出現不適合校園使用的場景;或畫面太像真實活動紀錄,容易讓人誤會。
比較好的問法,應該把影片寫成「前、中、後」的分鏡。
例如:
請協助我撰寫一段 10 秒校園閱讀週宣傳短片的分鏡文案,用於學校官網與活動開場簡報。前 3 秒呈現書本與書桌特寫,陽光灑在桌面上;中間 4 秒鏡頭慢慢推進到明亮圖書館,呈現安靜閱讀氛圍;最後 3 秒停在右側留白畫面,方便後續加入活動標題與日期。整體風格溫暖、明亮、安心,適合國中小家長與學生觀看。請不要安排可辨識真人臉孔、學生姓名、班級、學號、校徽、校名或任何畫面文字;活動標題與日期由承辦人後續自行排版。
這個提示詞比較長,但重點不是「越長越好」,而是它把 AI 需要知道的事情講清楚了:
這支影片用在哪裡。
要做幾秒。
前中後畫面怎麼安排。
鏡頭怎麼移動。
整體風格是什麼。
哪些東西不要出現。
哪裡要留給後製。
對老師與行政同仁來說,進階技巧不是要求 AI 一次完成整支影片,而是先請 AI 幫忙寫出可拍、可生成、可剪輯、可修改的分鏡文案。影片真正要穩,通常要先有腳本,再有畫面,最後才是字幕與後製。
這個道理不只適用於 AI 影片。生成圖像、寫程式、做簡報、整理文件也都一樣:AI 可以提供初稿,但不保證一次正確;AI 可以協助修改,但不保證只改你指定的地方;AI 可以提供方向,但仍需要人來判斷、修正、審查與負責。
尤其是寫程式或生成圖像時,常會出現同樣狀況。寫程式可能看起來完整,實際執行卻錯誤;生成圖像可能第一眼漂亮,細節卻出現文字變形、人物異常或風格不符;製作影片則可能遇到畫面跑題、修改後整體變調、額度不足或排隊等待。這些都不是單純「會不會用 AI」的問題,而是要把提示詞能力、檢查能力、修改時間與工具成本一起納入考量。
風險嚴重性(治理精神)
這個議題的嚴重性,不在於使用 GPT、Gemini、Canva、NotebookLM、Claude 或 Chat Everywhere,而在於影片一旦發布,觀看者往往會把畫面當成比文字更接近「真實紀錄」的內容。同時,也要讓主管與承辦人理解:AI 影片不是零成本任務,不能把「有 AI」直接等同於「馬上完成」。
第一,AI 影片不能只靠一句話完成。
目前學校較常接觸的 AI 影片工作流程,多半不是讓 AI 一次生成完整長片,而是先用 GPT、Gemini、Claude、NotebookLM 或 Chat Everywhere 產生影片腳本、分鏡、旁白與字幕草稿,再到 Canva 這類設計工具中搭配模板、圖片、短影音素材與音樂進行排版與剪輯。也就是說,對多數同仁來說,AI 影片製作的第一步不是「按下生成影片」,而是先把影片文案寫清楚。
第二,AI 影片有帳號、額度與成本限制。
AI 不是開了就能無限制使用。不同工具會受到帳號方案、學校授權、使用額度、排隊速度、生成秒數、輸出畫質、模型能力與修改次數影響。免費或基本帳號通常可用次數較少、生成速度較慢、功能較有限;付費帳號或學校授權帳號通常可用量較多,但仍不代表可以一次完成完整長片。
更現實的是,額度用完不是「等一下就好」。以 ChatGPT 免費方案為例,官方說明免費使用者在五小時區間內有使用限制;達到上限後,若不升級,就需要等額度重置後才能繼續使用。Canva 說明中心也提到,Magic Video 可建立 60 秒影片;Canva 的 AI 使用額度則會依方案與工具而有所不同,若達到每小時上限,也需要等待限制重置後才能繼續製作。不同工具的重置時間不一定相同,但共同重點是:不花錢或沒有足夠授權,就可能卡在等待、排隊、額度不足或功能受限。
因此,若要用 AI 製作正式活動影片、招生短片或宣導影片,應事前估算工具成本與製作時間。不要把重要影片工作壓到最後一天,才發現帳號額度不足,若不升級就要等數小時才能再試;也不要等到發布前才發現排隊過久、輸出不穩或結果需要大量重做。
第三,AI 影片需要人力與反覆修正。
AI 影片不是「丟一句話就交件」。一支能公開發布的影片,仍需要前期文案、分鏡設計、提示詞撰寫、結果挑選、錯誤修正、字幕後製、音樂搭配、校內資訊確認與發布審稿。
實務上,AI 可能第一版畫面不對,第二版風格跑掉,第三版人物動作怪異,要求它修改某一處時,也可能把原本正確的地方一起改壞。這些反覆溝通、等待、挑選與修正,都是實際成本。
第四,長影片要拆段,不要期待一次完成。
AI 比較適合協助短片段、開場動畫、情境示意、旁白草稿與字幕文案。如果要做 30 秒、1 分鐘或更長的宣導影片,建議先拆成「開場、重點一、重點二、結尾」幾個段落,分別寫好文案與畫面需求,再用 Canva 或剪輯工具組合。一次要求 AI 做完整長片,容易出現前後風格不一致、字幕不穩、畫面跳動或重點分散。
第五,影片提示詞要寫時間,不能只寫內容。
圖片提示詞描述的是一張畫面,影片提示詞描述的是畫面如何隨時間變化。若沒有說明前幾秒、中間幾秒、最後幾秒要出現什麼,AI 就會自行安排節奏。對活動宣傳、教學引導或行政宣導來說,這容易造成畫面重點錯置。
第六,AI 很容易自己生成文字,但文字常常不可靠。
AI 影片中的中文字、校名、日期、標語、活動名稱,可能出現錯字、變形或不符合原意。因此,製作校園宣傳影片時,建議在提示詞中先要求「不要在畫面中生成任何文字」,活動標題、日期、地點與報名資訊後續由承辦人用簡報、Canva 或剪輯工具自行加入。
第七,越像真實影片,越需要避免誤認。
如果 AI 生成或 AI 協助製作的影片看起來像真實校園活動紀錄,卻不是實際拍攝,家長、學生或社會大眾可能誤以為那是真實活動、真實學生或真實場地。必要時可在影片說明或畫面角落標示「AI 生成示意畫面」或「非實際活動紀錄」。內容來源與製作方式的標示,可以協助觀看者理解內容是拍攝、編修或 AI 生成。
第八,素材與人物影像要有邊界。
本篇主題是影片提示詞教學,不是素材管理規範,但仍要提醒:若只是需要活動氛圍,優先用文字描述生成示意影片;若要上傳真實學生、家長或教職員影像作為素材,應確認同意範圍是否包含本次用途。含姓名、班級、學號、報名名單、校務系統畫面的素材,不應直接上傳到外部 AI 工具。
第九,影片、圖像與程式都要有人工把關。
AI 影片容易讓人看到畫面就以為可以直接使用,但生成圖像與寫程式也有相同問題。圖像可能看起來精美,細節卻有錯字、怪手、錯誤標誌或不合宜元素;程式可能看起來完整,實際執行卻出錯,甚至產生資料處理或權限控管風險。AI 產出的內容越接近正式使用,越不能省略人工檢查。這不是不使用 AI,而是要把 AI 當成需要審稿、測試與修正的工作流程。
同仁怎麼做(AI 影片文案與分鏡提示詞三招行動指引)
● 第一招(先寫目的與秒數|不要只說幫我做影片)
AI 影片提示詞第一步,不是先描述畫面,而是先寫清楚這支影片要用在哪裡、做給誰看、要幾秒。
請先回答三個問題:
這支影片用在哪裡?
例如:學校官網、活動開場簡報、班親會簡報、課堂引導、社群貼文、校內電視牆。
這支影片給誰看?
例如:學生、家長、教職員、校外來賓、招生對象。
這支影片要多長?
例如:5 秒適合開場動畫,8 至 10 秒適合單一主題短片段,15 秒適合簡短宣導,30 秒以上建議拆成多段寫腳本後再剪輯。
不建議提示詞:
請幫我做一支校園防災宣導影片。
建議提示詞:
請協助我撰寫一段 8 秒校園防災宣導開場影片分鏡,用於學校晨會簡報。影片對象為國中小學生,目標是營造冷靜、清楚、可理解的防災提醒氛圍,不要過度緊張或恐怖。
這一招的重點是:AI 不會自動知道你的使用情境。目的與秒數寫清楚,後面分鏡才會穩。
● 第二招(分鏡要拆段|把前中後畫面寫給 AI)
影片不是一張圖,而是畫面隨時間移動。提示詞要把「前幾秒、中間幾秒、最後幾秒」寫清楚,AI 才比較不會亂跳。
可以使用這個格式:
前 3 秒:畫面出現什麼。
中間 4 秒:鏡頭怎麼移動。
最後 3 秒:停在哪裡,是否要留白。
鏡頭語言可以這樣寫:
鏡頭慢慢推近。
鏡頭由左至右平移。
鏡頭從上方俯視慢慢下降。
畫面保持穩定。
不要快速轉場。
最後定格在留白畫面。
範例提示詞:
請協助我撰寫一段 10 秒校園閱讀週宣傳短片分鏡。前 3 秒呈現書本與書桌特寫,陽光灑在桌面上;中間 4 秒鏡頭慢慢推進到明亮圖書館,呈現安靜閱讀氛圍;最後 3 秒畫面定格在右側留白區,方便後續加入活動標題與日期。畫面保持穩定,不要快速轉場。
如果要做比較完整的 30 秒宣導影片,建議不要一次要求 AI 完成,而是拆成四段:
開場片段:8 秒,建立情境。
重點一片段:8 秒,呈現第一個提醒。
重點二片段:8 秒,呈現第二個提醒。
結尾片段:8 秒,留下標題或行動呼籲空間。
這樣做的好處是,每一段都比較容易控制,也方便老師或承辦人後續挑片段、剪輯、加字幕與修正。
● 第三招(資安武功秘笈|成本限制與發布前審稿)
本篇屬於 AI 影片文案、分鏡提示詞與校園影像應用議題,重點不是外部求證,而是提示詞要寫清楚、成本要先估算、發布前要人工審稿。
製作前請先確認:
使用的是免費帳號、個人付費帳號,還是學校授權帳號。
是否有生成次數限制。
額度用完後,是每小時重置、數小時後重置,還是必須升級方案。
是否可能像 ChatGPT 免費方案一樣,在五小時區間內達到使用限制後,需要等待額度重置才能繼續使用。
是否有影片長度限制。
是否需要排隊等待。
是否能輸出需要的畫質。
是否能商用或公開發布。
是否需要額外剪輯工具或設計工具。
是否有足夠時間重跑與修改。
建議在影片提示詞最後加入限制條件:
請不要安排可辨識真人臉孔。
請不要出現學生姓名、班級、學號、電話或任何個資文字。
請不要出現學校校名、校徽或校務系統畫面。
請不要出現未授權品牌、卡通角色或名人肖像。
請不要在畫面中生成任何文字,活動標題與日期由承辦人後續自行加入。
請避免讓畫面看起來像真實活動紀錄;若為示意畫面,後續會加註 AI 生成示意畫面。
如果使用真實人物影像作為素材,請先確認同意範圍是否涵蓋本次用途;如果只是需要活動氛圍,請優先用文字描述生成示意影片,不使用真實學生照片。
發布前請人工檢查:
畫面是否出現錯字或奇怪文字。
人物手腳、表情、動作是否怪異。
畫面是否出現不合理物品。
是否出現錯誤校徽、錯誤校名或類似他校標誌。
是否讓人誤以為是真實活動紀錄。
是否需要標示「AI 生成示意畫面」。
是否符合學校形象與活動目的。
這一招的重點是:AI 可以幫忙產生影片文案、分鏡與短片段構想,但不能替學校負責發布判斷,也不能被當成零成本、零時間、零修改的工具。影片越像真的,越要清楚標示;內容越要公開,越要人工審稿。
同樣地,若使用 AI 生成圖像或寫程式,也不能直接複製貼上就交付。圖像要檢查人物、文字、標誌、版權與是否誤導;程式要測試能不能執行、是否處理正確資料、是否有不必要的權限或外洩風險。AI 產出只是草稿,不是最終責任的替代品。
資訊小組提醒
AI 影片文案不是一句「幫我做影片」就好,而是要像寫分鏡腳本一樣,把目的、秒數、畫面、鏡頭、風格、限制與後製需求說清楚。
請記住七格公式:
影片目的:用於什麼場合。
影片長度:要做幾秒。
分鏡安排:前中後各出現什麼。
鏡頭動作:推近、平移、定格或俯視。
視覺風格:溫暖、正式、活潑或科技感。
限制條件:不要出現個資、人臉、錯字、校徽或未授權元素。
後製空間:預留標題、日期、字幕或活動資訊位置。
也請記住一個現實:AI 不是萬能,也不是免費影片工廠。它可以協助產生腳本、分鏡、旁白、字幕與視覺構想,但要做出能正式發布的影片,仍需要時間、工具成本、AI 操作能力、反覆修改與人工審稿。
尤其是帳號額度問題,不能等到要交件時才發現。部分 AI 工具達到使用上限後,若不升級或加購方案,就必須等待系統重置額度後才能再使用。以 ChatGPT 免費方案為例,官方說明免費使用者在五小時區間內有使用限制;也就是說,若臨時要趕影片文案、分鏡、圖像或影片生成,卻遇到額度用完,沒有付費方案或授權方案時,就可能必須等待額度重置,無法立即繼續工作。
不管是製作影片、生成圖像,還是寫程式,都是一樣的道理。AI 可以提供初稿,但不保證一次正確;AI 可以協助修改,但不保證每次都改對;AI 可以降低部分入門門檻,但不代表沒有學習成本、溝通成本、等待成本、工具成本與審查責任。
把 AI 當助手,可以協助我們整理想法與產出草稿;把 AI 當成萬能工具,則容易造成錯誤期待。影片可能要重跑,圖像可能要重修,程式可能要測試,文件可能要校對。真正能把 AI 用好的關鍵,不只是會輸入提示詞,而是知道如何拆解需求、檢查結果、修正錯誤,並對最後發布或交付的內容負責。
AI 影片目前更適合協助短片段、開場動畫、情境示意、腳本草稿與視覺構想,不適合完全取代正式拍攝或一次完成長篇宣導片。把影片拆短、把分鏡寫清楚、把文字留給後製,並事前估算時間與成本,才是目前比較穩的做法。
我後來發現
這種提示詞
他其實就是要拆解成像演戲一樣
你要去研究演員的情緒動作拆解
你不能直接跟AI說
女主角哈哈大笑很開心
你必須要把哈哈大笑的動作拆解出來
一個人如果哈哈大笑他會前仰後伏
他會嘴巴張大然後笑到眼淚流出來
可能眼眶會紅、耳朵會紅
所以你的寫法不能說女主角哈哈大笑
要寫的是
女主角聽到對方說的話
先慢慢地露出笑容,身體開始往後仰,頭往上揚
手開始拍大腿,並且眼淚從眼角蹦出來
眼睛微微的彎曲,再寫上肩膀會隨著笑聲抖動
就是要把它像演技一樣的拆解出來
這樣你生成的動畫他才會是有情緒有遞進
感覺像真人一樣
我自從改用這種的寫法以後
我生出來的動畫女主角
他的動作眼神就有戲了
就不再是假假的了
我附上兩個範例給大家看一下
影片一
女主看影片又哭又笑
結果他生出來就是超尷尬的
哭的笑的有夠假的
影片二
我改成女主滑著影片
有點無聊
再慢慢地露出笑容
畢竟在家你不會像瘋子一樣亂笑
以下提示詞由 Threads 創作者 Chris.AI探索家(@chris_ai_explorer)在「以假亂真系列」中公開,本文已獲作者授權引用,分三段輸入。
60年代邵氏兄弟武俠電影原生風格,100%還原攝影棚人工布景假農家庭院,特藝彩色高飽和度,非自然主義戲劇布光,強烈紅藍補色光效,老電影膠片顆粒感,全程強化攝影棚內景感,畫面清晰無抖動,人物五官精緻貼合邵氏武俠審美,動作流暢不卡頓,全程搭配邵氏經典武俠管弦BGM,角色登場配武俠亮相鏘鏘音效,結尾定格配爆點重音音效。
AI 影片工具預設傾向生成寫實風格。要把模型「掰回」復古人工感,必須在開頭就明確告訴它:不要自然主義布光、不要戶外場景、不要現代感。 這段基底每個分段提示詞都要帶著走。
分兩個小節處理:
0–4秒:建立場景與人物
人工布景農家院內,需先建立明確的邵氏片場感。主體角色設定為黑髮整齊後梳束髮、戴舊布巾、面容樸實硬朗、淺麥色、無鬍鬚的年輕農夫,身穿土黃色粗布短打對襟小褂,挽袖露出小臂,腰間繫粗布腰帶,下穿扎腳布褲,布料需帶做舊磨邊質感,整體維持復古青黃色調柔光寫實質感。畫面中農夫正揮斧劈柴。院門口則安排女俠緩步踏入,人物需設定為容貌絕美、妝容濃豔、高聳髮髻配金飾步搖、身穿紅黑相間刺繡俠客服。此段需保留開口台詞:「你可曾在雪山救過一隻狐狸?」
重點:衣料質感描述(做舊磨邊)與色調(青黃色調)不能省略,否則 AI 容易生成過於精緻的古裝,喪失邵氏電影那種廉價感。
4–6秒:戲劇停頓與轉場
此段重點在於角色對話節奏與戲劇停頓。農夫需停下斧頭,抬眼挑眉看向女俠,並說出台詞:「你就是那隻狐狸?」女俠則需冷臉側身,以擲地有聲的語氣回應台詞:「我不是」此處需特別注意BGM驟停,並同步加入武俠鏘鏘重音音效,最後以畫面閃白完成轉場,強化老派武俠片的戲劇節奏感。
梗的核心,有兩種版本可選:
版本A:滿漢全席版(仿相聲「報菜名」節奏,18 道菜品化身武俠角色快切登場)
鏡頭極速切換,每幀0.6秒,維持邵氏武俠定格亮相式風格。所有角色登場時需自帶紅藍補色亮相光效,並開口報出對應菜名台詞,說完後即邁步站到院中列隊,院子逐漸被角色站滿:
白絨古裝帶羊羔元素→「我是蒸羊羔」
棕黑勁裝帶掌紋元素→「我是蒸熊掌」
棕褐短打帶鹿尾配飾→「我是蒸鹿尾兒」
花羽古裝→「我是燒花鴨」
嫩黃勁裝→「我是燒雛雞」
白絨鑲邊古裝→「我是燒子鵝」
醬色短打(多人)→「我是滷豬」「我是滷鴨」「我是醬雞」「我是臘肉」
松花紋肚兜造型→「我是松花」「我是小肚兒」
風乾質感古裝→「我是晾肉」「我是香腸兒」
盤裝造型→「我是什錦蘇盤兒」
白肚鑲邊→「我是燻雞白肚兒」
圓胖造型→「我是清蒸八寶豬」
釀鴨元素→「我是江米釀鴨子」
罐籠造型→「我是罐兒野雞」「我是罐兒鵪鶉」
版本B:醬板鴨版(還原原始爆紅版本,單一反轉角色)
農夫停下斧頭,抬眼挑眉看向女俠,試探道:「你就是那隻狐狸?」女俠冷臉側身,極度認真地回道:「不是,我是那隻醬板鴨。」此處BGM驟停,配武俠鏘鏘重音,畫面閃白轉場。6–14秒鏡頭極速切換,每幀0.6秒,維持邵氏武俠定格亮相式運鏡。
這套提示詞針對支援「分段時間軸輸入」與「對話台詞生成」的 AI 影片工具,Kling、Vidu、極夢均可嘗試。實際操作有三個限制需要提前評估:
台詞口型同步:目前多數工具對中文台詞的口型控制仍不穩定,可能需要多次生成才能對上。
多角色快切:滿漢全席版要求 18 個不同角色在 8 秒內快切登場,對模型連貫性是高壓測試,建議分段生成後後製剪接。
邵氏風格細節:部分較新的工具反而可能生成過於精緻的畫面,失去那種廉價復古感;碰到這種情況,可在提示詞中加強「攝影棚假布景」和「非自然主義」的要求。
最後要說的是,提示詞寫得再好,最後讓影片爆紅的往往是那個意料之外的反轉。醬板鴨是梗,但核心是那句「不是」之後的發展。
AI 視頻提示與圖像提示並不相同。
圖像提示用於描述單影格畫面。 視頻提示則用於描述時間維度。 這意味著它需要在數秒內管控主體、運動、鏡頭、光線、連貫性、風格以及各類限制條件。 若提示詞不夠精準,生成結果或許依然視覺效果出眾,但可能無法實際投入使用。 角色可能出現偏移。 產品可能發生扭曲變形。 鏡頭運動幅度過大。 藝術風格可能發生改變。 場景可能沒有足夠空間新增字幕。 轉場也可能無法與前一鏡頭銜接。
GPT-5.6 能夠幫助創作者撰寫更優質的提示詞,因為它可以對生產流程架構進行推理。OpenAI 的 GPT-5.6 預覽版推出了由 Sol、Terra 和 Luna 組成的模型家族,其中 Sol 被定位為旗艦型號,Terra 為低成本高效能的優選方案,Luna 則是速度最快、成本效益最高的選項。在預覽階段,OpenAI 表示目前僅透過 API 和 Codex 向經過篩選的可信組織開放訪問權限,後續計劃擴大開放範圍。
對於創作者而言,這意味著GPT-5.6應被視為一個規劃層。它有助於梳理思路並撰寫出更完善的指令。像這類工具 Elser AI 隨後將這些指令轉化為生成式影片:動漫片段、產品廣告、角色場景、圖轉影片鏡頭、音樂錄影帶畫面、應用推廣內容以及短影片內容。
本指南為你提供了一套實用的提示框架,用於運用GPT-5.6風格的推理 AI影片生成.
一個優質的AI影片提示詞通常包含八個部分:
格式
主題
身分或產品保護
操作
相機
照明
風格
限制
公式如下:
“拍攝一段[format]格式的影片鏡頭。 拍攝主體為[subject]。 請保留[identity/product/style details]。 在該鏡頭中,[specific action]。 鏡頭設定:[movement and framing]。 燈光:[source and mood]。 風格:[visual style]。 請規避[failure modes]。”
這種結構之所以有效,是因為它將穩定元素與靈活元素分離開來。
固定元素是指不得更改的內容:角色形象、產品包裝、logo、服裝造型、藝術風格、場地布局。
靈活元素指的是可進行調整的各類元素:動作、鏡頭、情緒、背景動態、光影氛圍、字幕位置。
人工智慧影片相關問題通常出現在提示詞未向模型指明哪些元素應歸屬於哪個類別的情況下。
對於角色類影片,角色身分必須擺在首位。 不要以動作開場。 要以角色開場。
弱提示詞
動漫女孩在城市中奔跑。
強提示詞:
“使用參考圖中的同一動漫角色。保留她完全一致的臉型、琥珀色眼眸、黑色短髮、黃色防雨外套、紅色徽章、黑色短褲、白色運動鞋,勻稱小巧的身材比例,以及乾淨的賽璐璐上色動漫風格。在本鏡頭中,她奔跑在飄雨的霓虹小巷,同時手持一個發光包裹。鏡頭:側面追蹤鏡頭,中景構圖。打光:藍色霓虹反光與暖調街燈。無面部走形、無服裝變更、無髮型更動、無年齡變化、無風格走樣。”
此提示詞在請求執行動作前會保護身份資訊。
使用Elser AI時,請先上傳或建立角色參考。隨後使用GPT-5.6產生可重複使用同一身份模組的場景提示詞。這比僅透過文字產生所有場景要安全得多。
對於產品影片來說,準確性比視覺想像力更為重要。 產品不得改變形狀、標籤、標誌、包裝、材質、顏色或比例。
提示詞模板:
“根據參考圖片製作[format]的產品影片。請完整且準確地保留產品的外形、logo、標籤、顏色、包裝、材質、瓶蓋、螢幕、按鍵及比例。產品[action or visual treatment]。鏡頭:[movement]。燈光:[style]。背景:[environment]。如需新增[text/CTA],請預留空間。嚴禁對產品進行變形,不得扭曲標籤、更改logo,亦不得虛構產品特性。”
範例:
“根據參考圖片製作一條直式9:16比例的TikTok風格產品廣告。請保留產品的精確形狀、品牌標誌、標籤、包裝、瓶蓋、顏色、材質及比例。以快速吸睛的視覺鉤子開篇,隨後在乾淨的影棚檯面上清晰展示該產品。鏡頭:先快速推近,再緩慢停留以打造高級質感。燈光:使用明亮柔和的影棚燈光,搭配真實自然的陰影效果。頂部預留乾淨空白區域用於添加字幕文字。請勿對產品進行變形,請勿扭曲產品標籤,請勿新增任何包裝細節。”
GPT-5.6 可協助將單份產品簡介改寫為多種提示詞變體:電商主視覺廣告、奢侈品廣告、生活場景素材、TikTok引流鉤子、問題解決方案類廣告以及最終的CTA鏡頭。隨後Elser AI即可根據產品圖片生成對應的影片版本。
圖生影片提示詞應保留來源圖像。提示詞不應要求AI重新設計所有內容。
提示詞模板:
“使用[特定運動]為來源圖像製作動畫。保留原始主體、構圖、藝術風格、色彩、光照、背景以及重要細節。新增[環境運動或鏡頭運動]。請勿變更[受保護元素]。”
範例:
“為來源動漫圖像添加細膩可控的動態效果。角色緩緩轉頭看向鏡頭並眨眼。保留完全一致的面部造型、髮型、服裝、身體比例、背景構圖、色彩搭配以及賽璐璐動漫風格。添加輕微的髮絲飄動與柔和的燈光閃爍效果。鏡頭:緩慢推近。禁止面部變形、更換服裝、身體扭曲以及風格偏移。”
圖像轉影片在運動幅度適中時效果最佳。如果你要求過大的運動幅度,該模型可能需要憑空補全缺失的人體結構、拍攝角度或背景細節。
鏡頭運動應該具體且有合理的動機。避免僅使用「電影感」一詞。
實用相機用語包括:
緩慢推入
靜態特寫
中景側面跟拍鏡頭
低角度揭示
平緩地從左向右平移
過肩鏡頭
廣角定場鏡頭
微距產品特寫
細微的手持動作
環繞產品的緩慢軌道運行
平拍中景鏡頭
相機應符合影片的用途。
用於情緒烘托:緩慢推鏡。
用於營造張力:靜態構圖或大特寫鏡頭。
高端產品展示:微距特寫與緩慢旋轉。
動漫動作拍攝:側面跟拍鏡頭或動態推鏡頭。
用於教育:穩定的架構與清晰可讀的圖表。
適用於房地產場景:緩慢看房漫遊或輕柔平移鏡頭。
GPT-5.6 可以依據創作目標幫助選擇合適的鏡頭語言。隨後 Elser AI 可在生成過程中應用該方向。
照明應當有光源。「美觀的照明」太過籠統。「左側的溫暖窗邊自然光」才是實用的。
範例:
從左側照來的柔和窗光
暖調日落逆光
手機螢幕發出的藍色光暈
濕滑路面上的霓虹倒影
單盞檯燈營造出溫馨的陰影
高階專業攝影棚燈光,帶有柔和反光
陰天的日光,色彩柔和
黃金時段輕裝旅行
光線會影響畫面一致性。如果每個鏡頭的打光風格都不一樣,影片就會顯得脫節。對於多鏡頭影片,請在各個提示詞中保持打光描述的一致性。
流暢的鏡頭轉場需要做好連貫性規劃。若角色在某段鏡頭的結尾處做出轉動動作,下一段鏡頭應延續該動作,或是展示他們正在注視的事物。
提示列:
這個鏡頭承接了上一個場景。
保持相同的角色位置和光照方向。
攝影機繼續進行上一個鏡頭的緩慢推鏡動作。
角色看向物體,下一個鏡頭便展示了該物體。
“使用與前一個鏡頭相同的拍攝地點和色彩搭配方案。”
GPT-5.6 可協助將故事板轉換為具備過渡感知能力的提示詞。相較於孤立的鏡頭片段,它能夠生成連貫的鏡頭序列。
針對短視頻的提示
請為TikTok、YouTube Shorts以及Instagram Reels指定直式格式與字幕空間。
提示詞模板:
“製作一條9:16比例的豎版短影片。開頭第一秒須設定清晰的視覺吸睛點。【拍攝主體/動作】。鏡頭:【鏡頭運動方式】。請在【頂部/底部/左側/右側】預留乾淨區域用於添加字幕。畫面須能在手機螢幕上清晰顯示。請勿讓畫面過於擁擠。”
短格式提示詞應優先保證可讀性。視覺效果複雜的鏡頭在桌面端可能觀感不錯,但在行動裝置上卻會出問題。
一個強大的工作流程看起來是這樣的:
讓GPT-5.6將你粗略的想法轉化為一份條理清晰的創意簡報。
讓它根據這份簡報撰寫三個AI影片提示詞。
選擇最強的提示詞。
將提示詞與視覺參考匯入Elser AI
產生影片。
檢查失敗項目:面部、動態效果、產品精度、光線、節奏或風格。
根據此次失敗,讓GPT-5.6修改該提示詞。
在Elser AI中重新生成。
此工作流程可創造迭代效果。首次輸出不必盡善盡美。它只需讓你明晰需要改進的地方。
“製作一條豎屏9:16比例的AI短影片,用於YouTube Shorts。使用參考圖中的同一位動漫發明家。完整保留她的銀灰色短髮、綠色眼眸、圓形眼鏡、寬鬆橙色連帽衫、黑色短褲、工具包、小巧勻稱的身材比例,以及乾淨的賽璐璐動漫渲染風格。在該鏡頭中,她自豪地展示工作台上的一台小型冒煙機器人,隨後發現機器人開始晃動。鏡頭設定:中景鏡頭搭配緩慢推鏡。燈光設定:左側暖調檯燈,營造柔和陰影,搭配溫馨的工作室背景。整體氛圍:詼諧有趣又略帶混亂感。頂部預留乾淨區域用於新增字幕。請勿更改她的面部造型、穿搭、髮型、身形、年齡或整體風格。禁止手部變形、出現多餘手指,背景不得出現扭曲變形。”
這個提示詞可行,因為它明確規定了格式、主題、身份設定、動作、拍攝機位、燈光、氛圍、標題布局以及限制條件。
GPT-5.6 能夠優化 AI 影片提示的效果,因為它可以幫助創作者建構創意指令。它能夠將粗略的想法轉化為可投入正式製作的提示詞,保留關鍵細節,生成多種變體,還能診斷輸出結果失敗的原因。
但提示環節僅占整個工作流程的一半。你仍然需要一個影片生成平台。
將 GPT-5.6 用作規劃與提示詞編寫層。使用Elser AI做為生成與迭代層。在Elser AI上註冊,上傳你的參考圖片或產品照片,然後測試使用該結構建構的提示詞。提示詞品質越高,影片的可控性就越強。
相關連結
分鏡表
(一)畫分鏡的好處 :
可以統整同一時段演員、時間、地點,讓拍攝順序不僅僅只能照劇本順序拍而已,因此可以降低拍攝成本,對一個人拍片來說也是很好用的工具。
提前思考鏡頭該如何轉接,方便後製。
將文字劇本圖像化,讓攝影師知道該如何拍、取甚麼景,後製也可以透過分鏡表輕鬆了解該如何剪接。
可方便總務思考每一景需要甚麼道具,準備妥善!
總言來說,分鏡表可以貫穿整個製片過程,讓拍攝可以更加流暢的進行!
(二)分鏡表格式:
鏡號:第一個場景第一個鏡頭表示為「1-1」
分鏡畫面:以圖示方式呈現鏡頭大概長怎樣
聲音說明:包含對話內容、旁白、 環境音、背景音樂、特殊音效
-環境音:可與原音分開錄,後置再一起加上去
-後製音效:例如《比悲傷更悲傷的故事》男主快死的場景的快門聲與醫院心電圖儀器聲音
畫面說明:可以寫「我要一個全景」、「鏡頭往右移」、主角該怎麼走位等,方便攝影師了解畫面內容
備註: 可寫這個鏡頭大概需要幾秒用以推估整個片長、亦可備註需要的人物與器材等等
(三)分鏡表範例
運鏡
" PAN “
攝影機固定中間,鏡頭往左右水平移動,用於延伸出不在鏡頭內的東西
" Tilt "
攝影機固定中間 ,鏡頭往上下垂直擺動,用於延伸出不在鏡頭內的東西,用義跟PAN很像,通常拍一個東西很高或相對很矮的
" Dolly “
攝影機固定於腳架上不動,讓腳架在軌道或軌道車上左右移,使用滑滾型 ,與PAN概念很像但,PAN 是有一個角度弧形的
" Dolly in & Dolly out “
攝影機固定於腳架上不動,讓腳架在軌道或軌道車上往前或往後移動
" Zoom “
攝影機不動,透過鏡頭焦段轉變造成的視覺變化
|4.&5.差別|
Dolly in & out 往前、往後延伸幅度更大;ZOOM 跟Dolly in & Dolly out很像,只取決於相機鏡頭多長,鏡頭較小的範圍則較小
“Steady “
最常會看到的攝影技巧,常用在跟拍、定鏡、沒有很快換場時
|搭配設備|
1.防手震
2.肩架 (有手桿、鏡頭在前面)
3.穩定器(抓到三軸上的平衡使更穩定不模糊)
" Crane “
機器搖臂 EX. 演唱會
定鏡
鏡頭定住不動,通常會用腳架輔助,若無腳架,可以透過相機拿近身體,手臂夾緊,降低晃動
主觀視角 (POV)
以主角的的視角做拍攝,簡單來說就是拍攝主角看到甚麼,有身歷其境感,主角不會出現在畫面裡面
焦距轉換(Focus in 、Focus out)
通常為兩個人一前一後,轉換對焦對像
PS 連結為線上範例資源
鏡位
遠景 : 表現場地不凸顯人
全景 : 表現場地以及人,通常為全身入鏡
中景 : 人的小腿到頭入鏡
半身景 : 人的腰到頭入鏡
特寫 : 情緒的描寫
大特寫 : 特寫眉毛眼睛等部位,像是流淚等效果
拉背 : 對話時很好,可著重說話者的表情
啟動Google Chrome:右上角登入電子郵件。
Google Chrome瀏覽器帳號登入同步與刪除說明:這樣你登入ChatGPT、Gemini...登入上課用軟體就方便多了。
安全說明:使用別人的電腦別再登出Chrome瀏覽器?請注意自己帳號的安全,共用電腦或公共電腦使用之後請記得登出。
ChatGPT:就是OPEN AI的人工智慧對話軟體,詢問簡單的問題可以用免費版就好。註冊、登入。
Gemini:Google 的AI人工智慧對話軟體。註冊、登入。
Phoenix Code:專為網頁開發者、設計師與學生打造的文字編輯器。
NotebookLM AI:Google 的AI資料整理。註冊、登入。
Gamma :投影片生成軟體用這個聯結推薦+200點AI點
W3CSchool :網頁與程式入門練習
Github:放置程式與版本變遷的管理系統
我的Github網頁:範例程式指引(建置中)
要記住的指令
<!DOCTYPE html>
<html lang="zh-Hant">
<head>
<meta charset="UTF-8"> <!-- 設定編碼,避免亂碼 -->
<meta name="viewport" content="width=device-width, initial-scale=1.0"> <!-- 手機/電腦都能適配 -->
<title>我的第一個網頁</title> <!-- 瀏覽器標題列文字 -->
</head>
<body>
<h1>哈囉,世界!</h1> <!-- 頁面主標題 -->
<p>這是一個簡單的 HTML 範例。</p> <!-- 段落文字 -->
</body>
</html>
解說:----------------------------------------
一個最標準的 HTML 檔案基本格式,這是每個網頁最常用的結構:
<!DOCTYPE html>
<html lang="zh-Hant">
<head>
<meta charset="UTF-8"> <!-- 設定編碼,避免亂碼 -->
<meta name="viewport" content="width=device-width, initial-scale=1.0"> <!-- 手機/電腦都能適配 -->
<title>我的第一個網頁</title> <!-- 瀏覽器標題列文字 -->
</head>
<body>
<h1>哈囉,世界!</h1> <!-- 頁面主標題 -->
<p>這是一個簡單的 HTML 範例。</p> <!-- 段落文字 -->
</body>
</html>
<!DOCTYPE html>
宣告文件是 HTML5 格式,瀏覽器才知道怎麼正確解析。
<html lang="zh-Hant"> ... </html>
整個網頁的根元素,lang="zh-Hant" 表示繁體中文。
<head> ... </head>
放置網頁的 設定與資訊(像是編碼、標題、關鍵字、CSS、JS 連結)。
<body> ... </body>
放置實際 顯示在網頁上的內容(文字、圖片、按鈕…)。
一定要會的基本能力
製作一個文字版網頁,文字內容、字體大小、字體顏色均可以指定。