AIGC 摄影不是“输入提示词,等一张图”。 真正可用的 AIGC 摄影,要求风格稳定、光影可控、构图可复现。通用模型能生成好看的照片,但很难每次都生成“你想要的同一种摄影语言”。
解决这个问题的关键,是训练一个摄影风格 LoRA。 它不改变基础模型,只教会模型:什么是你的色调、你的光影、你的镜头感。
下面用少量代码,跑通一条最小链路:数据打标 → LoRA 训练 → 推理生成。
AIGC 摄影训练通常包含五步:
关键不是照片多,而是照片“风格一致、标注准确”。
假设图片放在 train/ 目录,每张图生成同名 .txt 标注:
import os
for f in os.listdir("train"):
if f.endswith(".jpg"):
open(f"train/{f[:-4]}.txt", "w").write(
"mystyle, cinematic portrait, soft rim light, 85mm, f1.4, film grain"
)mystyle 是你的触发词,后面是风格和镜头描述。
从 diffusers 仓库获取 train_dreambooth_lora_sdxl.py,然后运行:
accelerate launch train_dreambooth_lora_sdxl.py \
--pretrained_model_name_or_path="stabilityai/stable-diffusion-xl-base-1.0" \
--instance_data_dir="train" \
--output_dir="my_photo_lora" \
--instance_prompt="mystyle, cinematic photography" \
--resolution=1024 \
--train_batch_size=1 \
--gradient_accumulation_steps=4 \
--learning_rate=1e-4 \
--max_train_steps=800 \
--mixed_precision=fp16 \
--checkpointing_steps=200这一步会把摄影风格压缩进一个轻量 LoRA 文件。
安装依赖:
pip install diffusers transformers accelerate peft torch加载基础模型和 LoRA:
import torch
from diffusers import StableDiffusionXLPipeline
pipe = StableDiffusionXLPipeline.from_pretrained(
"stabilityai/stable-diffusion-xl-base-1.0",
torch_dtype=torch.float16
).to("cuda")
pipe.load_lora_weights("./my_photo_lora", weight_name="pytorch_lora_weights.safetensors")
pipe.fuse_lora(lora_scale=0.8)
prompt = "mystyle, a young woman in a rainy Tokyo street, cinematic lighting, 85mm, f1.4, film grain"
image = pipe(prompt, num_inference_steps=30, guidance_scale=7.5).images[0]
image.save("aigc_photo.png")运行后,你会得到一张带有你训练风格的照片。
lora_scale 控制风格强度,0.6–0.9 通常比较自然。
上面能跑通,但不能直接商用。企业级 AIGC 摄影训练还要补:
模型能生成画面,但企业要的是可控、可审计、可复用的生产流程。
AIGC 摄影训练的起点,不是买最贵的卡,而是准备好一批风格一致、授权清晰的照片,然后跑通一条最小链路:
打标 → 训练 LoRA → 推理 → 评估。
上面这些代码很短,但足以让你理解 AIGC 摄影训练的核心。 先跑通它,再逐步叠加数据治理、评估体系、工作流和安全合规。 工具会越来越强,但决定摄影价值的,仍然是你的审美、判断和对真实世界的理解。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。