Sora 这类文生视频模型适合从提示词快速生成镜头;如果已有产品图或角色图,图生视频通常更容易保持主体一致。我整理测试时会在多模型工作区 https://imagetovideo-ai.org/ 里用同一张图比较不同模型的运动幅度和镜头稳定性,再根据成片用途选择结果。
文字生成视频的画面质量确实提升很快,但完整成片还需要旁白、音效和背景音乐与镜头节奏配合。最近我在测试 Seed Audio(https://seedaudioai.app/),比较适合把脚本快速转成多语言语音或补充声音素材。把视频模型与这类音频工作流组合起来,应该比只生成无声片段更接近真正可发布的内容。