78 lines
5.3 KiB
Plaintext
78 lines
5.3 KiB
Plaintext
# COST-EST-40EP-LOCAL.hdlp · 40集本地方案成本估算
|
||
|
||
> HLDP://cang-ying/eererdan/COST-EST-40EP-LOCAL
|
||
> 耳耳蛋 ICE-GL-耳耳蛋 · PTS-VA-001-EED
|
||
> D198 · 2026-07-27 · 苍耳问"本地方案做一部40集剧成本多少"
|
||
> D198 修订 · 苍耳追问"配音字幕能否用免费开源" → 全链开源打法更新
|
||
|
||
## 估算前提(锁定)
|
||
|
||
| 项 | 取值 | 说明 |
|
||
|----|------|------|
|
||
| 剧集数 | 40 集 | 苍耳指定 |
|
||
| 单集时长 | 1.5–2 min | 取中值 1.75 min |
|
||
| 单集镜头 | ≈20 镜 | hero特写约占 3–5 镜 |
|
||
| 硬件基座 | 7800X3D + 7900 XTX 24G(苍耳已有) | 零购置 |
|
||
| 生成模型 | Wan2.2-14B(Apache 2.0,商用干净) | 本地免费 |
|
||
| 配音模型 | **CosyVoice 2(Apache 2.0,本地)** | 开源免费,商用干净 |
|
||
| 字幕链路 | **Qwen本地翻译 + Whisper识别 + ffmpeg压制** | 全开源免费 |
|
||
|
||
## 成本要素单价(真实数据 + 开源替代)
|
||
|
||
| 要素 | 云端单价 | **开源本地单价** | 来源/说明 |
|
||
|------|------|------|------|
|
||
| 视频生成 | ¥4–5/镜(Seedance) | **¥0**(Wan2.2 本地,仅电费) | COST-LOG + Wan2.2 Apache2.0 |
|
||
| 电费 | — | **¥0.27/h**(7900 XTX 满载) | 实测推算 |
|
||
| 配音(TTS) | ¥5–15/集(豆包) / ¥100–300(ElevenLabs) | **¥0**(CosyVoice 2 本地推理) | Apache2.0 商用干净 |
|
||
| 字幕 | ¥0–5/集 | **¥0**(Qwen+Whisper+ffmpeg) | 全开源 |
|
||
| 超分 | 商业API 计费 | **¥0**(Real-ESRGAN 本地) | 开源 |
|
||
| 内存 32G(不加) | — | **¥0**(1.3B量产区无忧;14B需清程序单任务) | 官方下限档,可跑 |
|
||
| 内存升 64G | — | **一次性 ¥600–800** | 无忧档,建议 |
|
||
|
||
> 开源 TTS 选型:CosyVoice 2(阿里,Apache 2.0,多语种/克隆/情感,中文最强)首选;GPT-SoVITS(MIT,社区商用灰区);Fish Speech(需单独授权,非商用)。
|
||
> 狼人剧是海外变现,授权必须干净 → **优先 CosyVoice 2**。TTS 推理极轻,4060 笔记本可并行跑,不占 7900 XTX 主卡时隙。
|
||
|
||
## 三档方案 · 40 集总成本(全链开源版)
|
||
|
||
| 方案 | 视频生成 | 配音 | 字幕 | 硬件一次性 | **合计** |
|
||
|------|:--:|:--:|:--:|:--:|:--:|
|
||
| **A · 全本地开源** | ¥22(电费) | **¥0** | **¥0** | ¥0–700(可选) | **≈¥22–722** |
|
||
| **B · 混合**(hero 5镜云端) | ¥946 | **¥0** | **¥0** | ¥0–700(可选) | **≈¥946–1646** |
|
||
| **C · 纯云端视频**(配音仍开源) | ¥3400+ | **¥0** | **¥0** | ¥0 | **≈¥3400** |
|
||
|
||
> 全本地 A 档:视频电费=2h/集×¥0.27×40≈¥22;配音/字幕开源¥0;内存¥700。
|
||
> 对比纯云端 C 档(仅视频走Seedance):20镜×¥4.5×40=¥3600,配音字幕已开源故不再叠加。
|
||
|
||
## 核心结论
|
||
|
||
1. **全链开源 40集 ≈ ¥22(不加内存)~ ¥722(升64G)**,比纯云端视频+开源配音 ≈¥3400 **省 79–99%**;不加内存则仅电费成本。
|
||
2. **生成+配音+字幕全免费**:唯一硬件成本=内存¥700 一次性;运营近乎零成本(除人力时间)。
|
||
3. **配音/字幕是比视频更易本地化的环节**:推理极轻,4060 笔记本可并行,不挤占 7900 XTX 视频生成主卡。
|
||
4. **降本主因未变**:本地重生成免费,消灭 COST-LOG 那 85% 试错浪费。
|
||
|
||
## 内存不加(32G)的折中跑法
|
||
|
||
32G 是 Wan2.2-14B + 24G 卡的**官方下限档**,**能跑但余量小**(14B 权重 offload 到 RAM,峰值吃 20GB+,加 Windows 5GB 易顶满)。不加内存的实操方案:
|
||
|
||
- **量产区(中景/对话/空镜)**:用 Wan2.2 **1.3B 小模型**(480p),权重仅~2.6GB,32G 完全无压力,免费跑。
|
||
- **hero 特写(眼/印记/血)14B 720p**:生成时**关闭浏览器/剪映等占用程序 + 单任务跑**,靠 WanVideoWrapper 动态 offload 在 VRAM/RAM 间换页;偶发 OOM 重试即可。
|
||
- **或 hero 特写直接扔云端 Seedance**(混合 B 档),32G 全程只跑 1.3B,彻底不碰 14B 本地,零 OOM 风险。
|
||
|
||
→ 不加内存,成本压到 **¥22(纯本地 1.3B+清程序跑 14B)~ ¥946(混合)**,比加内存省 ¥700。代价=需手动管理内存占用 + 接受偶发 OOM。
|
||
|
||
## 诚实约束(估算边界)
|
||
|
||
- **开源 TTS 质量略逊 ElevenLabs/豆包大模型声线**:短剧是"听感驱动"产品,情感戏/hero 台词完播率敏感。若开源声线不达预期,可只对关键集/关键角色用商用声线兜底(局部成本可控)。
|
||
- **商用授权必须干净**:CosyVoice 2 (Apache 2.0) 干净首选;GPT-SoVITS/Fish Speech 商用需确认授权,海外变现剧勿踩灰区。
|
||
- **不含人力时间成本**:写本/分镜/剪辑/一致性调试是最大隐性成本,单人 1–2 集/日≈1–2 个月工期。
|
||
- **首集资产建设**:角色锚点/场景风格探索本地免费,但 Wan2.2 + CosyVoice 音色调试需时间投入。
|
||
- **电费按满负荷估**:实际挂机非 100% 满载,更低。
|
||
|
||
## 行动建议
|
||
|
||
- 走 **A 全本地开源** 最省:视频 Wan2.2 + 配音 CosyVoice 2 + 字幕 Qwen/Whisper/ffmpeg,全免费,仅内存¥700 一次性。
|
||
- 急活卡 deadline 时临时切 B 混合(hero 5镜扔云端 Seedance)。
|
||
- 部署按 LOCAL-VIDEO-DISPATCH-PLAN.hdlp,拿 EP02 一镜实测对标本估算,校准数字。
|
||
|
||
⊢ 本估算基于 COST-LOG 真实单价 + 7900 XTX 电费实测 + 开源模型 Apache2.0 授权核实,待 EP02 实测后回填真值。
|