探索笔记
杂谈2026年9月14日

现状分析

本页目录
  1. 1. 配音过快,且时序位置放错了
  2. 2. 媒介分发不应让所有片段都跑 html/svg/manim
  3. 3. 当前成片只有公式可视化,缺少引子和公式之间的衔接

请先完成链路的链接与闭环初次测试tts然后再继续阅读。 在初次跑完之后是时候来复盘仓库和效果了:

1. 配音过快,且时序位置放错了

现象:

  • 当前配音速度过快,几乎无法听清。

  • 当前主流程是先生成视觉片段,再在 finalize 阶段统一做 TTS。

  • 这导致画面时长不是由真实旁白时长驱动,而是由预估秒数或渲染产物反推。

判定:

  • 当前流程更像“先做画面,再塞音频”,不适合讲解型数学视频。

  • 对于科普讲解视频,音频应先成为时长基准,再驱动画面节拍与每段镜头长度。

2. 媒介分发不应让所有片段都跑 html/svg/manim

现象:

  • 首次运行中观察到所有片段都在尝试跑 svg/html/manim

  • 这和期望不一致。你真正需要的是“按分镜语义路由”,而不是“所有媒介默认并发候选”。

判定:

  • 公式推导、公式可视化、数学结构变化,优先应走 manim_worker

  • 开头引入、段间衔接、弱科普说明、轻量信息卡和氛围铺垫,优先应走 html_worker

  • svg_worker 应是补充型能力,而不是所有片段默认跑一遍的主路径。

下一轮要求:

  1. planner 必须对每个 segment 显式判断内容类型,而不是只给泛化的 hybrid

  2. coordinator 必须把分镜分成至少三类:

   - intro / bridge / weak_explainer HTML

   - formula_core / derivation / proof_visualization Manim

   - diagram_overlay / optional_relation_graph SVG(仅在明确需要时)

  1. workflow.build_worker_tasks(...) 的默认派发策略需要进一步收敛,避免因为 hybrid 或公式字段存在而把所有媒介都挂上去。

  2. reviewer 需要新增一条检查:媒介是否与 segment 目标匹配,而不是只看产物是否存在。

3. 当前成片只有公式可视化,缺少引子和公式之间的衔接

现象:

  • 当前视频更像“公式展示集锦”。

  • 缺少开头的引子。

  • 缺少公式与公式之间的过渡、解释桥段和弱科普连接段。

判定:

  • 这不是后处理问题,而是 storyboard coverage 不完整。

  • 现在的分镜生成还没有把“引入 - 解释 - 推导 - 过渡 - 收束”作为强制叙事骨架。

反向链接