14 NOTES
文件夹内容
初次测试
如果你足够幸运来到了这一步,你可能发现测试结果不尽人意,这是非常正常的。下面列出几个最可能踩的坑,不过具体问题还需根据具体情况分析。 数学公式渲染失败 应该90%的人都会遇到这个问题,manim的公式渲染依赖LaTeX,需要先下载LaTeX渲染器。建议使用MiKTeX,他是轻量版的LaTeX 工具链发行版,此外,如果你希望在电脑中渲染LaTeX你还需要perl。 生成内容极其简陋甚至没有manim 这一般是前期的planner出现问题导致的,ai可能直接硬编码了planner的角色,这会导致后期调用工具时根本没调用manim。正常来说应该角色之间相互分离,分别调用api,有各自专属的promp...
后端逻辑优化
到这一步demo已经算基本完成,但是整个产品系统的构建才刚刚开始,先针对阶段二现状分析中提到的三个问题进行三轮规划与审核,然后利用ai修改即可。 我们接着利用前端设计中的脚本进行第二次实验,这次效果可能比之前好很多但是仍然达不到预期,一些可能的问题如下: P0:脚本质量差——只有核心公式,没有叙事 现有 Manim 产物只是机械地 Write 公式,没有视觉铺垫、没有节奏控制、没有认知分层。coordinator 输出的 script_outline 太薄,worker 拿到的 handoff 信息不足以生成有叙事感的动画。 P1:HTML 产物未接入成片 post_produce.py 的 ...
环境配置
建议同时使用两种不同的AI coding agents写代码,在之后的阶段中我也会展示两个智能体之间如何配合。 我比较常用的智能体有四个:codex,claude,trae,DeepSeek-TUI。 trae 国内版似乎每月有一定额度,但是对于高token消耗的开发来说是远远不够的,如果打算拿他来写代码,建议作为后备力量使用。 DeepSeek-TUI 这是我最近新接触的agent,他整个框架是利用claude编写的,还处于开发初期,有非常多的问题,但是他是这几个agent里面上手难度最低的,甚至都不需要翻墙,并且天然支持deepseek。 下载方式如下: npm install -g de...
角色重构与现状分析
请先阅读后端逻辑优化和前端设计 1.
链路的链接与闭环
请先完成链路的链接与闭环然后再继续阅读。 在阶段一完成之后我们谈到剩余几个问题: 前端仍然是 mock 数据 console-demo.ts 里写死了项目状态、阶段、任务、事件、Agent、产物等数据。 前端和 backend 还没有真正接线 目前 README 也明确说当前版本优先验证页面壳、布局切分、组件职责和 API 接线点。 Worker 执行器还没有真正成为主链路 后端能接收 worker.progress / blocker / result,但真实 Manim Worker / HTML Worker / Reviewer 还没有被统一执行器调起来。 Context Packet...
前端骨架的实现
前端设计图的生成以ManiMind 前端控制台骨架方案文档为基准,借助gpt-image-2生成,效果如下: 可以看到,这个效果主要偏向Next.js + shadcn/ui 的实践方案,最贴合的开源项目是next-shadcn-dashboard-starter 我们把他clone到仓库中,提示词如下: 我需要你开始搭建前端骨架,示意图是"F:\ManiMind\d51e9537af482750899e7485b285e9b0.png",开源参考仓库是"F:\ManiMind\next-shadcn-dashboard-starter-main",要求...
前端设计
在修改的同时还应该强调需要完成前端网页的构建,包括真实api的引入,页面布局的优化问题,这一方面就见仁见智了。 前端打开方式: npm install npm run dev 到这一阶段整个agent算是开发完成,后期需要大量测试和调试,这里建议使用deepseek的api作为业务api接入,他在廉价的同时还能保持极高的效果,一个视频甚至只需要5毛钱之内。 这是这一阶段的前端参考,如果你仔细观察过后端代码你会发现其中存在着大量开关,而前端的按钮少之又少,由此可以判定这个前端实际上完全是游离于主业务之外的。 你可以在这一阶段修改前端,也可以留到架构重构完成之后再修改,甚至,你可以直接扬弃web端...
现状分析
请先完成链路的链接与闭环,初次测试,tts然后再继续阅读。 在初次跑完之后是时候来复盘仓库和效果了: 1.
总目标
这一阶段主要是初始化代码仓库,形成项目的骨架,目标如下: 完成初始状态的设置,leader的职能分配 完成前端骨架的搭建 完成HTML worker 和manim worker的POC并准备接入主线 对比按工作流顺序开发来说,这三个阶段可以并行开发,能够大幅缩短开发所需的时间。 在完成这一部分之后会得到: 前端控制台骨架已经落地。你现在有了 frontend/manimind-console/,定位是 ManiMind 的可视化驾驶舱,用来展示阶段流、任务看板、Runtime、Context Packet、事件日志、Agent 状态、产物预览和 MVP 能力清单。文档里明确说它不是完整产品,而...
总目标
在之后每个阶段的博客中,如果我没有特别说明的话阶段内任意两篇文章都是可以并行运行的,有先后顺序的情况我会在开头进行说明。 当前 ManiMind 的默认角色一共 8 个: lead explorer planner coordinator html_worker manim_worker svg_worker reviewer 它们不是平级随便聊天的 Agent,而是被三种 AgentMode 约束:read_only、structured_write、verify_only。也就是有的角色只能读和分析,有的角色能写结构化产物,有的角色只能审核。仓库文档明确列出了这 8 个默认角色,并说明每个...
Harness Engineering
产品化不是继续堆 prompt,而是做 harness。目前来说demo已经算是成功,也能跑出完整的视频,因此接下来重心应该转向业务逻辑优化和智能体约束上。 主要围绕这些东西: 1. 可重跑 2. 可观测 3. 可定位 4. 可约束 5. 可恢复 6. 可审核 7.
leader的状态搭建
在我们初代的计划中分为了7大阶段: 其中阶段2和3都是P0级别的,且都和leader的核心能力有关,因此我们把这两阶段合并处理。 我这里使用先计划后编写的策略,利用codex进行计划文档的编写,之后利用claude进行审核,codex的提示词如下: 编写阶段 1的计划文档,至少完成状态机的设计,上下文的动态静态两种存储方式,子agent与leader的通讯链路 codex的输出跨越了几个文档,总体来说是较为详细的,我直接使用claude进行评审: claude对codex编写的计划总体评价比较高 定位清晰(“定型底座,不急着接生成器”),三件核心交付物(状态机、上下文存储、通讯链路)互相支撑且...
tts
请先完成链路的链接与闭环然后再继续阅读。 在第一阶段形成的闭环中主要是针对视频生成,在生成完视频之后还需要配音字幕等角色,我们使用tts进行配音,即文字转语言模型。这里有两种思路,如果对音色要求不高可以找ai腔的音频,这种音频满大街都是,我们主要讲解另外一种思路。 这里需要用到F5-TTS和ffmpeg,自行下载即可。 F5-TTS是一种快速克隆声音、生成几段配音的配音方案,如果需要更精确克隆声音可以使用开源软件GPT-SoVITS,不过他需要GPU进行训练。 我们以F5-TTS为例,需要准备一段角色原声音频和对应的参考文本,然后完成第一次配音测试,可以看到,他直接只是用F5-TTS和ffmp...
worker的POC实现
manim的实现 manim是整个流程中最核心的部分,所有数学公式的可视化都要在这一部分完成,因此我脱离主线先进行可行性验证之后再并入主线开发。 提示词如下: 我需要编写Manim Woker,具体如下: > **Manim Worker:能否把明确的动画任务转成可运行的 Manim 代码,并通过渲染反馈修复错误。** 不要验证多 Agent,不要验证数学讲解能力,不要验证 Planner,不要验证 Explorer。所有上游内容都手写固定,只看 Manim Worker 本身是否成立。 --- ## 1.
