9 月 15 日,一个叫 Hypit 的开源项目单日涨了两千多颗星,冲上 GitHub Trending 榜第二。三天时间,星标从 749 涨到 8,838,发布不到 24 小时就先破了三千。它干的事一句话能说完:把一条爆款视频丢给 AI Agent,Agent 自己拆结构、写工作流、换内容、出成片,一条命令能排产 100 个变体。
热度和争议这几天都不少,我把五拨实测者的记录、官方自述和仓库里的坑全部对了一遍,这篇把这些信息合成一份:它是什么、为什么成立、实际效果如何、钱花在哪、坑在哪。
先算一笔旧账:人工复刻一条爆款有多贵一条二十秒的爆款短片,按人工的路子走一遍:拆结构写本子占半天,找料生成画面又一天,配声上字埋特效一天,剪接调节奏半天,来回返工再搭进去两天。一个人包圆,三到五天交一条;MCN 的职业剪辑师,一天也就三到五条。最要命的是,爆款结构躺在剪辑师的脑子里,没法复用,没法自动化。
外部市场的报价更能说明问题:一条产品种草视频,外包制作五千起步,腰部达人一到两万,头部五到十万。而已经有实测者拿 Hypit 复刻了一条正在投放中跑火的广告片,只换出镜人物,前后十几分钟出了两条,花费几美元。几千块对几美元,这道题不用多算,星标就是这么涨起来的。
它是什么:让 Agent 学会做视频的完整语言先把定位说准。Seedance、Sora 这类模型负责产出素材,可产出了素材,离一支完整的片子还隔着一整条流水线:写本、配声、上字幕、剪接、埋特效,直到统筹和渲染。剪映、CapCut 这些工具卷的是模板:固定提示词留一两个换脸的口子,创意被模板作者的预设框得死死的,底模一换代,模板说废就废。
Hypit 走的是又一条路:一套写给 AI Agent 的视频生产语言。装进 Claude Code、Codex 这类能读技能的 Agent 之后,Agent 就有了看片、拆片、重拍的完整能力。
底层是一种叫 .svml 的文件格式,做过前端的可以把它理解成视频领域的 HTML。一份文件分五层:台词层管对白和角色,支持多说话人多语言;画面层管素材;字幕层管词级对齐和说话人区分;语音层接不同的配音模型;最上面的合成层定画布、布局和渲染配置。
真正妙的是它的标记语法。你可以在台词里嵌标签:某个词上挂一个表情闪现的标记,那个词一出现动画自动触发;再挂一个产品特写的标记,画面就在那儿切。它还把整套结构分成两类:动不得的骨架,和随时可换的零件。人物、口播、产品图都归在零件里,时间锚点精确到帧。词一改、语速一变,画面自己重排。100 个变体只要一条命令,账就出在这里:编排和素材全部复用,重新生成的只有变化的那部分。因为视频源码是文本,它能进版本库、能比对差异、能直接拿别人的工作流改两个槽位出片。
还有一个纠偏要说在前面:宣传里的"像素级复刻"要打个折扣。官方文档自己写明,工作流是一张可复现的请求图,不承诺新的模型运行会还原已发布的像素。复刻的是结构、节奏、字幕卡点和转场语法,画面按这套结构重新生成。对使用者这是好事:拿到的是"这条片为什么成立"的答案,不是一份逐帧拷贝。
实际效果:三拨人的实测记录有位实测者用 Codex 复刻了两条 Instagram 爆款,成品和原片做到九分相似,他总结的路径是四步:找到爆款视频,把链接发给 Agent 复刻,先用零花费的占位素材跑通全片,有误差就让 Agent 继续调字幕,确认结构没问题后再调用真实 API 生成全部素材和成片。这个"占位先行、真实后置"的顺序,能省下大把试错的钱。
另一位拿一条产品推广广告片实测:丢进 Claude Code,一行命令,十来分钟出片,脚本配音字幕 B-roll 特效全部到位。然后他补了一句换个人物,除了人物那部分料是新生成的,其余一概照旧复用,几分钟又是一条。同一个结构,不同的壳,花的只有生图生视频的钱。
最有意思的是一位做了 Clone、Edit、Reuse 全流程实验的:先复刻一条唐代主题纸片拼贴视频的视觉表达,纸张纹理、题签、前后景移动;然后提新需求,沿用这套拼贴工作流,改做六十秒的中国瓷器史,中文旁白。同一套视觉语言承载了新内容,脚本和镜头围绕新主题重组。做完还追加要求,给 B-roll 加流程动效,Agent 在现有工程里加入依次点亮的步骤卡、连接步骤的箭头和顺序框选,全部复用已有素材再合成。一轮 Clone 走完,留下的本子骨架、字幕样式和动效零件,全是下一次开机时现成的家底。
模型怎么配:一位实测者的十二环节清单因为完全开源,每个环节的 API 都可以自己接。一位实测者把十二个环节用的模型全部公开,照抄就能跑:
负责什么派哪个模型上场听口播、对字幕WhisperX接需求、定工程编排Codex把参考片读透Gemini 3.1 Pro合成与导出HyperFrames 加 FFmpeg出人物与主视觉GPT Image 2字幕与排版绘制本地代码组件,零成本画界面和卡片Nano Banana Pro定一条统一声线MiMo V2.5 VoiceDesign补零碎配图Nano Banana 2网页图与界面兜底Seedream 图生图人物开口讲话的镜头Seedance 2 Mini产品与操作演示短片还是 Seedance 2 Mini,够用
配模型的原则写在最后两行里:能不调生成模型的环节就用本地组件,字幕和排版交给代码,省钱且永远不崩。
上手教程环境两样:Node.js 22.15 以上,加一个支持技能的 Agent。安装一行命令:npx skills add hypit-ai/hypit,首次使用时 Agent 会自动检查并备好可执行文件。
用法两种。给参考视频:路径或链接直接发,让 Agent 复刻,说清楚保留什么、换掉什么。从零描述:不给视频,直接说要什么结构、什么主题。更稳的写法是把边界说全:保留钩子结构、镜头节奏、字幕分组、转场语法,不复刻原片台词和品牌素材。
两条工程纪律:跑之前先执行 plan 看报价和请求数,确认再 build;从仓库的官方示例起步,别从零写。
成本的真实账技能开源免费,不收人头费,不按渲染次数抽成,也不往成片上压水印,登录和预览也免费。生成环节按量付费,官方实例一条三段式混剪总成本 1.09 美元。可以用平台托管模型,也可以自带密钥走自己选的服务方。
有个细节值得单独记:它的自述文件曾挂过一段竞品比价,说别人每月几十上百美元而自己零元,三天后官方主动删了这段话,换成中性的成本说明。爆火之中的项目主动把最抓眼球的话改诚实,这个动作比星标更有信息量。另外它自营托管服务,推荐链接带返佣追踪,它推荐的网关不一定是你最便宜的选项,比价自己做。
写在最后围绕这个项目吵得最凶的问题是"这算不算抄"。拆完五份实测记录,我的答案是:它把爆款的执行成本打到了地板上,但爆款的判断,钩子为什么成立、结构为什么留人,依然要人带着眼睛去选。工具把执行变成流水线之后,值的反而是选出值得流水线化的那条片子的眼光。
仓库地址:github.com/hypit-ai/hypit。你会先丢哪条片
盛唐青花崛起YUAN-BLUE&WHITEtAnggolDenaGeIntheseventhcenturyTangChinabuiltChang'anthelargestrichestcityonEarth.Tihewholeworldcametoitsgates.元代,景德镇的青花瓷