跳转至

Blog

猫猫们唱歌工具链 v3更新

今天又更新了一下工具链,增加推理模型,增加网易X studio工作流程

智能体与 LLM 模型

  • CherryStudio — 主控台,所有智能体调度
  • Qwen-3.8-Flash - 主力模型
  • DeepSeek v4 Flash — 主力模型(备用)
  • Kimi K2.7 Code
  • GPT-5.6-Terra

音乐相关

  • 网易X Studio — 改词
  • SoulX Singer — 改音色并润色
  • ACE Step — 歌曲二次合成
  • Open Soren WebUI - 歌曲最后一步合成
  • Qwen ASR - 获得歌词准确时间,便于分镜

图片生成

  • SenseNova u1.5 Lite — 画面首帧生成,封面抽卡
  • GPT Image 2 — 封面最终生成

视频生成

  • MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
  • Topaz Video — 2x放大(1280p,缩小到85%出1080p视频)

模型供应商

  • DeepSeek 官方
  • OpenCode Go 订阅
  • GrsAI 第三方

猫猫们唱歌工具链 v2更新

这两天更新了一下整体工具链上使用的工具。出图过程中使用了商汤刚刚发布的 1.5 模型,免费,可以大量反复测试出图。音频文件增加母带处理。MiniMax H3视频生成改为二次采样。(540p ➡️ 640p,并提升速度30%-50%)。超分改用Topaz Video。

智能体与 LLM 模型

  • CherryStudio — 主控台,所有智能体调度
  • DeepSeek — 主力模型
  • Kimi K2.7 Code
  • GPT-5.6-Terra

音乐相关

  • SoulX Singer — 歌词合成
  • ACE Step — 歌曲二次合成
  • Open Soren WebUI - 歌曲最后一步合成
  • Qwen ASR - 获得歌词准确时间,便于分镜

图片生成

  • SenseNova u1.5 Lite — 画面首帧生成,封面抽卡
  • GPT Image 2 — 封面最终生成

视频生成

  • MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
  • Topaz Video — 2x放大(1280p,缩小到85%出1080p视频)

模型供应商

  • DeepSeek 官方
  • OpenCode Go 订阅
  • GrsAI 第三方

喵喵要唱歌了

有一个多月没更新博客了,原因是在准备开新视频号,最近一直在跑通流程。

事情大概是七月中旬,某天午觉醒来刷手机,看到两个广播主持人做改歌词的短视频,把《好汉歌》改成吐槽加班,挺有意思的。我突然就想到了「刚买的飞机」这个梗,意识到这种号其实挺好做,而且如果接广告,直接用 Suno 生成歌曲就行。念头一起,就决定换个赛道了。

法律赛道的搞笑动画还是不好做。前前后后做了 140 多个视频,有近 10 个在不同平台被下架过。加上法律类 AI 工具(Skill、MCP 之类的)越来越成熟,入门法律咨询看起来越来越像骗子了。靠法律渠道赚钱确实得心黑。而且从接触到的低学历人群来看,普法教育的意义也没那么大——很多人不愿意学,也教不会。算了,心累。

所以还是做娱乐向内容。

确定了改编歌词的赛道,就要解决一套流程和技术问题:

  • 音频:SoulX Singer SvS + ACE Step 方案。Suno 效果虽好,但抽卡严重、可编辑性低,只用于商单曲目以避免侵权。
  • 文生图:还是经典的 NanoBanana。
  • 图生视频:本来准备用 SeeDance 2.0,但刚好 Minimax H3 发布了,还开源了,效果齐平 SD 2.0,而且免费,极大降低了生成成本。

主角就用我家两只小猫咪。猫猫唱歌——一个基本没有对手的赛道。但改歌词唱歌本身又是个满是对手的赛道,很神奇。

段子和素材也靠智能体自动检索加人工筛选搞定。整个流程中,人工介入的关键点只有三个:歌词改编、分镜设计、首帧设定。其他基本全自动。

目标:9 月 2 日,喵喵开始唱歌啦!

猫猫们唱歌工具链

记录一下猫猫们唱歌这条线用到的工具链,从模型到生成一条龙。

智能体与 LLM 模型

  • CherryStudio — 主控台,所有智能体调度
  • DeepSeek — 主力模型
  • Kimi K2.7 Code
  • GPT-5.6-Terra

音乐相关

  • SoulX Singer — 歌词合成
  • ACE Step — 歌曲二次合成
  • QwenASR — SRT生成

图片生成

  • NanoBanana2 — 画面生成
  • GPT Image 2 — 封面生成

视频生成

  • MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存)
  • Waifu2x — 2x放大

模型供应商

  • DeepSeek 官方
  • OpenCode Go 订阅
  • GrsAI 第三方

华为昇腾950:中国AI战争的基础设施

之前家里的光纤断了,因为我们的光纤不是牵电信的,所以要单独买一捆自己牵。武汉的天又热,我牵完之后还瘫了两三天,太累了,所以搞得像消失了半个月。不过现在我终于回来了。

这两天,华为的昇腾950的集群亮相人工智能大会。哇,太厉害了!完全是换了一个套路,乱拳打死老师傅。就是因为华为的这个机会,我认为中国几乎已经赢下了这轮AI战争。

参数与通讯技术

好,我跟你讲字面上的参数吧。华为这套机柜今年发布的是最大 8192 卡统一内存,同期比英伟达 72 卡的机柜算力高 16 倍,能用的统一内存就更多了。也就是说,华为并没有更先进的制程,但是华为有更先进的通讯技术。这个统一内存、统一架构,虽然单卡算力不强,但足以支撑推理、训练等各环节的模式。因为如果你平常在本地跑过一些大模型,就会知道大模型对 GPU 算力的占用其实没多高,除非是并发推理占满的时候。在并发时,它对显存的要求很高,特别是当上下文达到 1M 时,KV Cache 涨得非常非常快,反而对显存和带宽有要求。这个时候,考验的其实是多卡通讯技术,对吧?华为在这方面就有巨大优势。

智能涌现与统一内存路线

从另一方面来讲,在 GPT 刚刚开始惊艳我们的时候,其实就是算力突破了某个量级,产生了一种叫"智能涌现"的情况。你可以认为,当参数累积到一个量级,量变引起了质变,看上去突破了智力的边界,能够通过图灵测试。目前我们的整个大模型能力虽然在增强,但总体上来讲,还是在上次涌现的平台上。可能到下一次更大的突破,还需要累积到另一个量级才能涌现出来。当然也不一定有,这没谁说得准。但是华为目前堵这条路,就是堵我的统一内存大。我能用通信技术覆盖掉你的单卡算力优势,就像苹果用统一内存代替显存,导致 Mac Mini 可以做统一推理是一样的。

生态验证:DeepSeek 与智谱

中国因为有了华为这整套硬件的基础,而且华为这套系统其实已经给智谱和深度求索用过,GLM 和 DeepSeek 都已经验证在这套系统上是可行的。所以 4 月份的时候,DeepSeek 当时就说,等到华为 950 节点大规模上线的时候,他们将大幅降低价格。这肯定是因为当时已经测试过了,所以 DeepSeek 才把价格一直写得这么低。可能在 4 月份到 6 月份期间,他们算力不足,是在贴钱做,甚至 6 月份明显的"降智"可能就是算力的原因。但是到 7 月中下旬、8 月份的时候,等到算力大规模上线,我估计 DeepSeek V4 的正式版能够还原到当时 4 月底的能力。这都是华为这套硬件的功劳,也就是奠定了中国人工智能如果能胜利的最底层基础。

经济学与持久战

从经济学上来说,哪怕中国的大模型只能做到顶尖大模型 80% 的能力,它就能把 80% 甚至 90% 的钱赚走。因为我们更多的业务场景不需要那么高的智能,留给国外顶尖模型的生存空间就只剩 10%~20%。它花了那么贵的价格去做整个系统搭建和模型训练,价格永远是高高在上的。在经济学上它注定吃亏,亏着亏着钱总有烧干的一天。

我相信中国人是不怕打持久战的。华为在做这套机器、构建整套系统的时候,很多地方的成本就已经打下来了,国家是一定介入过的。它不像英伟达这种纯商业的公司,要计算商业上的得失。所以在搭建硬件系统的时候,成本可能就只有美方的 1/10 甚至 1%。从中美军费的相对开销来讲,你就能看得出来,美国一个马桶可能都几千美元,这在中国来讲是不可想象的,一个马桶可能几十块上百块就能采购回来。所以硬件上,华为只要能做出来足以对抗英伟达的产品——甚至目前从华为这套技术路径、技术路线演进来说,它比英伟达的效果还要好——硬件上就已经奠定基础了。

软件层面:Kimi k3

最近软件上,前几天发的 Kimi k3,它基本上已经到达目前公开可用大模型的"SOTA",它跟 Fable 5 只差一点点,跟 GPT-5.6 sol版本相差无几,而且这还只是 Kimi k3 的第一个版本。我们知道 Kimi 的预训练数据和能力都很好,它的后训练相对差一点,但是可能发展到 Kimi 3.2 甚至 3.5 的时候,这个模型就能超过目前的 Fable 5。而且目前的这个模型能力已经极佳,这还仅仅是中国的大模型公司之一。在同期我们看之前在同样做 1T 大模型的时候,GEMINI 明显是比 Kimi 做得好的,DeepSeek 也不差,当然 DeepSeek 更偏文科一点。

所以我判断,中国基本已经打赢 AI 战争。

AI是程序员的抖音

突然想到了一个比喻:现在的 AI 其实就是程序员的抖音,它会让程序员慢慢地丧失自己的判断力。

随着大模型的不断进化,我们对 AI 提出的需求可以越来越抽象,AI 就能吐出相应的代码。虽然详细的需求文档和设计框架,可以让 AI 写代码变得更准确。但是随着大模型能力的提升,越来越大比例的程序员对 AI 提出代码越来越抽象,甚至在 AI 调试的时候还会去骂它。

你想想,以前这种人是谁?他甚至不是策划,也不是程序员的领导,也不是项目经理,是他妈的老板。只有老板才会在公司里骂人。我们以前总是吐槽老板,这也不懂,那也不懂,瞎 JB 指挥。回旋镖总会扎回到程序员身上。

而且由于这种 AI 写代码写得快,完成简单任务特别快,是不是就类似于看抖音视频,爽感来得特别快,过程中自己根本就不用带脑子。有人把 AI 写代码比成吸毒,我觉得也挺准确的。

而且,大规模程序员的工作本身可能并不复杂,类似于老板输入语言需求,AI 代码就能完成。这会导致我们的社会以后出现什么?通过小项目逐步历练的程序员越来越少,因为这种机会没有了。经历过大项目、知道自己要搭架构的程序员越来越少,因为他们会老、会退休、会死。

也许很多人并没有意识到,软件的后期维护其实是很占成本的,他们更在意当下快速完成工作。我记得我在创游呢,我自己感觉我最牛逼的一点就是,我碰到什么样的问题,直觉上都能反映出大概是哪儿的问题。我的 bug 定位非常非常快,我相信绝大多数能编程的程序员都有类似的能力。

所以即便在 AI 时代写代码可以很快,但是我仍然想,如果能够让程序员本身知道自己写了什么、有什么架构,这才是 AI 时代程序员本身应该具备的能力。他应该保持自己的判断力,而不应该将一切都交给 AI。AI 不能取代人的脑子,它只是一个基于概率推算的编程工具。

重新开工

前前后后折腾了差不多五六天,终于把所有的工具整备到可以重新开工状态了。

工作流

数字人方面,本地跑通了,但实在太慢——差不多 1 秒画面要 200 多秒渲染。45 秒的口播就要至少 2.5 小时,本地推理期间电脑还不能干别的事,完全不可接受。暂时把这个工作迁到 RunningHub 上,每秒开销大约 80 秒,而且可以交给智能体跑,至少电脑腾出来了。

BGM 方面,从 AI 生成改为了固定 10 首曲目。一来 BGM 质量有保证,二来能形成统一的风格。这块也能省不少事。

差不多 7 月 2 号,工作流就彻底弄完了。

系统升级

但我突然发现 PR 提示 Win10 不再支持了。犹豫了一下,还是升级到了 Win11。调整了很久开始菜单,终于把排列能看过去了。

升级到 Win11 后,愕然发现 Windows 里面很多操作竟然变流畅了,很诡异——说好了 Win10 消耗性能更少的呢?查了一下,大概是 Win11 对固态有特殊优化。

CherryStudio

最后在 7 月 4 号尝试了一下 CherryStudio v2 的内测版。这个版本主推智能体功能,并重构了数据底层,确实命中我的需求——我一直都说 CherryStudio 提供的功能过于纷杂。思路都是对的,但由于是测试版本,问题不少:极其卡顿、界面渲染问题频出、拖入文本解析也不给结果。生产环境暂时不能用,先还原回 1.9.11 了。

多事之夏

连坐制度视频被限

6月28号发布了一篇关于古代连坐制度的视频。头条和抖音一个不给审核过,一个完全不给量。明明说的是古代的连坐制度,而且发布前已经把政审最严格的那段改得相对温和了,还是不给过,那段画面也都全用的口播。很奇怪。

BizyAir 国内停止服务

7月1号,因网信办监管,BizyAir 网站国内停止服务。花了两天时间重新跑通所有工作流,把能转接的 API 都接到了相对可靠的第三方:

  • 主力用 GrsAI,备份用 ApiLio
  • 平均出 100 张 GPT Image 的图约 3 块多
  • 偶尔切几张 Nano Banana 的图,约两毛多一张
  • 7月1号 Nano Banana Lite 新引擎上线,应该能进一步降低成本

Anthropic Sonnet 5

今天 Anthropic 公开了 Sonnet 5 模型,在任务流程中已经顶替了 Opus 4.6 的工作。预计在提纲和分镜阶段,成本将下降 5 到 7 成。

硅基流动调价

硅基流动今天调整了 DeepSeek V4 Pro 定价。在官方降智后,硅基流动是少有的智商在线的调用渠道,但今天开始恢复 4 倍原价。已将所有调用 V4P 的节点内容转移回官方。希望随着七月的峰谷价和 V4 正式版,官方能支棱住。


还有最后两个本地工作流的迁移工作,完成就能继续做视频了。

BizyAir关服有感

哎呀,今天一登录开屏雷击呀。

BizyAir 要关服了。本来可以白嫖到 9 月份的,这个会员现在啥都没有啦,还有最后一周。

小道消息是被同行举报,国内用不了了,他们要转战海外。照理说,硅基流动的业务一直是相对还算规矩的,因为国内硅基流动也只有开源的一些大模型,基本都是自己架服务器。但是这个 BizyAir 子站,应该是所有绘图 API 调用里最最最便宜的。虽然我白嫖了半年的专业版,但就算充值,专业版每天算下来大概 3 块钱也可以画 50 张以上的图啊,一张大概就几分钱。现在换成官方转接的一些 API(按token算),一张图可能 1 毛到 3 毛吧,还是贵很多啊。

关键是我这个之前还都不要钱的,突然就用不了了,很蛋疼。更更更更蛋疼的是,我 20 来个工作流,其中 6 个都是接的这个网站的 API,又得一个个剥离。虽然现在有大模型接 API 快得很,但是终归还是麻烦。

特别是现在如果 3 毛一张算的话,我一个视频做 100 张图左右,那么一个视频做图就要 30 块,加上一些生成视频和声音的,那就往四五十去了啊。一个月如果发 7 个视频,那我得花几百块钱,就有点太贵了。

这还不叫用 Seedance,对吧?我的视频不像短剧那样是烧钱的生成方式,已经很文明了。可能我又得退回到调本地 API 的过程了。

赶紧的,把 Z-Image 捡起来。

模型对比-提纲工作流

这是什么

记录一下我的写提纲工作流在各模型下的对比,今天是 2026 年 6 月 23 日,正好上架了 Doubao 2.1,就来对比下。

我个人认为,我工作中最重要的两个工作流就是这个写提纲的工作流和产生分镜的工作流。但产生分镜的工作流约束条件极多,只要模型指令遵循能力强,差别都不大。而这个根据提供的材料列出提纲的工作流才是最需要大模型文科能力的。

为了简洁表示,直接给出最后的最终排名,评价时使用 DeepSeek v4 Pro 进行。

PS:解释一下 Opus 为什么用 4.6,因为 4.7 和 4.8 的效果均不如 4.6。另外测试过 Fable 5,总评能到 94 分,但现在用不了了。

最终排名

Tier 1(可胜任)
  Opus 4.6              92分  🥇
  GLM 5.2               88分  🥈

Tier 2(差一口气)
  Doubao 2.1 Pro        83分  🥉

Tier 3(不适合)
  GPT 5.5               79分  ④
  DeepSeek v4 Pro       78分  ⑤
  Kimi 2.7 code         68分  ⑥
维度 Opus 4.6 GLM 5.2 Doubao 2.1 Pro GPT 5.5 DeepSeek v4 Pro Kimi 2.7 code
叙事逻辑 (×2) 100 92 82 85 75 65
比喻质量 (×2) 90 95 78 75 78 75
收尾质量 (×1.5) 88 92 86 80 82 80
安全策略 (×1) 95 75 85 78 72 82
参谋价值 (×1) 95 80 90 72 80 82
风格贴合 (×1.5) 88 90 83 80 82 85
AI 味控制 (×1) 90 85 82 78 80 90

六模型能力画像

Opus 4.6        叙事编织者    逻辑最清、节奏最准、安全最周到
GLM 5.2         比喻爆发手    金句最多、人味最浓、收尾最有回味
Doubao 2.1      最会当参谋    实操建议最强、彩蛋灵活、讲故事偏赶
GPT 5.5         安全答卷人    四平八稳、正确但不出彩、AI味偏重
DeepSeek v4 Pro 结构工程师    格式规范、规则遵循强、创意编织是短板
Kimi 2.7 code   评分裁判员    客观敢打低分、叙事编织有明显硬伤