哎呀,好久没有写博客了,感觉最近一直在做歌曲视频。不过越做越顺,整个流程怎么跑已经清楚了。
而且现在属于是差什么来什么:
音频质量不好,YuE2 这个模型就出来给你增强音频;DeepSeek V4 涨价,就发布了 Qwen3.8 Flash;生成速度不够快,又来了 DeepSeek V4.1,价格也都降下去了。
感觉就像困了,有人递过来一个枕头。
这次做账号感觉比较顺利。虽然说还在很初步的阶段,但明显比之前做普法视频的时候好很多。特别是快手这种对新号很友好的平台,涨粉的数量、速度,包括平均播放量,都很不错。音乐水平提高之后,加上整个制作的精美程度也在提升——这其实跟制作的熟练度差不多,人的审美和对音乐水平的调教,还是得多用一用、多听一听、多看一看,这个能力就会上去一些。
目前技术上所有问题基本都已经解决了,所以又回到了所有做内容视频的人的起点问题:现在卡壳的部分是稿子。只要改编的歌词做得出来、有搞笑的段子给我,我就能把它做出来。而且现在制作的熟练度和速度也越来越快。
顺便一提,终于碰到了第一个被封的视频,是在抖音上,一个给猫猫绝育的歌曲。可能是碰到了医疗或者手术台的图片,还有"绝育"这种词,触发了抖音内部的机审封禁。实际上这个视频在前 10 个视频里,快手上的呈现量是最好的。这也就说明问题不在我。
好了,就随便写一点,记录一点心得,就这样。
更新工具链。这次更新算是微调,只是将绘图模型从Lite改用了Fast。Fast在大多数情况下画质并没有Lite好,但是在卡通场景下,效果大多数时候 Fast更好。
- CherryStudio — 主控台,所有智能体调度
- DeepSeek v4.1 Flash — 主力模型
- Gemini 3.8 Flash - 重要节点参考LLM
- YuE2 — 改词、改曲
- SoulX Singer — 改音色并润色
- Open Soren WebUI - 歌曲最后一步合成
- 豆包录音识别 - 获得歌词准确时间,便于分镜,主要使用此渠道
- Qwen ASR - 获得歌词准确时间,便于分镜【备用】
- SenseNova u1.5 Fast/Lite — 画面首帧生成/封面抽卡
- GPT Image 2.5 — 封面最终生成,优先使用1K,降本
- VOSR2 - 图片超分放大,对于GPT去噪效果极佳
- MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
- RTX Video Processor — 2x放大(1280p,缩小到85%出1080p视频),利用RTX Video SDK开发
- DeepSeek 官方
- OpenCode Go 官方订阅
- SenseNova 商汤官方
- GrsAI 第三方中转站
更新工具链,这算是一次重大升级,首先是刚刚发布一周的DeepSeek v4.1 Flash,在质量基本不变的情况下,5-8倍的速度,让我一天就把之前一周需要整理的结构全部搞定了。价格还很便宜,仿佛回到了那个DeepSeek 0731的时代。
其次,音乐生成方面基本没有版权风险了,YuE2的出台,让音乐效果可以追平Suno 5.5,并且基本没有在X Studio那漫长的调音过程了,也不需要云端支持,彻底独立出来了。释放了依赖云端制作重要步骤的风险。我感觉这就是我最后一块拼图。
第三,是个降本增效的图片处理。GPT Image 2.5的构图能力强,写字没问题,同时1K图只需要4分钱不到。再经过10秒的VOSR2放大,效果比直出2K、4K图还好,每一期的制图成本基本压缩到了3毛以内。
第四,重用Gemini 3.8 Flash,写稿子很有特点,虽然很多方面不如其他模型,但最重要的是有特点。这和踢足球一样,基础达标后,最重要的是有特点!这一步可能每期开销要5毛左右。
第五,ASR识别改用豆包,这点纯粹属于提高效率。豆包在语音识别上明显高于千问。而且这个步骤实际支出很低,由于豆包 还送了20小时体验包,目前属于0成本。
- CherryStudio — 主控台,所有智能体调度
- DeepSeek v4.1 Flash — 主力模型
- Gemini 3.8 Flash - 重要节点参考LLM
- YuE2 — 改词、改曲
- SoulX Singer — 改音色并润色
- Open Soren WebUI - 歌曲最后一步合成
- 豆包录音识别 - 获得歌词准确时间,便于分镜,主要使用此渠道
- Qwen ASR - 获得歌词准确时间,便于分镜【备用】
- SenseNova u1.5 Lite — 画面首帧生成,封面抽卡
- GPT Image 2.5 — 封面最终生成,优先使用1K,降本
- VOSR2 - 图片超分放大,对于GPT去噪效果极佳
- MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
- RTX Video Processor — 2x放大(1280p,缩小到85%出1080p视频),利用RTX Video SDK开发
- DeepSeek 官方
- OpenCode Go 订阅
- GrsAI 第三方中转站
最近发现一个 VOSR 技术,确切地说是 8 月 22 号开源的 VOSR2,主打视频高清放大。它和以往的超分方案不同:不需要任何文本引导,是一个纯视觉生成方案,对视频的高清放大效果极佳。9 月 8 号,ComfyUI 的适配版本也已经出来了。
在本地跑了一下,情况如下:
虽然不爆显存(整个模型 7~8G,运行起来也就11~12 G 显存),但运行效率很低。目前实测大概 6 秒的视频需要 18~20 分钟左右才能放大完。这应该还是稀疏矩阵运算的问题,还需要 turbo 或其他优化技术来提速。
效果极佳!实测把一段 640P 的视频超分到 1280,一点点都不违和,完全达到了预期水平。
对比下来,远超我之前用的星光模型等方案。它既克制又清楚,锐化得恰到好处,细节补充也一点也不突兀。
现在已经进入 ComfyUI 生态了,相信过段时间就能看到高速的产品。
持续关注中……
更新工具链,经测试,参考LLM模型改用GLM 5.3 Flash和Gemini 3.8 Flash,扩展第三方中转站服务商。
- CherryStudio — 主控台,所有智能体调度
- Qwen-3.8-Flash - 主力模型
- DeepSeek v4 Flash — 主力模型(备用)
- GLM 5.3 Flash
- Gemini 3.8 Flash
- 网易X Studio — 改词
- SoulX Singer — 改音色并润色
- ACE Step — 歌曲二次合成
- Open Soren WebUI - 歌曲最后一步合成
- Qwen ASR - 获得歌词准确时间,便于分镜
- SenseNova u1.5 Lite — 画面首帧生成,封面抽卡
- GPT Image 2 — 封面最终生成
- MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
- RTX Video Processor — 2x放大(1280p,缩小到85%出1080p视频),利用RTX Video SDK开发
- DeepSeek 官方
- OpenCode Go 订阅
- GrsAI、apilio、DMXAPI 等三方中转站
更新工具链,将超分放大改为RTX的视频实时超分技术,效果和Topaz差不多,但速度极大提升,且一键bat可超分完成。另外,主要稿件参考LLM模型,更新为Gemini 3.7 Flash
- CherryStudio — 主控台,所有智能体调度
- Qwen-3.8-Flash - 主力模型
- DeepSeek v4 Flash — 主力模型(备用)
- GPT-5.6-Terra
- Gemini 3.7 Flash
- 网易X Studio — 改词
- SoulX Singer — 改音色并润色
- ACE Step — 歌曲二次合成
- Open Soren WebUI - 歌曲最后一步合成
- Qwen ASR - 获得歌词准确时间,便于分镜
- SenseNova u1.5 Lite — 画面首帧生成,封面抽卡
- GPT Image 2 — 封面最终生成
- MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
- RTX Video Processor — 2x放大(1280p,缩小到85%出1080p视频),利用RTX Video SDK开发
- DeepSeek 官方
- OpenCode Go 订阅
- GrsAI 第三方
今天又更新了一下工具链,增加推理模型,增加网易X studio工作流程
- CherryStudio — 主控台,所有智能体调度
- Qwen-3.8-Flash - 主力模型
- DeepSeek v4 Flash — 主力模型(备用)
- Kimi K2.7 Code
- GPT-5.6-Terra
- 网易X Studio — 改词
- SoulX Singer — 改音色并润色
- ACE Step — 歌曲二次合成
- Open Soren WebUI - 歌曲最后一步合成
- Qwen ASR - 获得歌词准确时间,便于分镜
- SenseNova u1.5 Lite — 画面首帧生成,封面抽卡
- GPT Image 2 — 封面最终生成
- MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
- Topaz Video — 2x放大(1280p,缩小到85%出1080p视频)
- DeepSeek 官方
- OpenCode Go 订阅
- GrsAI 第三方
这两天更新了一下整体工具链上使用的工具。出图过程中使用了商汤刚刚发布的 1.5 模型,免费,可以大量反复测试出图。音频文件增加母带处理。MiniMax H3视频生成改为二次采样。(540p ➡️ 640p,并提升速度30%-50%)。超分改用Topaz Video。
- CherryStudio — 主控台,所有智能体调度
- DeepSeek — 主力模型
- Kimi K2.7 Code
- GPT-5.6-Terra
- SoulX Singer — 歌词合成
- ACE Step — 歌曲二次合成
- Open Soren WebUI - 歌曲最后一步合成
- Qwen ASR - 获得歌词准确时间,便于分镜
- SenseNova u1.5 Lite — 画面首帧生成,封面抽卡
- GPT Image 2 — 封面最终生成
- MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存),一次采样0.3M,二次采样0.7M(640p)
- Topaz Video — 2x放大(1280p,缩小到85%出1080p视频)
- DeepSeek 官方
- OpenCode Go 订阅
- GrsAI 第三方
有一个多月没更新博客了,原因是在准备开新视频号,最近一直在跑通流程。
事情大概是七月中旬,某天午觉醒来刷手机,看到两个广播主持人做改歌词的短视频,把《好汉歌》改成吐槽加班,挺有意思的。我突然就想到了「刚买的飞机」这个梗,意识到这种号其实挺好做,而且如果接广告,直接用 Suno 生成歌曲就行。念头一起,就决定换个赛道了。
法律赛道的搞笑动画还是不好做。前前后后做了 140 多个视频,有近 10 个在不同平台被下架过。加上法律类 AI 工具(Skill、MCP 之类的)越来越成熟,入门法律咨询看起来越来越像骗子了。靠法律渠道赚钱确实得心黑。而且从接触到的低学历人群来看,普法教育的意义也没那么大——很多人不愿意学,也教不会。算了,心累。
所以还是做娱乐向内容。
确定了改编歌词的赛道,就要解决一套流程和技术问题:
- 音频:SoulX Singer SvS + ACE Step 方案。Suno 效果虽好,但抽卡严重、可编辑性低,只用于商单曲目以避免侵权。
- 文生图:还是经典的 NanoBanana。
- 图生视频:本来准备用 SeeDance 2.0,但刚好 Minimax H3 发布了,还开源了,效果齐平 SD 2.0,而且免费,极大降低了生成成本。
主角就用我家两只小猫咪。猫猫唱歌——一个基本没有对手的赛道。但改歌词唱歌本身又是个满是对手的赛道,很神奇。
段子和素材也靠智能体自动检索加人工筛选搞定。整个流程中,人工介入的关键点只有三个:歌词改编、分镜设计、首帧设定。其他基本全自动。
目标:9 月 2 日,喵喵开始唱歌啦!
记录一下猫猫们唱歌这条线用到的工具链,从模型到生成一条龙。
- CherryStudio — 主控台,所有智能体调度
- DeepSeek — 主力模型
- Kimi K2.7 Code
- GPT-5.6-Terra
- SoulX Singer — 歌词合成
- ACE Step — 歌曲二次合成
- QwenASR — SRT生成
- NanoBanana2 — 画面生成
- GPT Image 2 — 封面生成
- MiniMax H3 — 视频生成主力(本地 16G 显存 + 64G 内存)
- Waifu2x — 2x放大
- DeepSeek 官方
- OpenCode Go 订阅
- GrsAI 第三方