结论摘要
对比《接受》歌切与 55 分钟 PK 录播:同一机位、同一套光、同一构图。 唯一区别是唱歌时底部多了实时歌词条,聊天时多了点歌/舰长贴片。已验证
超近景大特写 + 正面平光 + 低对比高亮度,三者互为因果。 舞台冲击感所需的空间、方向光、明暗对比,被这三条同时挡住。加滤镜绕不过去。
构图、UI、遮幅、色调、背景压暗都能纯软件实现; 光真正照在脸上的立体感做不了,那需要一支物理灯。这个分界决定选哪套方案。
她的画面最大的问题是「静」——一个人坐着不动,构图几十分钟不变。 在 4K 源上做裁切窗口的缓慢推移,画面立刻就活了,不碰脸、不碰肤色、不碰美颜。 这条来自对她直播回放的拆解,是实时可做的。已验证
构图 + UI 清空 + 遮幅 + 曲名条,一场试 2–3 首歌。 有效果再解决美颜迁 OBS,最后才考虑加灯。先验证,再上工程量。
一个已经存在的好基础
她画面底部已经有一条实时歌词——半透明深色底,当前句橙红高亮,上下句灰白小字。 说明她已经有「唱歌模式」的意识和一套能出实时字幕的工具链,本方案的增量成本比从零开始低。 待确认 这条歌词是用什么做的(桌面歌词软件窗口捕获 / 插件 / 其他), 因为它决定了迁移到 OBS 时这块能不能平移。
现状拆解
画面构成
从投稿封面、歌切与录播反推。录播与直播画面基本一致,因此以下即她的实时画面特征。
| 项 | 现状 | 判断 |
|---|---|---|
| 取景 | 超近景大特写,脸占画面高度约三分之一,肩以上 | 颜值优势最大化,但没有空间 |
| 镜头 | 大光圈光学虚化,背景成暖色 bokeh 光斑 | 最大资产,滤镜做不出来 |
| 主光 | 大直径柔光正面略高,脸上几乎无硬阴影 | 为美颜服务,方向性为零 |
| 调色 | 提亮、降对比、暖偏、磨皮 | 皮肤优先,天然反冲击 |
| 背景 | 白/米色实景,暖色灯串、花束、装饰 | 温馨,虚化后质感好 |
| 道具 | 大振膜电容麦故意入镜 | 最强的「唱歌」视觉符号 |
| 画幅 | 1080×1920 竖屏 | 横向空间受限,纵向可做文章 |
已有 · 缺失
已经有的
- 实时歌词条(当前句高亮)
- 贴片素材能力(点歌/舰长提示)
- 精修封面的排版设计能力
- 棚拍级的布光与镜头
- OBS 使用经验
缺的
- 唱歌与聊天的构图差异
- 遮幅/画幅变化
- 唱歌时的 UI 清空
- 色调差异
- 光的方向感(轮廓光)
工具门槛:她没有门槛
B站第三方推流(OBS)权限门槛为 5000 粉(2025-05-26 起生效,此前为 100 粉)。 她 1.7 万粉,完全满足。已验证 所以她回到直播姬是主动选择,不是被平台卡住—— 真正需要搞清楚的是她当初为什么退回来(见 Q1)。
根因分析
舞台冲击感需要三样东西。她三样都被结构性挡住,而且三者互相咬死。
| 要素 | 她的现状 | 为什么改不动 |
|---|---|---|
| 空间感 | 画面 80% 是脸和虚化的墙 | 物理上装不下一个舞台 |
| 光的方向 | 正面平光 | 侧光在脸上留阴影,与美颜算法打架 |
| 明暗对比 | 提亮压对比 | 拉对比皮肤瑕疵就出来 |
要空间就得拉远 → 脸变小,削弱最核心的颜值资产; 要方向光就有阴影 → 与美颜冲突;要对比就露细节 → 也与美颜冲突。 任何绕过这组取舍的方案(例如全屏套彩色滤镜)只会让画面变脏,不会变得有冲击力。
方向判断:冲击感可能不是正确目标
她的歌单——《接受》《天梯》《月光》《甲乙丙丁》《崇拜》——全是抒情, 整个视觉资产是「温柔、亲密、治愈」。硬上舞台冲击感会与人设正面冲突。
在她这条线上更该追求的是「进入感」:从「在房间里和你聊天」变成「进入她的世界」。 压暗、聚焦、色温转冷就能做到,比彩光更贴她,成本也更低。
《处处吻》《我的宣言》这类粤语快歌撑得起真正的舞台光。 如果要做冲击感,按歌路分 look 比全局改造更安全,也更容易验证效果。
效果示意图
全部以她真实的直播画面为底图改造(取自《接受》Cover 投稿的原始帧, 1080×1920)。分两组:竖屏是直播实时能做到的, 横屏是投稿离线精修能做到的——两组的分界就是「能不能替换背景」。
用途是对齐预期与筛选方向。实际直播里,背景压暗由 AI 抠像遮罩实时完成, 边缘精度低于这里的精修图;轮廓光是遮罩偏移做出来的,也不会这么完美。 另外图中人物面部经过生成模型处理,与本人存在细微差异。
竖屏 · 直播实时线
背景是她原本的房间,只做压暗、调色、加灯,不替换。
它只加了黑边,画面内容一个像素没改——把它和 V0 并排,就能单独衡量遮幅本身值多少。 这是整套方案里成本最低的一项。
竖屏 · 运镜示意
同一张 V3,三个不同的裁切窗口。运镜的本质就是让这个窗口移动,而不是让摄像头移动。
建议一次推近走 30–60 秒。她的画面最大的问题是「静」—— 一个人坐着不动、构图几十分钟不变。加一段缓慢推近,画面立刻就活了, 而且完全不碰脸、不碰肤色、不碰美颜。
横屏 · 投稿离线线
允许替换背景,因此能做出实时做不到的环境。人物偏右、左侧留白给歌名, 左右背景由 outpainting 扩展。
另有一张 3840×2160 的 4K 封面级版本(W4), 规格同 W1,用于投稿封面。投稿封面是 B站信息流里拉新的第一入口, 它值得单独投入——同一场直播的素材,投稿时能做出直播里做不到的质感。
两条线的能力差别
| 能力 | 竖屏 · 实时 | 横屏 · 投稿 |
|---|---|---|
| 遮幅 / UI 清空 / 曲名条 | 可以 | 可以 |
| 背景压暗、调色 | 可以 | 可以 |
| 轮廓光 | 遮罩偏移,精度有限 | 可以 |
| 运镜 | 可以(需 4K 源) | 可以 |
| overlay 装饰 | 可以 | 可以 |
| 替换背景 | 做不到 | 可以 |
| 画幅 | 竖屏固定 | 横竖任选 |
方案 A · 直播姬简化版
推荐起点 零采购、零迁移、保留内置美颜。今天就能配,用来验证「模式切换到底有没有用」。
可行性依据
直播姬 PC 版支持多场景预设 + 多图层素材(摄像头/图片贴片/视频循环/文本)+ 快捷键切换。 这意味着「聊天场景」和「唱歌场景」可以直接在直播姬里做,不用换 OBS,美颜也保住。
两个场景的配置
场景 1 · 聊天
- 摄像头层:当前近景取景
- 贴片层:点歌提示、舰长提示
- 美颜:现有参数不动
场景 2 · 唱歌
- 摄像头层:中景裁切(背景进画面)
- 遮幅层:letterbox PNG
- 曲名条:歌名 / 原唱,放角落
- 歌词层:保留现有
- 贴片全部关闭
素材规格
| 素材 | 规格 | 说明 |
|---|---|---|
| letterbox 遮幅 | 1080×1920 PNG,带 alpha | 上下各 220–260 px 纯黑,中间全透明。数值可调,越厚越「电影」,但会压缩人物空间 |
| 曲名条 | 宽约 420 px PNG 或文本层 | 放左下或右上。歌名主字号,原唱小一级。避开歌词条与脸 |
| 过渡 | 1.5–2 秒淡入淡出 | 不要硬切。切换前留一句口播衔接 |
能力边界
| 能做 | 做不了 |
|---|---|
| 构图切换 · UI 清空 · 遮幅 · 曲名条 · 歌词 · 快捷键一键切 | 色调差异(美颜滤镜大概率全局)· 背景单独压暗 · 光的方向 |
- 图片素材支不支持 PNG 透明通道——决定 letterbox 和曲名条能不能叠
- 图层能不能自由裁切——决定构图切换能不能做
- 美颜滤镜是全局还是跟场景走——决定色调差异有没有可能
构图切换依赖裁切余量。源是 4K 推 1080×1920 → 随便裁,画质无损; 源只有 1080p 而当前特写已经是裁出来的 → 再裁就糊,这条就废掉, 只能靠物理移动摄像头。这是整个方案 A 成不成立的第一个前提。
方案 B · OBS 完整版
一个热键触发,构图、色调、背景、遮幅、UI 全部同时切。 能力上限高出方案 A 一大截,代价是必须先解决美颜与 GPU 开销。
唱歌场景的图层结构
- L5歌词条 / 曲名条现有歌词来源 + 曲名文本或 PNG
- L4letterbox 遮幅带 alpha 的 PNG,最上层
- L3假轮廓光层人物遮罩偏移相减得到单侧边缘,着色后 Screen 混合
- L2人物层摄像头副本 → AI 抠像输出 alpha → 美颜滤镜。不加任何调色
- L1背景层摄像头副本 → 色彩校正(压暗、转冷)+ 暗角。脸被 L2 盖住,不受影响
核心手法一:背景单独压暗,脸完全不动
用 obs-backgroundremoval (开源 AI 人像分割)——但不是拿它换背景,而是拿它生成的遮罩做分层: 摄像头源复制两份,一份当背景层加调色,一份当人物层用遮罩抠出来叠上去、不加调色。
结果是背景压暗转冷了,脸的曝光和肤色一点没动。 而且因为背景只是被调暗调色、不是被替换,边缘就算有几像素误差也几乎看不出来—— 这比绿幕换背景的容错率高一个量级。
她是长直发、发丝多,画面卖点是皮肤和发质,而抠像最难的恰恰是发丝边缘: 要么带绿边、要么被抠掉一层,皮肤还会反射绿光偏青。 加上绿幕需要独立布光和 1–1.5 m 纵深(居家小空间多半没有), 以及磨皮会让边缘判断更容易出错——失败点全落在人的边缘上,对她是负收益。 而且换背景会丢掉她最大的优势:光学虚化。
核心手法二:假轮廓光
光的方向严格说软件做不出来,但可以骗,而且效果不差:
- AI 抠像得到人物遮罩
- 遮罩往一个方向偏移几像素(例如
x+6, y-6) - 偏移后的遮罩减去原遮罩 = 单侧边缘环
- 边缘环着色(暖橙或冷蓝)+ 高斯模糊约 4 px
- 以 Screen 混合模式叠回人物层上
用 obs-shaderfilter 写一个 shader, 或者用遮罩 + 模糊 + 混合模式硬凑也行。 关键是第 2 步的偏移——不偏移就是均匀发光一圈,一眼假;有了方向才骗得过, 尤其在背景已经压暗的情况下。
假轮廓光骗的是「边缘」,真灯给的是「体积」:真光照上去,脸颊有明暗过渡、鼻梁有高光、下颌有阴影,这些软件给不了。 但她本来就要磨皮平光,脸上的立体感是主动放弃的东西—— 假轮廓光 + 背景压暗,已经能覆盖她需要的大部分效果。
色调差异
| 层 | 聊天 | 唱歌 |
|---|---|---|
| 背景层亮度 | 不变 | 降低约 15–30% |
| 背景层色温 | 暖白 | 偏冷 / 转琥珀(按歌路选) |
| 背景层饱和 | 不变 | 略降 |
| 人物层 | 两个模式完全一致,不做任何调整 | |
| 暗角 | 无 | 轻微 |
一键控制
「一键」这个诉求本身就把方案推向 OBS:直播姬的快捷键只能切它自己的场景、没有对外 API;
OBS 有 obs-websocket,才是能当总控的那个——
未来要联动伴奏、点歌队列,甚至一盏灯,都挂在这一层上。
- 美颜必须先解决——这是她当初退回直播姬最可能的原因,不解决她试一次就会再退回去。见下一节。
- GPU 开销 待确认——美颜插件 + AI 抠像 + shader 同时跑, 还要保证推流不掉帧。她的显卡配置必须先确认。
任何一条不过,就得降级回方案 A(构图 + UI + 遮幅,没有色调和抠像)。
overlay 与运镜
这两项来自对西野柚子直播回放的拆解,因此是实时可做的, 不是后期效果。已验证
overlay
素材格式:静态用带 alpha 的 PNG;动态用 webm(VP9 + alpha)—— OBS 媒体源原生支持带透明通道的 webm,这是做动态 overlay 的标准格式。
没有 Screen / Add 混合,overlay 永远是「贴上去的贴纸」;有了才是「发出来的光」—— 它会和底下画面产生真实的光叠加。这一条对霓虹类效果尤其致命,因为霓虹的本质就是发光。
直播姬能做的是:把发光效果预先烘进 PNG 素材再当贴纸叠。 边角装饰(条纹、角标、大字)可以接受,弥漫的光晕做不了。
运镜
在高分辨率源上开一个输出尺寸的裁切窗口,让窗口动,而不是让摄像头动。
- A裁切窗口动画4K 源内开 1080×1920 窗口,用 Move 插件做关键帧动画,绑定场景切换或热键。画质无损。最佳方案
- B多机位跳切预设 3–4 个不同裁切的场景,热键切换。直播姬也能做,但只能跳切,没有连续运动
- C呼吸式缩放对源做 100%→105% 慢速循环缩放。1080p 源也能做,画质损失肉眼不可见。降级方案
参数建议
| 项 | 建议值 |
|---|---|
| 缓推时长 | 一次 30–60 秒走完 |
| 缩放幅度 | 不超过 8% |
| 横移幅度 | 不超过画面宽度的 6% |
| 倾斜 | 1–3 度封顶 |
| 音频驱动缩放 | 幅度 1–2%,加大阻尼 |
西野柚子可以把镜头甩得很快,因为数字模型怎么动都不晕; 真人画面快速运动会让人不适。所有数值都要比她那套小一个量级,每次运动至少 20 秒以上。
音频驱动
Move 插件的 Audio Move 能把音频电平直接映射到源的变换值—— 画面跟着低音微微推近。比固定节奏的运镜自然,而且完全自动,不占她的操作。
能力对照
| 能力 | 直播姬 | OBS |
|---|---|---|
| 静态 overlay(条纹 / 角标 / 大字) | 可以 | 可以 |
| 动态 overlay(webm alpha) | 待实测 | 可以 |
| 发光融合(Screen / Add) | 做不到 | 可以 |
| 连续运镜 | 做不到 | Move 插件 |
| 跳切机位 | 多场景 + 热键 | 可以 |
| 音频驱动 | 做不到 | Audio Move |
| 呼吸式缩放 | 做不到 | 可以 |
一句话概括:直播姬能做「贴纸 + 跳切」,OBS 能做「光 + 运动」。
方案 A 的无损运镜需要 4K 源。如果摄像头只有 1080p,构图切换和运镜会一起废掉, 只能退到 C 方案的呼吸式缩放。所以摄像头分辨率是现在最该先问清的一条。
地基 · 美颜方案
直播姬内置美肤滤镜、五官微整(瘦脸/大眼)、一键美妆,OBS 原生一个都没有。 对颜值向唱见来说美颜是刚需不是加分项,这一条是整条 OBS 路线的地基。
| 方案 | 能力 | 成本 | GPU | 风险 |
|---|---|---|---|---|
| OBS 美颜插件 obsworks.com |
瘦脸、大眼、磨皮、美白、身材、美妆、背景虚化、贴纸 | 价格未公开 | 中 | 国产闭源插件,稳定性与隐私待验证;官网称兼容 OBS 27–32 |
| 手机美颜 App + 虚拟摄像头 |
美颜质量最好(成熟消费级 App) | App 订阅 + 连接软件 | 低 手机端算 |
延迟、连接稳定性、二次编码画质损失;且丢掉微单的光学虚化 |
| 自写 shader 磨皮 obs-shaderfilter |
只有磨皮,没有瘦脸大眼 | 免费 | 低 | 效果远不如专业美颜,大概率不达她的标准 |
| 放弃 OBS 留在直播姬 |
美颜最好,但没有色调/抠像/轮廓光 | 零 | 零 | 能力上限锁死在方案 A |
先问清 Q1(她当初为什么退回直播姬)。 如果答案不是美颜,那这一节的优先级大幅下降,可以直接上方案 B; 如果答案就是美颜,那必须先把美颜方案跑通并让她认可效果,再谈迁移—— 否则做完整套配置她试一次就会退回去,前面全白做。
分步路径
核心原则:先验证假设,再上工程量。每一步都有明确的退出条件。
-
验证「模式切换有没有用」
在直播姬里配方案 A(构图 + UI 清空 + 遮幅 + 曲名条),一场试 2–3 首歌。
零成本零风险。
退出条件:看弹幕反应、唱歌段的留存与礼物。没有可感知的变化就停在这里,不要继续投入。 -
解决地基
确认 Q1 的答案。若是美颜,跑通一个 OBS 美颜方案并让她本人认可效果;同时确认 GPU 能不能扛。
退出条件:美颜达不到她的标准,或 GPU 扛不住 → 永久留在方案 A,不要硬迁。 -
迁到 OBS 做完整版
背景分层压暗 + 假轮廓光 + 色调差异 + 一键热键。这一步拿到软件能给的全部效果。
退出条件:推流稳定性下降、她操作负担变重 → 回退。 -
要真正的立体感才加灯
一支轮廓光,接进已经搭好的
obs-websocket总控。 灯的一键控制并不复杂(见下),别把它当作不可能。
触发条件:前三步做完,仍觉得「不够立体」才做。
补充:物理灯的一键控制没那么复杂
| 做法 | 复杂度 |
|---|---|
| 带遥控器的 RGB 灯棒,唱歌前按一下 | 零集成。不是严格一键,但成本几乎为零 |
| WLED(ESP32 灯带控制器) | 有 HTTP API,切场景时脚本发一个请求就改色 |
| Lumia Stream | 就是为这个做的产品:OBS 场景切换直接绑定灯光变化 |
| Stream Deck | 一个物理按键同时触发场景 + 灯光 + 伴奏 |
一旦用了 OBS + websocket,接一盏灯的边际成本很低。建议先不做,但不要因为「要连物联网」就排除它。
补充:让灯进虚化区(她的独有优势)
如果最终决定加灯,把 RGB 灯棒藏在背景景深里而不是打人。 大光圈会把灯化成柔和的大色块光斑——同一支便宜灯,别人拍出来是廉价彩光,她拍出来是高级光斑。 唱歌时改灯色,背景就变了,零抠像风险、零画质损失。
待确认清单
调研的缺口全在这里。这几个答案会直接改变上面的方案排序,建议先问完再动手。
- 当初为什么从 OBS 回到直播姬? 美颜 / 卡顿 / 太麻烦 / 掉帧。最关键的一题——决定整条路线怎么走,以及美颜地基的优先级。
- 摄像头是什么型号,输出多少分辨率? 微单 + 采集卡 / 网络摄像头 / 手机。现在是优先级最高的一题—— 构图切换和运镜都依赖 4K 源的裁切余量,只有 1080p 的话两条会一起废掉, 只能退到呼吸式缩放。
- 电脑配置,特别是显卡? 决定 OBS 美颜插件 + AI 抠像 + shader 能不能同时跑而不掉帧。
- 现在有几盏灯、什么型号、能不能调色调亮度? 决定第 4 步加灯时是买新的还是改现有的。
- 唱歌时是坐着不动,还是会站起来或换位置? 决定固定构图的两套裁切是否够用。
- 底部那条实时歌词是用什么做的? 桌面歌词软件窗口捕获 / 插件 / 其他。决定迁到 OBS 时这块能不能平移。
- 她自己想要什么感觉:更亲密,还是更有舞台感? 这两个方向相反。她全部视觉资产都是「温柔亲密」,突然上舞台彩光会与人设打架。 这题必须她本人定,不能替她决定。
附录 · 对标
做得最好的样本:西野柚子(B站 VTuber)
本轮调研看到的最完整的实现。同一个模型,聊天一套画面,表演另一套, 而且一首歌一套视觉——下面三张分别取自三个不同场次。
它取自直播回放(2026-08-31 场次,1:14:56 处),不是投稿切片。 这证明她的表演模式画面——背景替换、模型染色、overlay、运镜—— 全部是 OBS 实时完成的,不是后期剪辑。已验证
| 维度 | 聊天模式 | 表演模式 |
|---|---|---|
| 色调 | 粉白高亮 | 暗色夜景,冷调降饱和 |
| 打光 | 平光,零色偏 | 侧光 / 轮廓光,明暗结构清晰 |
| 画幅 | 满幅 | 上下 letterbox 遮幅 |
| UI | 极密:聊天窗、时间卡、航海进度、点歌列表、二维码、域名水印 | 全部清空,只留竖排歌词 |
| 背景 | 浅粉房间 | 暗色都市 bokeh;一首歌一套视觉 |
可以搬到真人身上的
| 手法 | 真人能不能搬 | 说明 |
|---|---|---|
| letterbox 遮幅 | 可以 | 一张 PNG,成本最低效果最明显 |
| UI 清空 | 可以 | 唱歌场景不放贴片 |
| 背景变暗 / 色调转冷 | 有条件 | 需 AI 抠像分层,或物理灯 |
| 歌名 / 歌词条 | 可以 | 她已经有歌词了 |
| 模型侧光、轮廓光 | 搬不了 | 硬约束:真人的光在物理世界,后期加不出方向光。软件只能做假轮廓光 |
背景替换——模型自带透明通道,换背景零成本;真人需要抠像或绿幕。
全身染色——VTube Studio 的 Display Light Overlay 抓屏幕平均色 tint 到模型上, 让角色「浸」在环境光里;真人这么做等于毁肤色。
所以她那套洋红霓虹迁移到真人,只能保留 overlay、暗角、运镜和边缘光, 环境色必须靠物理灯或背景压暗来近似。
横向扫描的结论
国内单人唱见
B站唱见分区在播样本:清一色柔光美学,没有人做双 look。 单循小猫本人的画面质量在这批里属于上游。
国内团播
确实在做舞台效果,但全是物理搭建——LED 背景屏 + 真实灯具 + 棚。 重资产路线,与单人主播不可比。原则一致:动背景,不动脸。
Twitch 真人音乐
灯光普遍不如西野柚子。有主播整个房间被 RGB 紫光笼罩、脸也被染色——反面教材。 他们强的是运营层:点歌队列、曲目条、目标进度条。
工具生态
国外工具成熟(VNyan 的 audio-reactive lights、Warudo、Lumia Stream、Captivate、TouchDesigner), 但没有一个在做「模式切换」本身——全是单点能力。
西野柚子那套双 look 是她自己在 OBS 里手搭两组场景做出来的,没有产品化过。 而她做对的最关键一点——表演时把 UI 全清空——恰恰是纯灯光工具永远覆盖不到的, 因为那属于场景编排层。