No testdata at current.
直播运营工具要做一个「口令式高光剪辑」能力:主播或运营用一句中文描述目标成片(例如「把今晚开播前 10 分钟剪成 20s 竖屏,突出互动笑点,节奏偏快」),系统自动完成素材理解、分镜脚本、剪辑时间线与配乐建议。落地时碰到四类工程问题:
(a) 端侧要跑约 7–8B 的多模态模型,产品要求首 token ≤280ms,但中端机上现有 INT4 方案仍约 750–800ms;
(b) 需要从成百上千条短片段里做语义召回与关键帧定位,当前 CLIP 向量检索 Top 命中率大约六成;
(c) 每个账号有自己的包装风格(活泼 / 纪录片 / 电影感),希望少样本就能跟上,但通用模型零样本输出经常跑偏;
(d) 请求可能在端侧完成,也可能上云;弱网、断网与隐私敏感片段如何分流,还没有可执行的路由协议。
请给出可落地的系统方案,至少回答:
1) 针对 (a),分别从
(i) 注意力 KV 结构(GQA / MLA 等)、
(ii) 权重量化 / 压缩(AWQ / SmoothQuant / NF4 等)、
(iii) 投机或多头解码加速(Speculative Decoding / Medusa 等)
各选 1 条改造,并定性估计对首 token 或吞吐的收益;
2) 针对 (b),组合一套「视觉编码 + 视频时序建模 + 向量索引」方案(候选可包含 SigLIP / DFN / VideoMAE / VideoLLaMA / FAISS / Qdrant 等),并说明离线指标(如 Recall@k / mAP)与线上 A/B 怎么验收;
3) 针对 (c),在
(i) 上下文少样本、
(ii) 端侧 / 云侧轻量 LoRA、
(iii) 可存储的用户风格向量
三条路上给出取舍,比较隐私、存储与稳定性;
4) 写一个端云路由决策:输入为自然语言口令 + 设备算力/电量 + 网络质量 + 是否含隐私素材,输出走端或走云;至少 3 条规则,并说明超时/失败如何回退以及如何灰度放量。
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册