打开全部章节
使用文档/参数与设置/高级字幕参数参考
参数与设置

高级字幕参数参考

完整查看当前全部用户可调字幕字段。

这个功能是做什么的

逐项说明识别模型、精度、CPU 兼容、分块、VAD、提示词、重试和失败策略。

在哪里

设置 → 任务默认值 → 字幕档案。

怎么操作

  1. 1

    先使用推荐预设完成一个小任务。

  2. 2

    只修改一个有明确测试目标的字段。

  3. 3

    保存后用新任务比较。

  4. 4

    结果无改善时恢复预设。

推荐怎么设置

  • 普通用户直接使用默认预设即可。
  • 计算精度、Beam Size、VAD、CPU 兼容、重试和失败策略建议保持预设值。

注意事项

  • CPU 兼容开启后会使用 CPU 路径,半精度选项会转为 int8。

全部字幕参数

参数作用当前默认可选范围调整影响推荐风险恢复
识别模型选择新任务使用 V3 Turbo(快速识别)或 V3(高质量识别);保存后不会自动切换。未选择,必须明确选择V3 Turbo(快速识别) / V3(高质量识别)这是离散选择,不适用调高或调低。普通用户先选 V3 Turbo(快速识别)。所选模型未安装时,任务不会自动换用另一个模型。选择推荐模型并保存“平衡”预设。
CUDA Compute Type选择字幕识别加载时使用的计算精度;CPU 路径遇到 float16 或 int8_float16 会改用 int8。int8_float16(平衡档案)自动 / float16 / int8_float16 / int8 / float32这是离散选择;当前项目测试未给出各选项的统一效果排序。保持预设值。不合适的精度可能导致当前设备无法加载或改走 CPU 兼容精度。重新选择字幕预设并保存。
允许 CPU 慢速兼容开启后让字幕识别与对齐使用 CPU 兼容路径。关闭关闭 / 开启开启会使用 CPU 路径;关闭时优先使用可用的 CUDA 路径。只有明确需要兼容排查时再开启。CPU 路径可能明显变慢。重新选择任一内置字幕预设并保存。
识别分块(秒)按该时长把音频切成连续识别区间,并作为任务检查点。60 秒15–600 秒调高会生成更少、更长的识别分块;调低会生成更多、更短的分块。保持推荐预设值。当前项目没有证明某个自定义时长在所有素材上效果最好。选择“平衡”并保存。
Beam Size原样传递给字幕识别引擎。11–10当前项目没有提供足够测试证据对调高或调低的质量、速度影响作统一结论。保持预设值。随意修改可能改变识别行为和资源使用。选择“平衡”并保存。
启用 VAD决定是否把 VAD 过滤开关传给字幕识别。开启关闭 / 开启开启时识别调用包含 VAD 过滤;关闭时不启用该过滤。保持开启。项目测试没有证明关闭适合所有素材。选择“平衡”并保存。
VAD 阈值(%)VAD 开启时,把阈值直接传给字幕识别。50%10%–90%当前项目没有提供足够测试证据说明任意调高或调低对所有素材的统一影响。保持 50%。随意修改可能改变语音片段过滤结果。选择“平衡”并保存。
初始提示词非空内容会作为识别初始提示;专有名词也会与它合并后传入。空0–2000 个字符填写会增加提供给识别引擎的上下文;留空不附加自定义提示。普通用户留空。不准确的提示可能影响识别文本。清空内容并保存。
人名与专有名词按逗号、顿号或换行拆分后,与初始提示词一起传给识别引擎。空列表最多 1000 项增加条目会把这些词加入识别提示;删除条目会移除对应提示。只有固定人名或专有名词时填写。错误或过多词条可能影响识别文本。清空内容并保存。
单块重试字幕分块处理失败时,控制每个分块可再次尝试的次数。3 次0–10 次调高允许更多尝试并可能延长等待;调低会更早结束失败分块。保持 3 次。更多重试不能修复缺失模型或持续环境错误。选择“平衡”并保存。
生成词级时间戳决定识别调用是否请求词级时间信息。开启关闭 / 开启开启会请求词级时间信息;关闭则不请求。保持开启。关闭会减少后续可用的词级时间信息。选择“平衡”并保存。
对齐失败时决定中文字幕时间对齐失败后保留识别时间继续,还是停止任务。保留识别时间保留识别时间 / 停止任务这是离散选择,不适用调高或调低。普通用户选择“保留识别时间”。选择停止任务后,对齐失败会直接结束当前字幕任务。选择“平衡”并保存。

常见问题

这篇文档没有解决问题?

准备好关键信息,再联系 QQ 客服。

客服 QQ:250437319。请提供 NovaFlow 版本、错误截图、剧目名称、环境检查结果和任务诊断摘要。