恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

CTC和 seq2seq

  • 首页
  • 资讯中心
  • /
  • CTC和 seq2seq

相关资讯

向量数据库复合查询:融合元数据过滤与语义搜索的工程实践 2026/8/15 21:23:19
Office默认个人模板位置精准定位与高效管理全攻略 2026/8/15 21:23:19
AI推理优化实战:从模型压缩到服务化部署的开发者指南 2026/8/15 21:23:19

最新资讯

【RAG】知识图谱 RAG 与可验证引用案例讲解
商家AI合伙人:碰省钱 TapSave 如何用五大 AI Agent 重构实体店引流与分润体系
STM32 HAL库FLASH编程实战:从基础操作到产品级应用
前端实现HTML转PDF:html2canvas与jsPDF实战指南
CTF逆向工程实战:从入门到企业级应用
Claude Code Tools计划模式:从AI意图解析到多步骤开发任务自动化

今日推荐

内景 空间站内部 中国空间站 太空 内仓
重新定义数据接口:3个突破性场景让通达信数据读取更智能
5大网络安全实操平台,免费练手入门,轻松掌握攻防技能

本周热门

5分钟告别提取码焦虑:baidupankey如何智能破解百度网盘资源锁
如何快速生成中国车牌图片:Python开源工具完整指南
当 LLM 遇见大文档:主流开源项目如何处理上下文超限

本月精选

如何用DamaiHelper实现演唱会门票的智能自动化抢购:完整技术解决方案指南
第4篇:59 倍性能差距的索引瓶颈定位——一次教科书级的全表扫描调优
终极歌词批量下载神器:5分钟解决离线音乐库歌词同步难题

CTC和 seq2seq

发布时间:2026/8/15 21:23:19
CTC和 seq2seq CTC和seq2seq都是用来做“输入一段连续动作输出一串词”的方法。CTC 是 Connectionist Temporal Classification。它适合这种情况输入帧: 1 2 3 4 5 6 7 8 9 10 ... 标签: 我 爸爸 是 医生问题是我们不知道哪些帧对应“我” 哪些帧对应“爸爸” 哪些帧对应“是” 哪些帧对应“医生”CTC 的作用就是不用人工标注每个 gloss 的起止帧也能训练模型输出 gloss 序列。模型每一帧都预测一个类别包括一个特殊的blank空白类。比如模型可能输出blank 我 我 blank 爸爸 爸爸 blank 是 blank 医生 医生CTC 解码时会去掉重复 去掉 blank最后得到我 爸爸 是 医生所以 CTC 很适合连续手语识别 CSLR因为 CSLR 通常只有整句对应的 gloss 序列没有每个 gloss 的精确时间边界。seq2seq 是 sequence-to-sequence。它把任务看成输入序列 - 输出序列例如pose帧序列 - gloss序列 pose帧序列 - 中文句子典型结构是 Encoder-DecoderEncoder 读取整段动作 Decoder 一个一个生成输出词比如 Decoder 生成我 - 爸爸 - 是 - 医生 - eos它更像机器翻译。优点是表达能力强可以处理更灵活的输出缺点是训练和解码更复杂需要 BOS/EOS、teacher forcing、beam search 等机制。对你这个数据区别可以这样理解方法输入输出是否需要 gloss 起止帧适合第一版吗句子分类整句 pose100 个句子类之一不需要最简单CTC整句 posegloss 序列不需要适合seq2seq整句 posegloss 序列或中文句子不需要更复杂帧级分类每帧 pose每帧 gloss需要你现在没有这个标注所以我建议你现在先做 CTCpose-sentence - CTC - gloss序列原因是它正好适合sentence_gloss_map.txt这种“整句对应 gloss 序列但没有每个词起止时间”的数据。CTC 和 seq2seq 不是“网络结构路线”而是“输出序列的训练/解码范式”。卷积、RNN、Transformer、GCN 都可以和它们组合。可以这样拆开理解特征提取/编码器: CNN / TCN / RNN / Transformer / GCN 训练目标/解码方式: 分类 / CTC / seq2seqCTC 不等于卷积。CTC 只要求模型输出一串逐时间步的概率[B, T, vocab_size blank]至于这个输出怎么来很多结构都可以pose - TCN - CTC pose - BiLSTM - CTC pose - Transformer Encoder - CTC pose - GCN TCN - CTC video - CNN BiLSTM - CTC video - CNN Transformer - CTC早期语音识别、OCR、连续手语识别里经常是CNN/RNN CTC。现在连续手语里也常见CNN/GCN/Transformer/TCN CTC。所以 CTC 是“对齐损失”不是卷积路线。seq2seq 也不等于卷积。seq2seq 的核心是Encoder 编码输入序列 Decoder 自回归生成输出序列常见实现有RNN Encoder-Decoder CNN Encoder RNN Decoder Transformer Encoder-Decoder Conformer Encoder Transformer Decoder现在更常见的是 Transformer 风格不是单纯卷积。卷积可以作为前端特征提取比如视频帧先用 CNN 提空间特征然后再交给 Transformer/RNN 建模时间关系。对你这个 pose 数据比较合理的路线是第一版: pose - Transformer Encoder / TCN Encoder - CTC - gloss序列也可以更轻量: pose - TCN - CTC或者更复杂: pose - Transformer Encoder - Transformer Decoder - seq2seq gloss序列我的建议仍然是先做 CTC baseline。因为你的数据只有“整句对应 gloss 序列”没有每个 gloss 的起止帧CTC 正好解决这个弱对齐问题seq2seq 后面可以作为更强模型再加。谁更优没有绝对谁更优取决于数据规模、标注形式和目标。对你现在的CSL2018 sentence pose - gloss 序列这个任务我建议先 CTC后 seq2seqCTC 的优势更适合只有“整句 gloss 序列”、没有 gloss 起止帧的数据训练更稳定实现简单小数据集上更容易跑出 baseline解码简单greedy decode 就能用连续手语识别 CSLR 里很常见CTC 的劣势假设输出顺序基本和输入时间顺序单调对应对语言建模能力弱容易漏词、重复、插入 blank如果句子复杂、上下文依赖强表达能力有限seq2seq 的优势表达能力更强可以学更复杂的上下文关系可以结合 attention / Transformer decoder / beam search更适合从手语直接翻译到自然语言句子也就是 SLTseq2seq 的劣势训练更复杂更吃数据量小数据集容易过拟合解码更复杂需要处理bos eos pad、teacher forcing、beam search 等细节如果没有足够数据效果不一定比 CTC 好简单对比维度CTCseq2seq实现难度低高训练稳定性较好更难小数据适配更好较差输出能力中等更强是否适合 gloss 识别很适合也适合是否适合手语翻译一般更适合解码复杂度低高你的情况比较特殊pose-sentence只有 100 个固定句子每个句子对应 gloss 序列。这个规模不大。直接上 seq2seq 很可能模型学到的是“句子模板记忆”而不是稳定的连续识别能力。所以我建议第一版做pose - Transformer/TCN Encoder - CTC - gloss序列目标是先建立完整 CSLR pipeline数据转换 - gloss vocab - CTC dataset - CTC model - 训练 - greedy decode - WER评估等这个 baseline 跑通后再加pose - Encoder-Decoder Transformer - seq2seq gloss序列这样你可以在同一份数据上比较CTC WER vs seq2seq WER这比一开始判断“谁更优”更可靠。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号