恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

umi_tools使用

  • 首页
  • 资讯中心
  • /
  • umi_tools使用

相关资讯

树莓派AI视觉机械臂:边缘侧闭环系统实战指南 2026/9/30 1:35:26
Ubuntu 20.04 GNOME终端实现选中复制+右键粘贴 2026/9/30 1:35:26
ROS2期末测评卷设计:从通信机制到仿真实操的考点拆解 2026/9/30 1:35:26

最新资讯

STM32 通用串口 IAP 升级方案
12-Factor Agents 第 11 因子:Trigger From Anywhere,让 Agent 在用户所在的任何渠道被触发与响应
灰片调色适合什么素材
捉一只羊客服咨询AI流量赋能,捉一只羊科技重塑智能体验新标杆
【软考信息安全】第六章 认证主要产品与应用
OWASP Cheat Sheet Series 写作指南:从模板到发布的高质量安全速查表编写规范

今日推荐

模型优化器实战:从FP32到INT8的推理加速与精度平衡
LangGraph+FastAPI构建可审计AI编码助手
基于图像预处理与几何特征的人脸脸型发型搭配系统实现

本周热门

从像素到笔画:srt-whiteboard-animation骨架笔迹追踪实现(Zhang-Suen细化+8邻接追踪)
网站建设的英语怎么说?别只背单词,看完这套安全完整流程才敢上线
新手入门看这篇:建设网站加盟避坑指南与SEO实操

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

umi_tools使用

发布时间:2026/9/30 1:40:26
umi_tools使用 首先保存两个网址umi_tools github网址https://github.com/CGATOxford/UMI-toolsumi_tools 官方网址https://umi-tools.readthedocs.io/en/latest/1. 提取UMI信息到readnameumi_tools extract --bc-patternNNNNNNN --bc-pattern2NNNNNNN \ -I ./V300056107_L01_1069_1.fq.gz \ -S ./test.extract.reconcile.1.pe_1.fq \ --read2-in./V300056107_L01_1069_2.fq.gz \ --read2-out./test.extract.reconcile.1.pe_2.fq \ --ignore-read-pair-suffixes还可以加一个“--reconcile-pairs”如果是在rawdata处开始做 extract的时候这个是没必要的。报错1.Read pairs do not matchF300002275L1C001R0030000002/1 ! F300002275L1C001R0030000002/2这种不是真正的不匹配而是umi_tools的一个bug。可以用 --ignore-read-pair-suffixes 参数来忽略 “/”及以后的内容。通过master branch 安装的umi_tools有这个“--ignore-read-pair-suffixes”参数原来那个umi_tools的问题是这个工具与相应的python版本不对应的问题。https://github.com/CGATOxford/UMI-tools/issues/431 #这是umi_tools项目组成员的解答报错2. 如果出现Read pairs do not matchF300002275L1C001R0030000005 ! F300002275L1C001R0030000013说明这是fq1和fq2里面的reads不是一一对应的readname也对应不上。它在输出文件中只会输出配对的reads处理后的结果其他不配对的全都在标准错误中输出。这时候可以加“--reconcile-pairs”这样就允许read1和read2中的read name不匹配。问题3umi_tools 跑得太慢的问题https://github.com/CGATOxford/UMI-tools/issues/257解决方法是 输出文件不要加“.gz”格式后缀。我试过加了gz后缀耗时8小时左右不加差不多40分钟。我从一开始用python2然后换到python3.7 最后换到python3.6CTTGCAAGTCACTAGAGTGGTGCAGCCTATTTTTTAAAAGTCGTGTGTGTCCTCTTACCCAGTACTTCCTCTTCATATGCACCTTCCGCGCTGCTACAGCCTTGCATTTACTGCAGGGGAAATAGTTGACATAAAGATGTACTTGCGTATTAGGCACTCCGATTTCAAAGATTTACTCGTATATTGGTCAAAGATATACTF300002275L1C001R0030000002/1_CTTGCAACTTGCATGTCACTAGAGTGGTGCAGCCTATTTTTTAAAAGTCGTGTGTGTCCTCTTACCCAGTACTTCCTCTTCATATGCACCTTCCGCGCTGCTACAGCF300002275L1C001R0030000002/2_CTTGCAACTTGCATTTACTGCAGGGGAAATAGTTGACATAAAGATGTACTTGCGTATTAGGCACTCCGATTTCAAAGATTTACTCGTATATTGGTCAAAGATATACT2. 去低质量、含Nreads mapping, sort, index 略3. dedup 类似picard的markdupumi_tools dedup -I ./test.coordinate.sort.bam \ --output-statsdeduplicated \ -S ./test.marked_duplicates.directional.bam \ --method directional --paired注 --method 参数有5种可选值作者认为directional是最好的https://github.com/CGATOxford/UMI-tools/issues/435--paired 参数对于PE reads来说必不可少否则它会只输出read2不输出read1.dedup太慢解决方法https://github.com/CGATOxford/UMI-tools/issues/340The biggest thing you can do here to improve things is not generate the stats #也就是不要--output-statsdeduplicated 这个参数。结果比较coordinate.sort.bam 38078276 #before_dedupmarked_duplicates.adjacency.bam 35220427 #adjacencymarked_duplicates.cluster.bam 35219515 #clustermarked_duplicates.directional.bam 35219616 #directional作者团队成员推荐这个marked_duplicates.percentile.bam 35483003 #percentilemarked_duplicates.unique.bam 35483001 #uniquemarked_duplicates.picard.bam 34350858 #picardUMI序列设置In the default basic mode we specify the location of barcodes and UMIs in a read using a simple string.Ns specify the location of bases to be treated as UMIs,Cs as bases to treated as cell barcode andXs as bases that are neither and that should be retained on the read. By default this pattern is applied to the 5’ end of the read, but we can tellextractto look on the 3’ end of the read using--3-primehttps://umi-tools.readthedocs.io/en/latest/regex.html一个extract的例子umi_tools extract \ --extract-method string \ --bc-patternNNNNNNN \ --bc-pattern2NNNNNNN \ -I /in_dir/F350071577_L01_23_1.part_001.fq.gz \ -S /out_dir/extract.1.pe_1.fq \ --read2-in/in_dir/F350071577_L01_23_2.part_001.fq.gz \ --read2-out/out_dir/extract.2.pe_2.fq \ --ignore-read-pair-suffixes用正则表达式更好可以区分UMI和容错碱基不将容错碱基错误纳入UMI。umi_tools extract \ --extract-method regex \ --bc-pattern^(?Pumi_1.{6})(?Pdiscard_1.{1})(.*)$ \ --bc-pattern2^(?Pumi_2.{6})(?Pdiscard_2.{1})(.*)$ \ -I /in_dir/F350071577_L01_23_1.part_001.fq.gz \ -S /out_dir/extract.1.pe_1.fq \ --read2-in/in_dir/F350071577_L01_23_2.part_001.fq.gz \ --read2-out/out_dir/extract.2.pe_2.fq \ --ignore-read-pair-suffixes注意umi_1discard_1之类的前缀不能变数字可以递增。但在PE reads条件下umi_1只能针对read_1, umi_2针对read_2, discard_*也是同理。umi_*的序列进入read_name从read序列和质量值序列(对应长度)删除。discard_*的序列直接丢弃不进入read_name从read序列和质量值序列(对应长度)删除。其他匹配内容拼接并保留到read序列和质量值序列(对应长度)中。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号