macでインフォマティクス

macでインフォマティクス

NGS関連のインフォマティクス情報についてまとめています。

format

review article要約 SNPs callingビギナーズガイド

8/24 誤字修正 A beginners guide to SNP calling from high-throughput DNA-sequencing data (Andre ́ Altman et al., 2012)より ハイスループットDNAシークエンシング(HTS)は、ライフサイエンスにおいてますます重要になっている。その最も顕著な用途…

データに適したグラフフォーマットとその描画コードを教えてくれる From Data to Viz

From Data to Vizは、決定木(wiki)を使ってデータの可視化に適したフォーマットを教えてくれるwebサイト。 From Data to Vizに関するツイート。 From data to Viz | Find the graphic you need 下記の決定木を使い、自分の所有しているデータタイプに適し…

高速なロング/ショートリードアライナー minimap2

Single Molecule Real-Time(SMRT)シークエンシング技術とOxford Nanopore technologies(ONT)は、10kbp以上の長さのリードを約15%のエラー率で生成する。そのようなデータのためにいくつかのアライナーが開発されている(論文より Chaisson and Tesler、…

BEDフォーマット

UCSCのゲノムブラウザーなどで使うフォーマット。最初の3列が必須で、オプションでさらに9列情報がつく場合がある。 最初の3列に記載する情報 クロモソームの名前(e.g., chr1) リードや遺伝子のスタートポジション(ポジションは1でなく0スタート) リー…

GTFとGFFフォーマット

GTFはgeneのアノテーション専用のフォーマットと定義されている。それに対してGFF3はtranscriptなどにも使えるよりジェネラルなフォーマットとなっている。この違いのため、例えばUCSC genomeではgeneアノテーションファイルはgtfフォーマットでのみダウンロ…

バリアントコール結果のVCFフォーマット

2018 10/25 追記 次世代データからリファンレンスゲノムの変異検出を行うと、Variant Call Format(VCF)という形式で出力されることが多い。VCFの詳細はsamtoolsのVCFフォーマットオフィシャルページに書いてあるが、そのフォーマットについてもう少し噛み…