macでインフォマティクス

macでインフォマティクス

HTS (NGS) 関連のインフォマティクス情報についてまとめています。

Genome Biology

表現型マルチオミクスデータと微生物パンゲノムの迅速な関連付けを行う Scoary2

細菌の遺伝子機能解明は、食品生産、薬理学、生態学など様々な分野の進展を牽引している。オミクス技術が高次元の表現型データを捕捉する一方で、それらをゲノムデータと関連付けることは困難であり、細菌遺伝子の40~60%が未解明のままである。このボトル…

包括的な高品質MAGのデータベース MAGdb

微生物群集のメタゲノム解析は、メタゲノムアセンブリゲノム(MAG)の再構築により、種間および種内の遺伝的多様性が非常に高いレベルで存在することを明らかにした。MAGデータベース(MAGdb)は、臨床、環境、動物のカテゴリーにまたがる74の代表的な研究論…

メタゲノムリードの正確な分類を行う Centrifuger

Centrifugerは、微生物ゲノムデータベースとシーケンスリードを比較する効率的な分類手法である。Centrifugerでは、Burrows-Wheeler変換されたゲノム配列は、ランブロック圧縮と呼ばれる新しいスキームを用いて可逆圧縮される。ランブロック圧縮は線形以下の…

複数のゲノムから種を代表する代謝モデルを自動的に再構成する pan-Draft

未培養生物種のゲノムスケール代謝モデル(GEM)を正確に再構築することは、メタゲノムアセンブリゲノム(MAG)に典型的に見られる不完全で断片的な遺伝情報のために困難である。既存のツールは単一ゲノムの配列相同性を利用しているが、本研究ではpan-Draft…

HiFiリードを使う複雑な植物オルガネラゲノムのde novoアセンブリツール Oatk

植物オルガネラゲノム、特に複雑な繰り返し構造を持つ巨大なミトコンドリアゲノムは、アセンブリにとって大きな課題である。ロングリードシーケンス技術の登場は、完全長のゲノムを構築する画期的な機会を提供するが、代替構造を解決する問題は依然として残…

(主に動植物)遺伝子ノテーションの品質向上のためのシンテニーベースのツールキット SynGAP

2024/09/06 追記 ゲノム配列決定は生物学者にとって日常的な作業となったが、遺伝子構造アノテーションの課題は依然として残っており、正確なゲノム・遺伝子研究を妨げている。SynGAPは、遺伝子のシンテニー情報を利用して、ゲノムの遺伝子構造アノテーショ…

細菌の種レベル以上でのパンゲノム計算のための包括的コアゲノムアノテーションパイプライン RIBAP

2024/09/03 追記, 9/5追記 微生物パンゲノム解析は、原核生物ゲノム中の遺伝子の有無を同定する。しかし、現在のツールでは、配列の多様性が高い種や、属や科のような分類学上の上位の種を解析する場合には限界がある。Roary ILP Bacterial core Annotation…

タンパク質の機能的アノテーションを行う AnnoPRO

タンパク質の機能アノテーションは生物科学における長年の課題の一つであり、様々な計算手法が開発されてきた。しかし、既存の方法では、GOファミリーの数が多く、アノテーションされたタンパク質が少ないという深刻なロングテール問題に悩まされている。そ…

可変長タンデム反復配列のアノテーション(多型コール)を行う vamos

ヒトゲノムのおよそ3%は可変反復配列(VNTR)で構成されている。これらの遺伝子座は多型性が高いが、アラインメントのブレイクポイントに基づいてバリアントを定義しマージする現在のアプローチでは、その多様性を完全に捉えることはできない。ここではvamo…

ロングリードのハプロタイプを考慮したエラー訂正を行う HERRO

20240419 タイトル修正 2024/08/05 引用の間違い修正 2025/01/22 テストラン追記 注;論文のタイトルにはHEROと書かれてますが、レポジトリではHERROとなっています。ここではHERROで統一します。 追記 HEROとHERROを混同していました。コメントで教えていた…

セントロメア構造の自動アノテーションツール HiCAT

ロングリードシーケンス技術の著しい向上により、ゲノム中のセントロメアのような複雑なゲノム領域が解明され、セントロメアのアノテーション問題が導入された。現在、セントロメアのアノテーションは半手動的に行われている。HiCATは、階層的タンデムリピー…

メタゲノムロングリードの分類学的分類と定量を行う Melon

2024/09/04 論文引用 ロングリードシーケンスは、複雑な微生物群集の特徴を明らかにする上で大きな可能性を秘めているが、ロングリード専用に設計された分類学的プロファイリングツールはまだ不足している。ここでは、ロングリードのユニークな特性を生かし…

DegNorm

2023/07/10 インストール手順修正 RNA-seqは現在、ハイスループットシークエンシング技術を使用して転写活性をプロファイリングするための最も一般的な方法である。転写産物長の単位あたりのシークエンシングタグカウントは、転写産物の相対存在量を測定する…

機械学習と言語モデルによる高速、正確、包括的なオーソログ推論を行う SonicParanoid2

オルソログ遺伝子を正確に推論することは、様々なゲノム研究や進化研究の必須条件である。SonicParanoidはオルソロジー推論に最も適したツールの1つである。しかし、その拡張性と感度は、それぞれ時間のかかるall-versus-allアラインメントと複雑なドメイン…

遺伝子ファミリーの起源を推論する GenEra

GenEra(https://github.com/josuebarrera/GenEra)は、DIAMONDを用いたgene-family founder inference framework(遺伝子ファミリーの起源となる遺伝子の推論フレームワーク)で、ゲノム系統分類における相同性検出の失敗など、これまで指摘されてきた限界…

ロングリードシーケンスデータを用いてトランスポーザブルエレメントのアレル頻度推定を行うTrEMOLO

Transposable Element MOnitoring with LOng-reads(TrEMOLO)は、アセンブリベースとマッピングベースのアプローチを組み合わせた新しいソフトウェアで、トランスポーザブルエレメント(TE)と呼ばれる遺伝要素を強固に検出することができる。TrEMOLOは、高…

複雑な微生物群集から個々のゲノムを回収するアンサンブルビニング法 MetaBinner

ビニングは、メタゲノムデータから微生物ゲノムを復元することを目的としている。複雑なメタゲノムコミュニティに対して、利用可能なビニング手法は満足できるものではなく、通常、異なる種類の特徴や重要な生物学的知識を十分に利用できていない。本著者ら…

複数の遺伝子モデルを統合する EVidenceModeler

2023/02/15 追記 EVidenceModeler (EVM) は、真核生物の遺伝子構造を自動アノテーションするツールであり、真核生物の遺伝子構造を、利用可能なすべての証拠の重み付きコンセンサスとして報告するものである。EVMは、Program to Assemble Spliced Alignments…

微生物パンゲノム解析のスコア付けを行う Scoary

2024/04/09 追記 2025/04/17 インストール追記 ゲノムワイド関連研究(GWAS)は、ヒトの医学やゲノミクスにおいて不可欠なものとなっているが、細菌を対象とした研究はほとんど行われていない。本発表では、パンゲノムの構成要素について、観察された表現形…

MinHashスケッチで数百万個のバクテリアゲノムの高速クラスタリング解析を可能にする RabbitTClust

スケッチベースの距離推定に基づく、高速でメモリ効率の良いゲノムクラスターツールRabbitTClustを紹介する。本手法は、次元削減技術とストリーミング、最新のマルチコアプラットフォーム上での並列化を組み合わせることで、大規模データセットの効率的な処…

STRONG

複数のメタゲノムサンプルからde novoで株を同定するSTrain Resolution ON assembly Graphs (STRONG)を紹介する。STRONGはメタゲノムアセンブリゲノム(MAG)に対してコアアセンブリとビニングを行い、バリアント簡略化の前にコアアセンブリグラフを保存する。…

一塩基変異や逆転写酵素によるアレストイベントを検出する JACUSA2

シーケンシングデータからRNA修飾を検出するためのハイスループットな抗体不要の方法がいくつか開発されている。ここでは、IlluminaまたはNanoporeプラットフォームをベースとするRNA修飾検出アッセイのための多用途ソフトウェアソリューションおよび包括的…

関心のあるあらゆる生物のWGSデータセットに対して、SV、SNP、IN/DEL、およびCNVのコールとアノテーションを実行する PerSVade

2022/08/22 オプション追記 構造バリアント(SV)はゲノムの変異の根底にあるものだが、ショートリードからの検出が困難なため、見落とされることがよくある。ほとんどのアルゴリズムはヒトでテストされており、他の生物にどの程度適用できるかはまだ不明で…

シングルブレイクエンドバリアントと構造バリアントのフェージングにより体細胞構造変異の包括的な評価を行う GRIDSS2

GRIDSS2 は、片側のみが明確に決定できるブレイクポイントであるシングルブレイクエンドを明示的に報告する初めての構造的バリアントコーラーである。シングルブレイクエンドをブレイクポイントと同様に基本的なゲノムリアレンジメントシグナルとして扱うこ…

ロングリードのアセンブラ NextDenovo

2022/06/09 追記 2024/04/28 論文追記、05/23追記 Githubより NextDenovoは、ロングリード(CLR、HiFi、ONT)用のストリンググラフベースのde novoアセンブラです。canuと同様に "correct-then-assemble "戦略を採用していますが(PacBio HiFiリードは修正ス…

ハプロタイプを考慮してロングリードシーケンスからマッピング困難な領域のSNPやインデルを正確に検出する NanoCaller

ロングリードシーケンスでは、ショートリードシーケンスではマッピングが困難とされているゲノム領域でのバリアント検出ができる。この手法では、長距離ハプロタイプ情報を用いてSNPを検出し、検出されたSNPとロングリードを位相合わせし、ローカルリアライ…

配列のアノテーションに用いられる Sequence Ontology

Sequence Ontology(SO)は、配列のアノテーションに用いられる、配列の特徴を定義するための共同オントロジー・プロジェクト。SOのサイトでは、既存のオントロジーを確認することができる。簡単に見ていきます。 Request A Term https://github.com/The-Seq…

アセンブリの内容をどれだけ反映したコールであるかに基づいてSVコールを評価する TT-Mars

大規模なシークエンス研究により、一般的な構造バリアント(SV)やレアバリアントなどの遺伝子バリアントと形質や疾患との関連付けが可能になった。SVには、欠失、挿入、重複、50塩基以上のリアレンジメントが含まれ、これらは遺伝的多様性、発達障害、ガン…

DESeq2

2022/05/09 誤字修正、インストール手順修正(ggplot) 2022/06/09 heatmapのコマンド修正. 10/24 インストール手順修正(Rのバージョン4指定) 2023/06/18 追記 2024/02/27 docker image例追記 比較ハイスループットシーケンスアッセイでは、RNA-seqにおける…

系統樹検索エンジン SHOOT.bio

遺伝子間の進化的関係を明らかにすることは、比較生物学研究の基本である。ここでは、SHOOTを紹介する。SHOOTは、ユーザからのクエリー配列を系統樹のデータベースと照合し、クエリー配列が正しく配置された系統樹を返す。SHOOTはBLAST検索に匹敵する速度で…