Bioinformatics Advances
次世代シーケンシング革命は、群集構成を探索するための効率的かつ費用対効果の高い方法としてメタバーコーディングの確立を推進した。原核生物の16S rRNA遺伝子などの分類マーカー遺伝子のアンプリコンシーケンシングは、ハイスループット分類プロファイリ…
大規模な細菌比較ゲノム解析には、ゲノムアセンブリとその生物学的コンテキストを記述する包括的なメタデータが必要である。NCBI Genomeにはアセンブリが、BioSampleには採取日、宿主、場所などの重要なコンテキストフィールドが保存されているが、統合され…
アセンブリグラフは、ゲノムおよびメタゲノムのアセンブラが配列とその重複情報を表現するために用いる基本的なデータ構造であり、より長いゲノム断片を構築する上で重要な役割を果たす。アセンブラでの本来の用途に加え、アセンブリグラフは、メタゲノムビ…
比較ゲノミクスや進化研究から精密育種に至るまで、現代のゲノミクスにおいて染色体レベルのアセンブリは不可欠である。HiFiデータとHi-Cデータを統合することで、現在では高精度な染色体スケールのゲノムアセンブリが可能になっているが、そのバイオインフ…
Ancestral recombination graphs (ARGs)は、組換えを起こす系統間の遺伝的関係を完全に表現したものであり、集団遺伝学において中心的な重要性を担っている。近年のシミュレーションおよび推論手法の飛躍的進歩により、ARGへの関心が高まっている。しかし、A…
本稿では、高性能コンピューティング(HPC)クラスタなどのリモートシステムでの利用を想定して設計された、高速で対話型のターミナルベースの多重配列アライメント(MSA)ビューアであるtermalを紹介する。従来のグラフィカルビューアとは異なり、termalは…
SurprisalAnalysisは、Surprisal分析を用いて生物学的プロセスの結果として発現上昇または発現低下する傾向のある遺伝子のパターンを抽出するWebベースのアプリケーションを備えたオープンソースのRパッケージである。Surprisal分析は、遺伝子発現値を熱力学…
バイオインフォマティクスパイプラインは、再現可能な解析を可能にするために、FAIR基準を満たす必要がある。FAIRは、再現可能な研究に必要な4つの主要要件、すなわち、検索可能性、アクセス可能性、相互運用性、再利用性を規定している。Singularityなどの…
ハイスループットシーケンシング(HTS)は、微生物学者の日常的な分析に不可欠な要素となっている。数十のサンプルをシーケンシングするプロセスでは、手作業ではアノテーションを付与できない膨大な量のデータが生成される。この課題に対処するため、長年に…
出版物レベルの可視化を作成することはバイオインフォマティクスにおいて不可欠であるが、コーディングの専門知識が限られている研究者にとっては依然としてボトルネックとなっている。大規模言語モデル(LLM)はコード生成に長けているが、ライブラリの依存…
FastGAは、同等の感度を持つ従来手法と比較して1桁以上高速に2つのゲノム配列間のアラインメントを発見する。その高速性は以下の要因による:(a) MSD基数ソートとマージのみを伴う完全キャッシュローカルアーキテクチャ、(b) ソート済みk-merテーブルの線形…
ウイルスゲノムのシークエンシングと解析は、ウイルスの多様性と進化を理解する上で極めて重要である。従来のサンガーシークエンシングはシークエンスデプスが低く、労力を要するという制約があった。イルミナなどの次世代シーケンシング(NGS)法はシークエ…
遺伝子オントロジー(Gene Ontology)システムは、遺伝子を特定の生物学的プロセス、細胞構成要素、および分子機能に分類することで、遺伝子の機能的注釈付けを容易にする。DAVIDやEnrichrなど多くのツールが存在するものの、非モデル生物の解析は遺伝情報や…
2025/03/19 追記 シーケンスデータの品質管理は、多くのシーケンスワークフローの最初のステップである。ショートリードおよびロングリードシーケンス技術には、品質管理に関して多くの共通点がある。品質管理プログラムはいくつか存在するが、両方のテクノ…
2025/02/14 condaインストール追記(conda) 深くシークエンシングされ、de novoアセンブルされたトランスクリプトームのアノテーションは、最新のツールの中には動作が遅く、インストールが難しく、使いにくいものがあるため、依然として難題である。TransAnn…
2024/10/31追記、論文引用、11/02追記 プロテオーム全体にわたる新しいタンパク質間相互作用(PPI)を発見することは、新しいタンパク質の機能を理解し、生物内あるいは生物間のシステム特性を解明する上で大きな可能性をもたらす。近年の計算構造生物学、特…
2026/01/17 論文引用 高品質なリファレンスゲノムを用いた生物多様性研究の取り組みが活発化し、さまざまな生物の塩基配列決定が可能になっていることから、大規模ゲノムアセンブリのための最先端の方法論を取り入れた、アクセスしやすく、再現性が高く、使…
DeGeCIは、de Bruijn graphとして表現されるアノテーションされたミトコンドリアミトコンドリアゲノムのリファレンスデータベースを用いて、ミトコンドリア塩基配列から完全自動のde novo遺伝子予測を生成するコマンドラインツールである。入力ゲノムはこの…
MerCat2("Mer-Catenate2")は、オミックスデータ中のフィーチャーをロバストに解析するための、汎用性、並列性、拡張性、モジュール性を備えたソフトウェアパッケージである。MerCat2は、あらゆるプラットフォームからのHTSシークエンシングの生リード、ア…
過去数十年の間に多重配列アライメントのための手法開発が進歩したにもかかわらず、配列の長さが大きく異なるデータセットのアライメントは、特に入力配列に非常に短い配列(シークエンシング技術、または進化の過程で大きく欠失した配列)が含まれる場合、…
病原体やその系統の解析では、一塩基多型(SNP)を用いてその進化史を再構築することが一般的である。しかし、ゲノムワイドなSNPベースの系統樹がさらなる情報なしに解析されることはほとんどない。SNPのデータだけでなく、サンプルのメタデータも含めて解析…
パスウェイアノテーションは、生命科学における実験データを解釈し、意味を与えるための重要なツールである。このタスクのために数多くのツールが存在するが、最新世代のパスウェイエンリッチメント解析ツールであるネットワークベース法は、単に遺伝子の内…