macでインフォマティクス

macでインフォマティクス

HTS (NGS) 関連のインフォマティクス情報についてまとめています。

プラスミドアノテーションパイプライン PlasAnn

2026/08/14 追記

 

接合伝達性プラスミドは、多様な微生物集団内および集団間でのアクセサリー遺伝子の水平伝播を可能にし、細菌の適応における重要な推進力となっている。しかし、その遺伝子構造は高度にモザイク状であり、遺伝子命名法も不統一であるため、機能予測や比較解析が困難であり、アノテーション(注釈付け)を行う上での課題となっている。こうした課題に対処するため、本著者らは天然プラスミド上の遺伝子に特化したデータベース「PlasAnn」と、それに対応する専用のアノテーション・パイプラインを開発した(Biocondaまたはウェブサイト https://plasann.rochester.edu/ から利用可能)。精選された本データベースは、標準化された機能アノテーションを伴う、高精度かつプラスミド型特異的な遺伝子名を提供する。これにより、専門的な知識や手作業による修正を必要とせずに、プラスミド間での直接的な比較が可能になる。また、統合されたアノテーション・ツールは、プラスミドの他の一般的な特徴も考慮しており、迅速かつ包括的なソリューションとして、汎用的な原核生物ゲノムアノテーション・パイプラインよりも高い精度と効率を実現している。PlasAnnの有用性を実証するために、以下のことを示した。すなわち、異なるグループのプラスミド由来アクセサリー遺伝子がしばしば保存された遺伝子レパートリーを共有していること(これは遺伝子同士が相互接続された動的かつモジュール的なネットワークの存在を示唆している)、およびプラスミド上のトランスポゾンが、抗生物質耐性以外にも代謝、病原性、ストレス応答といった細菌の適応に関わる遺伝子を頻繁に運んでいること(これは適応度や適応能力に対するプラスミドのより広範な寄与を強調するものである)。現行の標準的なツールでは捉えきれなかったこれらの知見は、PlasAnnがいかにプラスミドのアノテーションを改善し、プラスミド生物学、微生物生態学、そして進化に関する我々の理解を深めるものであるかを示している。

 

HPは現在アクセスすることができない。=>  8/14 アクセスできることを確認

https://plasann.rochester.edu/

(メンテナンス中か、あるいは既に消えている可能性がある *1)

 

Start analysisからオンラインでアノテーションできる(未テスト)。

 

インストール

Github

#mamba
mamba create -n plasann_env -c conda-forge -c bioconda plasann -y
conda activate plasann_env

> PlasAnn --check-deps

Matplotlib is building the font cache; this may take a moment.

🔍 PlasAnn v1.1.6 - External Dependency Status:

   ✅ makeblastdb (BLAST+) - Found

   ✅ blastn (BLAST+) - Found

   ✅ blastx (BLAST+) - Found

   ✅ blastp (BLAST+) - Found

   ✅ prodigal (Prodigal) - Found

   ✅ cmscan (Infernal) - Found

   ✅ cmpress (Infernal) - Found

 

✅ All external dependencies are installed!

🚀 PlasAnn is ready to use!

O.K !

> PlasAnn -h

usage: PlasAnn [-h] [--version] [--check-deps] [-i INPUT] [-o OUTPUT] [-t {fasta,genbank,auto}] [-n NAME] [--overwrite] [--retain] [--uniprot-blast] [--uniprot-tsv UNIPROT_TSV]

               [--min-identity MIN_IDENTITY]

 

PlasAnn v1.1.6 - Comprehensive Plasmid Annotation Pipeline

 

🧬 Features:

  • Gene prediction (Prodigal) and functional annotation (BLAST)

  • Mobile element detection (oriC, oriT, transposons, replicons)

  • ncRNA detection (Infernal/Rfam) and intergenic gene discovery

  • Optional UniProt BLAST enhancement for comprehensive annotation

  • Beautiful circular plasmid visualizations

  • Batch processing with auto-detection of mixed file types

 

📖 For detailed documentation, visit: https://github.com/ajlopakin/PlasAnn

        

 

options:

  -h, --help            show this help message and exit

  --version             Show PlasAnn version and exit

  --check-deps          Check external dependency status and exit

  -i, --input INPUT     Input FASTA or GenBank file/folder

  -o, --output OUTPUT   Output directory

  -t, --type {fasta,genbank,auto}

                        Input type: fasta, genbank, or auto (auto-detect from folder)

  -n, --name NAME       Custom name for output subfolder (single files only - ignored for folders)

  --overwrite           Use Prodigal on GenBank sequence (ignore existing annotations)

  --retain              Use GenBank annotations with fallback to translation (default)

  --uniprot-blast       Run optional UniProt BLAST annotation (slow but comprehensive)

  --uniprot-tsv UNIPROT_TSV

                        Path to UniProt TSV file (default: Database/uniprot_plasmids.tsv)

  --min-identity MIN_IDENTITY

                        Minimum identity percentage for UniProt BLAST hits (default: 50%)

 

📚 Examples:

 

  Basic Usage:

    PlasAnn -i plasmid.fasta -o results -t fasta

    PlasAnn -i plasmid.gb -o results -t genbank

    PlasAnn -i mixed_folder/ -o results -t auto

  

  Enhanced Annotation:

    PlasAnn -i plasmid.fasta -o results -t fasta --uniprot-blast

  

  GenBank Processing Modes:

    PlasAnn -i plasmid.gb -o results -t genbank --retain   # Use original annotations

    PlasAnn -i plasmid.gb -o results -t genbank --overwrite # Re-annotate with Prodigal

  

  Batch Processing:

    PlasAnn -i fasta_folder/ -o results -t fasta

    PlasAnn -i mixed_folder/ -o results -t auto --uniprot-blast

  

  System Check:

    PlasAnn --check-deps

    PlasAnn --version

 

🔧 Dependencies: BLAST+, Prodigal, Infernal

   Install with: conda install -c bioconda blast prodigal infernal

 

💡 Tip: Use --uniprot-blast for comprehensive protein annotation (slower but thorough)

        

 

実行方法

PlasAnnは、FASTAまたはGenBankを入力として以下を注釈し、アノテーションつきのCSVとプラスミドマップを出力する。

  • CDS
  • gene name
  • functional category
  • oriV
  • oriT
  • replicon
  • transposable elements
  • ncRNA

 

データベースは初回実行時に自動ダウンロードされる。直接ダウンロードするなら、以下の通り。

curl -L  "https://zenodo.org/api/records/15583460/files/plasann_databases_v1.1.0.zip/content"  -o plasann_databases_v1.1.0.zip

 

PlasAnnはプラスミドのfastaファイルか、プラスfastaを含むディレクトリを指定して実行する。genbankにも対応している。

PlasAnn -i plasmid.fasta -o outdir -t fasta
  • -i     Input FASTA or GenBank file/folder
  • -o    Output directory
  • -t {fasta,genbank,auto}   Input type: fasta, genbank, or auto (auto-detect from folder)

 

出力例

outdir/

PBR322

annotations.csv

 

既存のGenBank注釈を使う。

PlasAnn -i plasmid.fasta -o outdir -t genbank --retain
  • --retain     Use GenBank annotations with fallback to translation (default)

 

Prodigalをランしてgenbankのアノテーションを上書きする。

PlasAnn -i plasmid.gb -o outdir -t genbank --overwrite
  • --overwrite     Use Prodigal on GenBank sequence (ignore existing annotations)

 

UniProtへBLASTサーチを行ってアノテーションを付ける。

PlasAnn -i plasmid.gb -o outdir -t genbank --uniprot-blast --min-identity 50
  • --uniprot-blast       Run optional UniProt BLAST annotation (slow but comprehensive)
  • --min-identity   Minimum identity percentage for UniProt BLAST hits (default: 50%)

 

その他 (論文より)

  • Prodigalは細菌ゲノムのCDS予測でよく使われるが、入力配列から遺伝子の特徴を学習して予測する。短い配列やORF数が少ないプラスミドでは、十分な学習ができず、CDS予測が不安定になりやすい。PlasAnnはCDS予測にProdigalなどを使うが、それだけで終わらず、intergenic regionsをPlasAnn databaseに対してBLASTX検索することで、Prodigalが見落とした既知CDSの回収も試みる。
  • Prokka、Bakta、DFAST、RASTなどは有用だが、基本的にはwhole-genome annotation向けであり、プラスミドの命名規則や多様性に最適化されていない。その結果、遺伝子名が曖昧になったり、hypothetical proteinが増えたり、比較解析に使いにくくなる。PlasAnn database v4.1.5 は、12,256 plasmid sequences と 227,714 annotated CDSs からなる。NCBI GenBankから完全長プラスミド配列を集め、文献との対応、サイズ、メタデータ、遺伝子名、AMR/TA/BacMetなどの外部DBと命名規則を使ってキュレーションしている。

引用

PlasAnn: a curated plasmid-specific database and annotation pipeline for standardized gene and function analysis 

Habibul Islam , Abhishek Sharma , Jordan Blair , Allison J Lopatkin

Nucleic Acids Research, Volume 54, Issue 3, 10 February 2026

 

関連

*1

Nucleic Acids ResearchにWeb ServerやDatabase系論文を出す場合、論文公開後も一定期間アクセス可能にすることが推奨されています。投稿ページには次の記述があります

It is expected that the website will be maintained for at least five years.

「NARに出すWebサイトは、少なくとも5年間維持されることが期待される。」

これは利用者にとっては非常に重要ですが、投稿する側からすれば非常に高いハードルとなります (サーバーの管理と保守、場合によっては計算資源の費用を払い続けないといけない)。ただ、それによってNARのWeb Server論文の品格と信頼性が高められているとも言えます。条件を承知でNARに投稿している以上、公開から間もない段階でサイトを落とすのは、やはり少し不義理な感じがします (しかも今年出たばかりならなおさら)。

ただこれは実はけっこう難しい問題でもあります。論文は一度出ればよしとする一方、Webツールはそこからも使える状態を保たないといけないからです。2026 updateのような更新論文を出せるぐらい使われていれば保守する理由も立ちますが、そうじゃなくて引用もつかないならいつまでも維持し続けるのは厳しくなります (NAR系では見られないが、ひどいときには、論文が出た直後にwebサイトを閉鎖するケースもしばしば観測される)。サーバーを非公開とする理由として、致命的なセキュリティエラーが発生して落としたほうが賢明という判斷が起きることもあるかもしれませんし、大学の規約変更、ハードウェアの致命的な故障、契約の変更で支払いが事実上不可能になることもあるかもしれません。時々使うwebツールに久しぶりにアクセスしたらアクセス出来なくなっていた、というのはやはり理由があるのでしょう。

逆にいえば、10年前のWebツールに今でもアクセスできるなら、それは著者の誰かか、その関係者がずっと維持してきたということになります。そのようなサイトの裏には、研究成果を一回きりの発表で終わらせず、公共物として維持する研究者の強い信念があるように感じます。