web tool
科学分野の基盤モデルは、多様なデータモダリティから高次元の表現を学習するが、それらが具体的に何を符号化しているのか、またその知識をどのように抽出するのかは、依然として未解明の課題である。本研究では、70億パラメータを持つゲノム基盤モデル「Evo…
現在、「生命の樹(tree of life)」の全体像を利用できるようになったが、研究、教育、科学コミュニケーションのニーズに応えるためには、それを可視化する手法が依然として求められている。数百万もの末端(種)を持つ樹を動的に可視化するには、データの…
メタゲノム由来ゲノム(MAG)は、培養困難な微生物が持つ新規タンパク質配列へのアクセスを可能にし、タンパク質の多様性研究、構造予測、進化解析において極めて重要なリソースとなっている。しかし、MAG由来のタンパク質データが爆発的に増加している一方…
過去40億年にわたる生命は、タンパク質とその三次元構造への集合能力によって形作られてきた。タンパク質配列アライメントは、生命の系統樹全体におけるタンパク質の進化と機能的適応を解明するための基盤技術となっている。一次配列のみから三次元タンパク…
AI推敲済み Transformerは機械学習に革命をもたらしたが、その内部構造は多くの人にとって依然として不透明である。そこで本著者らは、非専門家がGPT-2モデルを通してTransformerについて学ぶことができるように設計されたインタラクティブな視覚化ツール、T…
RNAの二次構造(2D)の可視化は、RNAの機能を理解するために不可欠なツールである。R2DTは、RNAの2次構造を、一貫性があり、認識可能で、再現性のあるレイアウトで可視化するために設計されたソフトウェアパッケージである。最新リリースのR2DT 2.0では、一…
核局在シグナル(NLS)と核外輸送シグナル(NES)は、核膜孔複合体を介したタンパク質の核細胞質輸送を媒介し、タンパク質機能の重要な決定因子である。しかし、これらのシグナルの短く縮重した配列パターンは、配列ベースの予測手法において偽陽性率が高く…
タンパク質とリガンドの相互作用を解明することは、生物学的メカニズムの理解と創薬の加速に不可欠である。事前の知識なしに結合部位を特定するブラインドドッキングは、クライオ電子顕微鏡やAlphaFold3などのAIベースの予測ツールによって生成される膨大な…
タンパク質言語モデル(pLM)は、機能、構造、進化に関する情報をエンコードするタンパク質ごとの埋め込みを生成するが、これらの表現で捉えられた関係を体系的に探索することは依然として困難である。ProtSpace(https://protspace.app)は、pLM埋め込み空…
ゲノムバリアントとその予測される機能的影響の注釈付けは、ゲノム研究および臨床診断において重要なステップである。広く使用されているEnsembl Variant Effect Predictor (VEP) はPerlで実装されているが、最新のシーケンス研究によって生成されるますます…
高品質なバイオインフォマティクスプロットは、生物学研究、特に論文発表の準備において重要である。しかし、論文発表に適したプロットを作成するには、学習曲線が長く、コーディング環境の設定が複雑になるという課題がつきまとう。そこで本稿では、バイオ…
HumanBaseは、組織および細胞型特異的な変異効果予測フレームワークと遺伝子機能ネットワークを、下流解析ツールと組み合わせた、ユーザーフレンドリーで無料のサーバーで提供する。62,000を超える公開データセットを統合し、堅牢なパイプラインを使用して前…
Gene Neighbourhood Analysis Tool(GNAT)は、タンパク質配列を与えられた微生物(細菌、古細菌、真菌)またはウイルスデータベース内の相同遺伝子を同定し、それらのゲノム近傍(GN)を類似性に基づいてアラインメントおよびクラスタリングし、一致したゲ…
バイオフィルムは、自然環境および人工環境における細菌のデフォルトの生活様式を表し、細胞外多糖類(exoPS)はバイオフィルムマトリックスの重要な構造的および機能的構成要素として機能する。その重要性にもかかわらず、これらの環境でのexoPSの産生はほ…
生物医学文献の広大な領域を探索し、検索を実行したり、それらをバイオインフォマティクス解析と組み合わせたりする過程は、科学文献の指数関数的な増大と、PubMedおよび関連リポジトリを対象とした多数のマイニングツールの存在を考慮すると、困難である。…
異なる形式の配列座標やリファレンスゲノムを扱うことは、遺伝学研究において課題となる。この複雑性は、異なる命名規則を用いる多様なデータソースを変換・調和させる必要性から生じる。手動処理は時間がかかり専門知識を要するため、遺伝データセットの日…
家系図の作成は生物医学研究において繰り返し行われる作業だが、複雑なヒトの家系図を描画できるオンラインツールは少なく、無料のものはさらに限られている。DrawPedはこのギャップを埋めることを目的としている。DrawPedは標準的なPED形式の家系図ファイル…
2025/11/05 誤字修正 メタゲノムシーケンシングの急速な発展により、メタゲノムアセンブルゲノム(MAG)の前例のない膨大なデータが生成され、微生物の発見および機能的特徴づけの機会が一変した。しかしながら、これらの資源を完全に活用することは、データ…
ヒト遺伝子のバリアントレパートリーの多くは、一塩基多型(SNV)とsmall indelで構成されているが、構造多型(SV)は依然として私たちの変異DNAの主要な部分を占めている。SVの検出は、各カテゴリーのSVを検出するために異なる技術(アレイCGH、SNPアレイ、…
本著者らは最近、腸内微生物叢の状態から疾患発生の可能性を判定し健康状態を評価する指標として、糞便メタゲノムに基づく「腸内微生物叢ウェルネス指数(GMWI)」を導入した。このウェルネス指数の算出は、健康に有益な種と健康に有害な種の相対的豊かさに…
ゲノム、トランスクリプトーム、プロテオームデータの解釈に不可欠なエンリッチメント解析は、メタボロミクス分野へも拡大している。さらに、メタ解析やマルチオミクス研究に見られるように、異なる研究やオミクスプラットフォームからのデータを統合する統…
変異プライマー(通常は16Sリボソーム遺伝子領域を標的とする)を用いて生成されたPCR増幅産物のシーケンシングは、複雑な微生物サンプルの分類学的構成をプロファイリングするためにメタゲノミクスで広く用いられている。プライマー選択における分類学的バ…
メタゲノムデータにおける微生物の分類群と相対的豊度の決定は、技術的に依然として困難である。本研究では、普遍的マーカー遺伝子内の保存領域を用いて群集構成を推定する「SingleM」を提案する。ゲノム情報が欠如した種を正確に組み込むことで、未知種がほ…
公開リポジトリで利用可能な生物学的シーケンスデータの量は急速に増加しており、生物医学にとって重要な資源を形成している。しかし、これらのデータを効率的かつ正確に全文検索可能にすることは依然として課題である。本研究では、大規模なシーケンスセッ…
peakScoutは、ゲノムピークデータと遺伝子アノテーションの間のギャップを迅速かつ容易に埋めるために設計されたコマンドラインおよびウェブベースのバイオインフォマティクスツールであり、研究者が調節エレメントの測定値とその標的遺伝子との関係を理解す…
2025/08/17 指摘いただいた部分を修正 大量の構造コレクションから、機能的に重要な短い3Dパターンである類似したタンパク質構造モチーフを検出することは、計算上非常に困難である。そこで本著者らは Folddisco を開発した。Folddisco は、側鎖の向きを含む…
ゲノミクス分野においてデータ可視化はますます重要性を増しており、研究者が世代を超えて遺伝と組み換えのパターンを解明するのを可能にしている。既存のツールの多くは祖先予測に焦点を当てているが、親の遺伝子が子孫のゲノムにどのように寄与するかを分…
メタオミクスデータは、微生物の多様性と機能に関する情報が公共のレポジトリで指数関数的に蓄積されているが、派生した情報はデータの種類、研究、または採集された微生物環境に応じて孤立した状態で管理されている。ここでは、生息地、地理、系統関係を超…
環境DNAシーケンシングは、微生物の多様性と生態系に関する我々の理解に革命をもたらした。現在では、地下深部から山の頂上まで、無数の宿主、生物群、条件を網羅する地球全体のマイクロバイオームの塩基配列が決定されている。しかし、シークエンシングや処…
公開データベースにおけるウイルスゲノム配列数の急速な増加に伴い、包括的なウイルス研究のためのスケーラブルで普遍的かつ自動化された予備的な分類学的枠組みが必要とされている。ここでは、ウイルス配列に基づく分類法(VISTA:Virus Sequence-based Tax…