← Files Life Sciences NGS AnalysisARCHIVED FILE

references/database-registry.json

4.3 KB · Sep 30, 2026 · 22:50 UTC

↓ Download file

{
  "schema_version": "0.1.0",
  "databases": {
    "silva_138_amplicon": {
      "display_name": "SILVA 138 marker-gene taxonomy database",
      "kind": "taxonomy_database",
      "database_family": "SILVA",
      "version": "138",
      "root_env": "NGS_DB_SILVA_138_ROOT",
      "source": "SILVA release files converted for the selected amplicon backend.",
      "license_note": "Respect SILVA distribution and citation requirements.",
      "estimated_size": "medium; depends on release and classifier representation",
      "suggested_setup": [
        "mkdir -p \"$NGS_DB_SILVA_138_ROOT\"",
        "Place release-matched taxonomy.tsv and sequences.fasta under \"$NGS_DB_SILVA_138_ROOT\".",
        "For QIIME2 classify-sklearn, also track the trained .qza classifier path used for the run."
      ],
      "required_files": [
        "taxonomy.tsv",
        "sequences.fasta"
      ]
    },
    "gtdb_release": {
      "display_name": "GTDB taxonomy database bundle",
      "kind": "taxonomy_database",
      "database_family": "GTDB",
      "version": "user_selected",
      "root_env": "NGS_DB_GTDB_ROOT",
      "source": "GTDB release bundle prepared for the selected classifier.",
      "license_note": "Track GTDB release and classifier-specific conversion details.",
      "estimated_size": "medium to large; depends on GTDB release and classifier representation",
      "suggested_setup": [
        "mkdir -p \"$NGS_DB_GTDB_ROOT\"",
        "Place release-matched taxonomy.tsv and sequences.fasta under \"$NGS_DB_GTDB_ROOT\".",
        "Record the GTDB release, classifier backend, and conversion command in the run resource manifest."
      ],
      "required_files": [
        "taxonomy.tsv",
        "sequences.fasta"
      ]
    },
    "kraken2_standard": {
      "display_name": "Kraken2 standard database",
      "kind": "metagenomics_database",
      "database_family": "Kraken2",
      "version": "user_selected",
      "root_env": "NGS_DB_KRAKEN2_ROOT",
      "source": "Kraken2 standard database or lab-curated equivalent.",
      "license_note": "Large database downloads should be deliberate and checksum-tracked.",
      "estimated_size": "large; Kraken2 standard databases can require substantial disk space",
      "suggested_setup": [
        "mkdir -p \"$NGS_DB_KRAKEN2_ROOT\"",
        "kraken2-build --standard --db \"$NGS_DB_KRAKEN2_ROOT\" --threads <threads>",
        "kraken2-inspect --db \"$NGS_DB_KRAKEN2_ROOT\" > \"$NGS_DB_KRAKEN2_ROOT\"/inspect.txt"
      ],
      "required_files": [
        "hash.k2d",
        "opts.k2d",
        "taxo.k2d"
      ]
    },
    "bracken_standard": {
      "display_name": "Bracken database paired to Kraken2",
      "kind": "metagenomics_database",
      "database_family": "Bracken",
      "version": "user_selected",
      "root_env": "NGS_DB_BRACKEN_ROOT",
      "source": "Bracken files generated from the exact Kraken2 database used for classification.",
      "license_note": "Bracken abundance estimates are only valid when read length and Kraken database match the generated kmer distribution.",
      "estimated_size": "small to medium relative to the paired Kraken2 database",
      "suggested_setup": [
        "Use the exact Kraken2 database root used for classification.",
        "bracken-build -d \"$NGS_DB_BRACKEN_ROOT\" -t <threads> -k 35 -l <read_length>",
        "Keep one kmer distribution per read length when workflows mix read lengths."
      ],
      "required_files": [
        "database100mers.kmer_distrib"
      ]
    },
    "humann_uniref90": {
      "display_name": "HUMAnN UniRef90 and ChocoPhlAn database bundle",
      "kind": "functional_profile_database",
      "database_family": "HUMAnN",
      "version": "user_selected",
      "root_env": "NGS_DB_HUMANN_ROOT",
      "source": "HUMAnN utility downloads or local mirrored database bundle.",
      "license_note": "HUMAnN databases are large and should be versioned with the HUMAnN software release.",
      "estimated_size": "large; ChocoPhlAn plus UniRef databases can require substantial disk space",
      "suggested_setup": [
        "mkdir -p \"$NGS_DB_HUMANN_ROOT\"",
        "humann_databases --download chocophlan full \"$NGS_DB_HUMANN_ROOT\"",
        "humann_databases --download uniref uniref90_diamond \"$NGS_DB_HUMANN_ROOT\""
      ],
      "required_files": [
        "chocophlan",
        "uniref"
      ]
    }
  }
}

SHA-256: f45698bd3506210b2388d43436d59d3c664254c72da23e3d7a4cb3f8e1f015f9