跳转至

bioinfo-system-new 知识库与算法分析

Bayx Agent 分析 · 2026-07-13


一、核心分析模块一览

模块 代码行数 功能描述
main.py 2,590 FastAPI 主入口,16个 router 注册
pipeline_16s_router.py 1,085 16S rRNA FASTQ 分析
wgs_router.py 1,127 全基因组测序分析
array_router.py ~11KB 基因芯片分析
cancer_screening_router.py 802 癌症早筛
pharmacogenomics_router.py 902 药物基因组学
immune_repertoire_router.py 883 免疫 repertoire
pipeline_16s_v23/pipeline_runner.py 780 16S v2.3 pipeline 编排器

二、16S Pipeline v2.3 分析流程

输入: FASTQ 文件(双端 R1/R2 或单端 SE)

7 步处理流程: 1. FASTQ 输入验证(双端/单端自动识别) 2. 序列处理:QC + 去噪 → ZOTU(使用 scikit-bio 真实处理) 3. 物种注释:k-mer + alignment 双模式(hybrid 方法,min_identity=0.80) 4. 多样性分析:Alpha(chao1/shannon/ACE/simpson/observed) + Beta(bray_curtis/jaccard/unifrac) 5. 健康评分:多维度综合评分 6. 代谢物预测 + 食物推荐 7. PDF 报告生成

新增 v2.3 模块: - 蛋白腐败代谢产物预测(对甲酚/吲哚/腐胺/尸胺/氨) - 肠道产气预测(氢气/甲烷/硫化氢/二氧化碳) - 综合评估结论生成器(健康建议/阶段目标/复查提醒)


三、知识库规模

分类 条目数 行号
核心菌属知识库(CORE_GENERA_DB) 291+ 菌属 1-183
疾病风险模型 ~233 种疾病 184-416
营养评估数据库 ~64 种菌→营养映射 417-480
代谢物预测模型(METABOLITE_MODELS) ~203 种代谢物 481-683
抗生素耐药基因数据库 ~51 种 684-734
食物推荐数据库(USDA) ~95 种食物 735-829
肠型判定规则 3 种肠型 830-851

知识库来源: 从真实报告(JQ93802325-孙玲娜.pdf)提取


四、物种分类层级

知识库涵盖完整分类层级:界 → 门 → 纲 → 目 → 科 → 属 → 种

核心菌属示例: - Prevotella(普雷沃氏菌属): 植物性饮食相关,Prevotella 肠型主导 - Bacteroides(拟杆菌属): 胆汁酸代谢,Bacteroides 肠型主导 - Faecalibacterium(粪杆菌属): 最重要产丁酸菌,权重 3.0 - Bifidobacterium(双歧杆菌属): 益生菌,权重 2.5 - Lactobacillus(乳杆菌属): 产乳酸,调节情绪


五、多样性指数

Alpha 多样性: chao1, shannon, ACE, simpson, observed OTUs, goods_coverage, pd Beta 多样性: bray_curtis, jaccard, unifrac(加权/非加权)


六、代谢物预测类别

类别 代表代谢物
短链脂肪酸(SCFA) 乙酸、丙酸、丁酸、戊酸
蛋白腐败产物 对甲酚、吲哚、腐胺、尸胺、氨
神经递质前体 5-HTP、GABA 前体、酪氨酸
维生素 B1/B2/B6/B12/K、叶酸
肠道气体 氢气、甲烷、硫化氢、二氧化碳
胆汁酸 初级胆汁酸、继发性胆汁酸

七、PDF 报告结构

  1. 概述(样本信息、检测方法)
  2. 肠道菌群概况(总览+健康评分)
  3. 菌群结构分析(门级/属级分布)
  4. Alpha 多样性分析
  5. Beta 多样性分析(样本对比)
  6. 核心菌属详解
  7. 疾病风险评估
  8. 代谢物预测
  9. 营养评估
  10. 抗生素耐药风险
  11. 食物推荐
  12. 综合评估与健康建议

八、算法特点与局限性

优势

  • 知识库来源于真实中国人肠道菌群检测报告
  • 肠型分类基于 V4 区域(准确性高于 V3)
  • 多层次代谢预测(SCFA + 腐败产物 + 神经递质 + 气体)
  • 集成食物推荐(USDA 数据库)

局限性

  • 物种注释 min_identity=0.80 可能导致种级鉴定不准确
  • 知识库 291 菌属覆盖有限(约占肠道菌群 5%)
  • 疾病风险预测基于关联规则,非机器学习模型
  • 无统计显著性检验(p 值)
  • PDF 报告依赖 ReportLab(字体跨平台问题)

九、技术债务

  • 153 处裸 except:(已修复 routers + cache_service 部分)
  • 两个重复 pipeline 目录(pipeline_16s/ 和 pipeline_16s_v23/)
  • qynode_pdf_engine.py 和 integration/report_generator.py 重复
  • ai_diagnosis 服务在 Mars 上导致启动挂起(原因未明)