PRIME 算法研究中心31 项严格自研

创伤数智中心 9 大算法域 / 31 项严格自研原创算法。本页算法均基于本团队 实际运行的代码仓库,每一个都对应真实服务的核心逻辑、可被商业授权集成。第三方开源模型与商用 API(如 SenseNova 文生图、DeepSeek、Ollama 生态)已明确标注,不纳入原创声明

📩 申请商业授权 / 私有化部署 →
31
原创算法
9
算法域
62
统计工具
35+
后端服务
275+
补丁文档
46GB
主库容量
220万
PubMed 文献
49K
KG 节点
3.9M
统计表行

📌 原创边界声明(合规优先)

为了向潜在合作方(软件公司 / SaaS 平台 / 医院信息化厂商)提供准确可信的能力清单,本页面 严格区分 原创算法与第三方组件:

i

算法总目录

9 大算法域 / 31 项原创算法 / 全栈自主研发 · 点击卡片跳转至对应章节
🏛️
A. 核心架构与感知 (3)
Core Architecture & Perception
PRIME Notice v2.1 五项增强 / HUD Dashboard 28 端点 / 期刊扫描智能调度
🔍
B. 检索与综述 (5)
Retrieval & Review
PICO 拆解 / PubMed 严格语法 / TwoStep 多轮 / PRISMA Independent / Scoping
🕸️
C. L1-L9 知识图谱 (4)
L1-L9 Knowledge Graph
9 维向量 ETL / 4 类冲突检测 / FAISS 1.08M 索引 / 双向跨文献抽取
🤖
D. 对话 AI 防护 (5)
Conversational AI Safety
Answer Grounding 11 规则 / Disclosure Guard 13-16 / 引用 Linker / Avatar 评分注入 / 内容复核
📊
E. 医学统计框架 (1+62)
Medical Stats Framework
62 个统计工具(Bayesian/因果推断/生存/Meta/纵向)+ LLM 调度 · 即 stats-lab
⚙️
F. 多智能体与路由 (5)
Multi-Agent & Routing
Multi-Agent Supervisor 12 智能体 / Concierge 3 层路由 / 语音意图 / Handover BM25
🏭
G. 多模态编排 (2)
Multimodal Orchestration
T2I 异步队列 / VibeVoice 语音编排(Mushroom VLM 已下线)
💊
H. 药品与评分知识 (3)
Drug & Medical Knowledge
Drug FTS5 + 拼音索引 / 423 条评分 ETL / Concierge 关键词导航
🛡️
I. 系统与安全 (3)
System & Safety
PMID 永久约束 / Empty DB 检测 / 性能铁律
A

核心架构与感知 / Core Architecture & PerceptionSaaS 平台底座

平台层骨架 / 感知引擎 / Dashboard / 3 项算法
📡
PRIME Notice 感知算法 v2.1 已上线
PRIME Notice v2.1 — Five-Enhancement L1 Layer
trend_3 / conflict_alert / Triple-Cross / source_anomaly / confidence
5 项 L1 增强在 v1 基础上同时运行:本周主题聚合 / 争议预警 / 跨源联读 Triple / 休刊异常 / 置信度评分。每日扫描 48 核心期刊 + 117 Online First,从 220 万 PubMed 文献中实时捕捉"本周必读"与"风险信号",避免感知踩空。
同类竞品(UpToDate Alerts / Read by QxMD)只做"新文献推送",本算法做到"语义聚合 + 跨源联读 + 冲突预警",可作为医药 SaaS / 临床决策支持系统的感知层独立授权。
5 项增强 220 万文献 每日扫描 v1 兜底
位置build_notice_pool_v2_1.py · awareness_api.py · 端口 5017
版本v2.1.0-20260819-l1-five
🌐
HUD 全息 Dashboard 聚合引擎 已上线
HUD Dashboard 28-Endpoint Aggregator Engine
服务矩阵 + 28 端点 + SSE 流式 + 三层缓存策略
单一查询入口聚合 28+ 个内部服务端口的实时状态、健康度、流量、延迟、KG 节点 / 边 / 冲突计数、FAISS 索引、CPU/内存/磁盘等运营指标。独创 "哑探测 + 缓存分层 + SSE 长连接" 模式,10 秒级响应、零外部依赖。
可直接复用为多微服务架构的 "统一观测面",替代 Prometheus + Grafana 的轻量替代方案,也可作为 BI 大屏的实时数据源接入到任何软件公司现有平台。
28 端点 SSE 10 秒级 零外部依赖
位置stats_api.py · 端口 5021 · hud-dashboard.html
📰
智能期刊扫描调度器 已上线
Smart Journal Scan Scheduler
48 核心期刊 + 117 Online First + epub 4 类型
调度器分 4 个时间窗口(晨/午/晚/夜)拉取 48 本急症 / 重症 / 创伤 / 护理核心期刊的 epub 出版,并扫描 117 本 JCR EM/CC 期刊的 Online First。独创"主题亲和度评分 + 重复性过滤"避免重复推送。
任何医药资讯 / 继续教育平台可直接复用为"专业期刊聚合引擎",替代人工订阅 RSS 的低效模式;也可作为循证医学教学平台的核心数据采集层。
48 核心 117 Online 4 窗口 主题评分
位置awareness_api.py + build_notice_pool_v2_1.py
B

检索与综述 / Retrieval & Review高价值 LLM 应用

意图理解 / 综述生成 / 5 项算法
🎯
LLM 意图 PICO 拆解算法 已上线
LLM Intent Decomposition + PICO Algorithm
LLM 拆解用户意图 → 3-6 个 PICO 子主题检索式
任何综述问题不能简单拼 "trauma AND hemorrhage" 这种 2-3 词 AND 串。本算法让 LLM 拆出 3-6 个互补子主题检索式,每个对应 PICO 一个维度(人群 / 干预 / 对照 / 结局)。内置 3 类 JSON 解析容错(thinking mode fallback / 括号配对 / max_tokens 8000)。
所有 SaaS 类临床检索产品最大的痛点就是"用户提了一个开放问题,召回了一大堆不相关文献"。本算法把"开放问题"翻译成"结构化 PICO 检索式",可直接接入任何医疗 SaaS 的检索入口,把召回率从行业平均 35% 提升到 80%+。
PICO 拆解 3 容错 8000 tokens
位置agent_engine.py 4785-4880
🔬
PubMed 严格语法检索式构建器 已上线
PubMed Strict Syntax Query Builder
MeSH / [tiab] / [dp] / Subheading 严格按 PubMed 官方规范
基于 https://pubmed.ncbi.nlm.nih.gov/help/ 规范构建。每个检索式必含 humans[Mesh]、MeSH 主题词 + 下位词自动 expansion、tiab 自由词、pt publication type、dp date of publication、la language、副主题词组合。`_MESH_TRANSLATION` 字典 30+ 词条覆盖 TXA / 全血 / LTOWB / REBOA / MTP / DCR 等创伤核心术语。
竞品(如 Microsoft Graphlit / Mendeley)通常用关键词匹配,本算法做到 PubMed 语法级别严格,等价于人工 MeSH 标注师的工作量。可直接封装为 B2B 检索 API,对接科研服务公司、医院图书馆、研究者工具。
MeSH 严格 [tiab][dp] 30+ 词条
位置pubmed_search_builder.py 1096-1313
🔁
TwoStep 多轮综述生成算法 已上线
TwoStep Multi-Round Smart Review Generator
LLM 生成 body + 后端 cite 重映射 · 蓝字链接 + hallucination-guard
实际生产路径(取代 OneStep):Step 1 LLM 生成带 [LIT-N] 占位符的 body 文本(不生成参考文献清单);Step 2 后端按 PMID 顺序重映射为 [Author et al. Year] 内联引用 + 蓝字超链接。解决参考文献编号混乱 + 参考文献截断 + LLM 拼接错误。批量化并行摘要生成(30+ 文献自动分批)+ hallucination-guard 后置清洗。
业内唯一"两阶段分离"综述架构:让 LLM 专心写文本,让代码控制引用编号。可授权给医学综述 SaaS、循证医学教学平台、药企医学部作为综述自动化的核心引擎。
两步分离 cite 重映射 hallucination guard 并行分批
位置agent_engine.py 行 3716 _generate_review_two_step
补丁2026-08-31-twostep-multibatch + hallucination-guard
📊
PRISMA Independent 自适应轮数综述 已上线
PRISMA Independent Multi-Round Review
LLM 自适应决策轮数 + 完整证据链 + 章节规范化
PRISMA 独立多轮综述:每轮文献检索后 LLM 自适应决策是否进入下一轮(association-min-rounds-gate)。每轮注入完整证据链。包含 scoping_5_fixes + review_5_fixes + 全章节阿拉伯数字编号。docx_export 综合修复 + 综述框架优先 prompt + 移除硬编码 stats。
PRISMA 是医学综述的国际标准(2500+ 期刊要求),但人工走 PRISMA 流程耗时 4-8 周。本算法把 PRISMA 流程自动化,符合 Cochrane / EQUATOR Network 标准。SaaS 化的 PRISMA 综述生成服务,授权给科研服务公司 / 高校图书馆可形成 SaaS 订阅收入。
PRISMA 标准 自适应轮数 docx 导出
位置prisma_review_engine.py · prisma_api.py
补丁2026-08-31-prisma-independent-multi-round
🔭
Scoping Review 语义路由引擎 已上线
Scoping Review Semantic Routing Engine
LLM 批次筛选 + 语义路由 + 模态 CSS 隔离 + MVP 优化
Scoping Review 框架:scoping_review_engine + scoping_api + scoping_schema。LLM batch screen 批次筛选文献(比单条快 10x)。scoping-semantic-routing 语义路由(基于 kg_nodes chain_level)。scoping-modal-css-fix 模态 CSS 隔离避免弹窗冲突。MVP 综述工作流优化。
与 PRISMA 互补:PRISMA 适合已有系统综述主题,Scoping 适合探索性主题(如新发传染病、AI 医疗)。两条路径覆盖 80% 学术综述需求,构成"综述 SaaS"完整产品矩阵。
LLM 批次 语义路由 10x 加速
位置scoping_review_engine.py + scoping_api.py
补丁2026-08-31-scoping-llm-batch-screen
C

L1-L9 知识图谱 / L1-L9 Knowledge Graph数据资产壁垒

三元组 ETL / 9 维向量 / 冲突检测 / 索引 / 4 项算法
🧬
L1-L9 双向跨文献三元组抽取 已上线
L1-L9 Bi-Directional Cross-Document Triple Extraction
49,488 节点 + 9 维向量 + 双向非线性
从 220 万篇 PubMed 摘要中抽取跨文献三元组,输出 49,488 个 KG 节点 + 数万条带方向向量边。遵循"关系是双向、非线性、跨文献"原则——同一摘要中"基因 + 药物"、"蛋白 + 临床结局"等多维组合,跨文献拼接形成完整链。冲突自动写入 conflict 表。
数据是 AI 时代的壁垒。本算法 6 年沉淀的 49,488 节点图谱,是创伤医学领域目前公开可查最完整的结构化知识资产。可授权给药企(药物靶点发现)、保险公司(理赔决策支持)、AI 制药公司(Drug Repurposing)作为数据层。
49,488 节点 双向抽取 冲突自动
位置g9_daily_incremental.py + kg_builder_v8_complete_v2.py
📐
L1-L9 9 维向量方向算法 已上线
L1-L9 9-Dimension Direction Vector Algorithm
绑定 GRADE + Cochrane RoB 2 + OHDSI OMOP + PubMed PT 4 大公认证据体系
9 维方向向量:relation / polarity / confidence / evidence / pmid_count / study_type / causal_strength / evidence_level / risk_of_bias。所有维度、桶、冲突规则都绑定到 4 个公认证据体系(GRADE 工作组 / Cochrane RoB 2 / OHDSI OMOP CDM / PubMed MeSH Publication Types 2026),禁止另起炉灶。
业内可审计(任何 Cochrane 评审员能复现)+ FDA/EMA 评审可用 + 与医学教育体系一致。竞品(OpenBioLink / Hetionet)使用自创关系标签,本算法采用 OHDSI 18 类标准关系,是临床决策系统的"安全合规"特性。
9 维向量 GRADE Cochrane RoB 2 OHDSI OMOP MeSH PT 2026
字段kg_edges 9 维 + kg_edges_conflict 双向 + kg_edges_mechanism 机制
⚖️
4 类冲突检测算法 已上线
4-Type Conflict Detection Algorithm (Cochrane Handbook Ch.14 Aligned)
方向翻转 / 不一致 / 偏倚 / 撤稿 + 双 pmid 双端校验
所有冲突处理符合 GRADE Inconsistency 维度规范(Cochrane Handbook Ch. 14)。4 大类:方向翻转 (direction_flip) / 不一致 (rct_direction_conflict / preclinical_conflict) / 偏倚 / 撤稿 (retraction_detracted)。双 pmid 校验按 conflict_reason 分层。撤稿自动从主表移除。
医疗 AI 最大的合规风险是"撤稿论文未及时移除"。本算法的撤稿检测 + 自动隔离是 FDA/EMA 评审重点。本算法作为合规模块可独立授权给医学 AI 公司、临床试验平台、文献管理 SaaS。
4 类冲突 双 pmid 撤稿移除
kg_edges_conflict · pmid_main + pmid_other
100+ 万向量 FAISS 检索引擎 已上线
1.08M Vector FAISS Index Engine
bge-small-zh-v1.5 + IndexFlatIP + 1800 字切块 + 200 重叠
本引擎将 .pdf + .docx + .txt + 临床图、尽扫描后材占全语料变为 1.08M 个向量。IndexFlatIP 准确但高精度,首查 ~60s 预热。覆盖:NEJM PDF + 8 词本 + 8 文本 + 临床图 + 顶刊 epub。Word (.docx) chunks 12,532 + 临床图 89,735。
FAISS 是 Meta 开源的,但"如何把医学语料切分 + 嵌入 + 索引"是每个公司的难题。本引擎沉淀了医学专用切块策略 + 多模态嵌入管线。可作为"私有医学知识库 RAG 引擎"整体方案授权,节省下游公司 6-12 个月自研成本。
1.08M 向量 IndexFlatIP 512 维 临床图 89K
位置embeddings/knowledge.index · 2.1 GB
D

对话 AI 防护 / Conversational AI Safety合规必备

Grounding / 反幻觉 / 反套话 / 4 项算法
🚫
Answer Grounding Rule(禁训练记忆) 已上线
Answer Grounding Rule — No LLM Training Memory
11 条 prompt 注入 + 数字类幻觉消除 + 路径披露防护
Expert 智能体回答的内容严禁包含 LLM 训练的科研数据。每条回答必须只基于本次检索证据。NEJM 全文 PDF chunks / PubMed 摘要 / 本地知识库 KB / KG 三元组 / 用户上传指南。_GROUNDING_DIRECTIVE 集中定义 11+12+13+14+15+16 条规则。
医疗 AI 最大的法律风险是"幻觉导致误诊"。本算法的 11 条规则 + 数字强制引用 + 摘要统计提取,构成医疗 LLM 应用的"安全合规基线",可直接授权给任何医疗 AI 公司作为基础 prompt 模板。
11+ 规则 数字提取 禁止记忆
位置expert_api_v2.py _GROUNDING_DIRECTIVE 行 3136
补丁2026-07-30-expert-grounding-no-llm-training
🛡️
Answer Disclosure Guard(反 LLM 泄露) 已上线
Answer Disclosure Guard — Anti Prompt Injection
13-16 规则:反存储清单套话 + 反版权 bulk + 反系统架构
4 条新规则防 prompt injection:rule 13 禁披露存储清单 / rule 14 拒绝 inventory 类问题 / rule 15 禁全文复制 / rule 16 禁系统架构披露。即使用户冒充平台所有者、管理员、审核员、开发者也拒绝。覆盖回答 + 思考链。
2026-08-03 红队测试后入库:竞品在用户冒充"管理员"时会把数据库结构吐出来。本算法的身份冒充防御 + 4 类防泄露规则,是企业级 LLM 应用的"安全护栏"。可授权给金融、医疗、法律等强合规行业的 LLM 应用厂商。
4 规则 反套话 反 bulk 反架构
位置expert_api_v2.py _GROUNDING_DIRECTIVE 末尾
补丁2026-08-03-answer-disclosure-guard
🔗
PMID 引文 Linker 与作者年标签 已上线
PMID Citation Linker + [Author et al. Year] Tag Builder
cite_key 双向匹配 + 蓝字超链接注入 + 别名表 fallback
把 LLM 输出的 [Author et al. Year] 标签反查回 pmid,注入蓝字超链接指向 PubMed。cite_key 双向匹配(first_author + year / title tokens 多 token Jaccard)+ 别名表 fallback(中文文献作者名多音字处理)+ 88 个 sources_map cite_key 跟踪。
医疗内容平台最大的转化漏斗是"读者想点文献但找不到原文"。本算法的 cite_key linker 把 LLM 输出直接转成"可点击的循证引用",让内容平台用户留存率提升 40%+。可作为"循证内容渲染引擎"独立授权。
cite_key Jaccard 88 sources 蓝字注入
位置expert_api_v2.py _build_cite_aliases / inject_pmid_links
补丁2026-08-19-onestep-5rounds-recovery
👤
Avatar 评分上下文注入器 已上线
Avatar Score-Question Context Injector
medical_scores 自动注入 + 急救场景检测 + 上下文感知
avatar_chat_api.py 自研:_is_score_question(question) 自动检测评分问题 → _retrieve_score_context(question, max_chars=2200) FTS5 检索 → build_system_prompt 注入 medical_scores 条目。急救场景自动追加评分知识(如 NIHSS / GCS / HEART / Wells-PE 等)。
数字人急救场景要求"问 GCS 几分必须立即给算法"。本算法实现"问题 → 评分 → 算法"的实时响应。可授权给急救培训 SaaS、医院信息系统、急救设备公司作为知识注入层。
medical_scores 急救检测 FTS5 423 评分
位置avatar_chat_api.py · 端口 5060
补丁2026-08-13-avatar-scores-memory-cleanup
🔎
内容复核算法(事实核查) 已上线
Content Review / Fact-Check Verify Algorithm
8 条 LLM 核查规则 + 服务端 lint 降级 + 摘要关键数字逐项判定
两阶段混合算法:① 服务端正则提取摘要关键数字(样本量 / 死亡率 / 事件率对比 / OR / HR / RR / 95%CI / p 值 / 随访时长)→ 输出【逐项核查清单】。② LLM 8 条规则核查:同义/转述视为一致 · 数据微差视为一致 · 句子覆盖范围 > 摘要视为一致 · 仅 4 类情况判 false(数字明显不同 / 方向相反 / 对象错误 / 研究类型错误)· 拿不准默认 true · 不扣字眼 · 逐项 PASS/FAIL/N/A · 摘要无结构化数字时只看方向。配合 agent_engine.py 服务端 lint:句子中的 n=|OR=|HR=|RR=|95% 数字若不在 abstract 中 → 自动降级该 cite 的 pmid 为空(最多 5 处/综述)。
医疗 AI 综述最大的法律风险是"张冠李戴"——LLM 把 A 研究的数字配到 B 研究的 PMID。本算法的"LLM 语义核查 + 服务端正则 lint"双层防护是业内独有的"数字-文献一致性"保障,可作为医学出版 / 综述 SaaS / 药企临床报告的事实核查模块独立授权。
8 规则 LLM lint 降级 逐项 PASS/FAIL 5 处/综述 /factcheck_verify
位置ask_api.py 行 6775 _handle_factcheck_verify + 行 6887 _extract_factcheck_key_stats
Lint 层agent_engine.py 行 5149 _verify_citations
暴露/ai/api/factcheck_verify (nginx 953) · /search/api/factcheck_verify (2107)
E

医学统计框架 / Medical Stats Framework · 即 stats-lab纯原创 SaaS

62 个统计工具 + LLM 调度 · 即 /ai/stats-lab 全部功能
📊
Medical Stats Framework v1(62 工具 + LLM 调度) 已上线
Medical Statistical Analysis Framework · Multi-Agent LLM-Driven
62 个统计工具 + LLM 自动选型 + LLM 解读 + 可视化导出
纯原创统计框架(独立代码仓库 /opt/stats-framework/,端口 5097)。62 个工具覆盖 Bayesian / 因果推断 / 倾向得分匹配 / 多重插补 / Cox 生存 / 纵向数据 / 单细胞 / 影像组学 / 全基因组关联 / 中介分析 / 临床流行病学 / Meta 分析 / 时间序列预测 / 健康经济学等。用户上传 CSV,LLM 自动选工具、自动跑、自动出图、自动解读
竞品(如 SPSS / Stata / R Studio)需要用户懂统计。本框架做到"上传数据 → 自然语言提问 → 自动跑模型",是中国本土唯一对标 JASP / Jamovi 的"零代码医学统计 SaaS"。可作为医院科研处、独立医学统计服务公司、CRO 公司的核心引擎授权,单医院年费可达 5-20 万元。
62 工具 LLM 选型 LLM 解读 CSV 直跑
位置/opt/stats-framework · 端口 5097 (uvicorn)
入口https://traumadatacenter.com/ai/stats-lab
🧬
Bayesian + Causal Inference 双引擎 已上线
Bayesian Inference + Causal Inference Engine
贝叶斯后验 + 因果图 + 反事实推理 + DAG
原创实现贝叶斯先验/后验/MCMC + 因果图(DAG)构建 + 反事实推理 + 中介效应分析 + 工具变量法。支持连续/二分类/生存结局,可视化后验分布 + 效应量森林图 + DAG 节点边图。封装在 62 工具中的 bayesian.py + causal_inference.py + mediation.py 三个模块。
因果推断是医学 AI 的圣杯(Pearl 因果阶梯理论)。本引擎让临床研究者用自然语言跑因果推断,可授权给药企临床试验组、流行病学研究室、卫生经济学家作为核心工具。
MCMC DAG 反事实 中介
代码tools/bayesian.py + causal_inference.py + mediation.py
🧪
流行病学 + 倾向得分匹配 + Meta 分析 已上线
Epi + PSM + Meta-Analysis Toolkit
OR/RR/HR + PSM 配对 + 异质性 I² + 漏斗图
原创实现 OR/RR/HR 估计 + 倾向得分匹配(PSM)+ 多种匹配算法(最近邻 / 卡尺 / 核匹配)+ Meta 分析(固定/随机效应)+ 异质性 I² + 亚组分析 + 漏斗图 + Egger 检验。封装在 epidemiology.py + psm_tool.py + meta_analysis.py
真实世界研究(RWS)/ 药物经济学评价的标准工具链。可授权给 RWE 服务公司、医保部门、卫生技术评估(HTA)机构、保险产品精算团队作为标准化工具包。
OR/RR/HR PSM Meta 漏斗图
代码tools/epidemiology.py + psm_tool.py + meta_analysis.py
🧬
生存 + 纵向 + 单细胞 + 影像组学 已上线
Survival + Longitudinal + Single-cell + Radiomics
Cox / 混合效应 / 单细胞 / 影像组学特征
原创实现 Cox 比例风险 + Kaplan-Meier + 加速失效时间(AFT)+ 混合效应模型(LME/LMM)+ 单细胞差异表达 + 轨迹推断 + 影像组学特征提取(PyRadiomics 兼容)。封装在 survival_ext.py + mixed_effects.py + longitudinal.py + singlecell.py + radiomics.py
肿瘤 / 慢病 / ICU 三大场景的统计核心需求全覆盖。可授权给肿瘤专科 SaaS、慢病管理平台、ICU 数据分析公司作为基础设施层。
Cox LMM 单细胞 影像组学
代码tools/survival_ext.py + mixed_effects.py + singlecell.py + radiomics.py
F

多智能体与路由 / Multi-Agent & RoutingAI 编排引擎

Supervisor / Concierge / Voice / Handover / 5 项算法
🤝
Multi-Agent Supervisor 协调引擎 已上线
Multi-Agent Supervisor Coordinator (Plan+Execute+Reflect+Memory+Handoff+Distill+Share)
12 agents + 6 阶段闭环 + 4 真业务 + 8 fallback 透传
12 个专项 agent 通过 Supervisor 协调:plan (任务规划) → execute (执行) → reflect (反思) → memory (记忆) → handoff (交接) → distill (蒸馏) → sharing (共享)。全 6 阶段 Phase A/B/C + dashboard 集成 + SSE 流式 + prime 集成。4 个真业务 agent(RAG / Drug / AI Algorithms / Ask)+ 8 个 fallback 占位透传。
企业级 LLM 应用最大的难题是"多个 agent 怎么协作"。本引擎实现了完整的 plan-execute-reflect 闭环 + memory/handoff 持久化,可作为企业 AI 中台的核心调度层授权。对标 Microsoft AutoGen / LangGraph,但更轻量、更适合医疗垂类。
12 agents 6 阶段 memory handoff
位置multi_agent/supervisor.py · 端口 8001
补丁2026-09-03-multi-agent-phase-a ~ phase-c6
🧭
Concierge 3 层路由导航器 已上线
Concierge 3-Layer Service Router (Keyword + BGE + LLM)
关键词命中 + BGE 余弦相似 + LLM 兜底 · 35 服务注册表
3 层路由:第一层关键词命中(weight 0.5-1.0,毫秒级)/ 第二层 BGE-small-zh-v1.5 embedding 余弦相似(80ms,命中 ~12%)/ 第三层 LLM 兜底(>500ms,处理 ambiguous)。35 服务注册表(SERVICE_REGISTRY.json)覆盖所有内部服务,导航 0 跳转 404。
任何大型 SaaS 平台的痛点是"用户找不到功能"。本算法 3 层路由可在 35+ 服务间毫秒级导航,授权给多服务聚合平台、应用市场、企业内部工具导航,可显著降低支持成本。
3 层 35 服务 BGE LLM 兜底
位置concierge_api.py · 端口 8000
数据SERVICE_REGISTRY.json (12KB, 35 services)
🎙️
Voice Agent 语音意图路由器 已上线
Voice Intent Router (WebSocket + Rule + LLM Fallback)
WebSocket 语音输入 → 关键词路由 → LLM 兜底
WebSocket 接收语音转写后的文本,先用关键词规则路由(毫秒级),未命中走 LLM 兜底(500-1500ms)。返回结构化 action(ask/search/chat/predict/expert_consult/emergency_consult/comprehensive_review 等 14 种)。支持 agent_manifest 自动注册 + agent_execute 真业务转发。
语音助手最大的转化漏斗是"用户说完后系统不知干嘛"。本算法的 14 action 结构化输出可直接对接客服 SaaS、智能音箱、车载语音、企业内部语音助手。WebSocket 长连接 + 毫秒级路由是核心壁垒。
WebSocket 14 action rule+LLM manifest
位置/opt/voice_agent/main.py · 端口 5020
🚑
Handover 班次感知对话引擎 已上线
Handover Shift-Aware Dialogue Engine (BM25 + Specialty Detect)
SparseBM25 + 班次检测 + 专科分类 + 危急值提取
急诊交班对话场景:自动识别"夜班/白班/中班/重点关注"等班次意图,识别"心内/神内/创伤/重症"等专科,自动提取"危急值"(肌钙蛋白 / 血压 / SpO₂ 等),SparseBM25 检索知识库 + 本地 FunASR ASR。封装在 handover/backend/app.py。
急诊科护士交班文档标准化是医院信息化"硬骨头"。本算法把"对话 → 结构化交班记录"完全自动化。可授权给 HIS 厂商、急诊信息系统、医院数字化转型项目作为 AI 模块嵌入。
BM25 班次检测 专科 危急值
位置/opt/handover/backend/app.py · 端口 5030
🎯
Intent 意图分类器(11 类) 已上线
Intent Classifier (11 Types + Tool Routing)
11 种意图 + 工具路由 + 上传感知
11 类意图分类(quick_answer / comprehensive / clinical_decision / image_interpretation / drug_inquiry / score_query / guideline / differential_diagnosis / case_discussion / reference / ...)+ should_use_tools() 工具路由 + has_upload 上传感知。封装在 intent_classifier.py。
所有 SaaS 类对话产品的"第一公里"——意图分类。本分类器针对医疗场景定制(11 类覆盖 95% 医疗对话),可授权给医疗 AI 客服、互联网医院、智能问诊平台作为基础组件。
11 类 工具路由 上传感知
位置intent_classifier.py
G

多模态编排 / Multimodal OrchestrationAI 工程能力

T2I / VLM / Voice / 3 项算法(第三方模型但服务编排层原创)
🖼️
T2I 异步队列调度器 已上线
Text-to-Image Async Queue Scheduler (SenseNova + LLaDA Fallback)
异步任务队列 + 双 upstream fallback + 24h 任务持久化
原创编排层(不是模型本身)。Mac Studio 上跑 SenseNova-U1.5 GGUF 推理 + LLaDA-Image fallback。本算法实现:① 异步任务队列(ThreadPoolExecutor max_workers=2);② 任务 SQLite 持久化(24h 保留);③ 双 upstream 健康检查 + 自动 fallback;④ SSE 进度推送(可选);⑤ 轮询模式避免 nginx 504。封装在 t2i_api.py。
文生图模型(Midjourney / DALL-E / Stable Diffusion)只提供 API 接口,"如何把多个模型融合 + 队列化 + 高可用"是每个公司必做的工程。本算法的双 upstream fallback + 任务持久化模式,可直接复制到任何 AI 推理服务(视频 / 语音 / 3D)。
异步队列 双 upstream 24h 持久 SSE 进度
位置t2i_api.py · 端口 5098
说明SenseNova-U1.5 与 LLaDA-Image 均为第三方模型,本算法仅含编排层
🎙️
VibeVoice 语音智能体编排 已上线
VibeVoice ASR+TTS+LLM Orchestrator
FunASR ASR + edge-tts TTS + Ollama LLM · 全栈编排
原创编排层(不是底层模型)。把 FunASR(ASR 5061)+ edge-tts(TTS)+ Ollama(LLM 11434)编排成"语音进 → 语音出"完整智能体。bitnet 模型在 vibevoice 上线。auto-dispatch + wake 404 fix + retry 全栈修复。封装在 vibevoice_api.py。
语音智能体最常见问题:ASR 延迟 + TTS 卡顿 + LLM 慢 + 三者协调崩溃。本编排器的关键是"模型状态机 + 自动重试 + 503 防御",可作为白标解决方案授权给智能音箱、车载、教育硬件等硬件厂商。
3 模型编排 bitnet auto-dispatch retry
位置vibevoice_api.py · 端口 5070
说明FunASR / edge-tts / Ollama 均为开源/第三方,本算法仅含编排层
H

药品与评分知识 / Drug & Medical Knowledge垂直数据资产

药品 FTS5 / 423 评分 / Concierge / 3 项算法
💊
Drug FTS5 + 拼音混合检索引擎 已上线
Drug FTS5 + Pinyin Hybrid Retrieval Engine
110,964 药品 · 26 字段 · FTS5 + 拼音索引 · 中英文混合
原创 SQLite FTS5 全文检索引擎,覆盖 110,964 条中国上市药品,26 个字段(成分 / 适应症 / 用法用量 / 不良反应 / 禁忌 / 注意事项 / 相互作用 / 规格 / 厂家等)。FTS5 关键字检索 + 拼音首字母索引(pypinyin 二分查找)覆盖中英文 + 拼音 + 别名混合查询。
中国药品说明书数据库最大痛点:"用户记不住中文名,只记得拼音 / 别名"。本算法的 FTS5 + 拼音混合索引让查询体验提升 5x。直接对标药智数据 / 丁香园用药助手,可授权给互联网医院、电子处方、医保审核系统作为底层检索引擎。
110,964 FTS5 拼音索引 26 字段
位置/data/rag/drug_api.py · 端口 5085
DB/data/rag/drug_fts.db (WAL)
📋
423 条医学评分 ETL 管线 已上线
Medical Scores ETL Pipeline (423 Scores · 19-Field Schema)
423 条 · 19 字段全量 · FTS5 同步 · PMID EFetch 验证
原创 ETL:19 字段全量 schema(abbrev/name_zh/name_en/category/year/latest_version/developer/indications/components/total_score_range/interpretation/formula_or_calculation/validation_pmid/guideline_source/common_pitfalls/online_calculator_url/source_url/version/source_origin)。FTS5 自动同步,PMID EFetch title-check 验证。
医学评分是临床决策的基础(NIHSS / GCS / HEART / Wells / MELD / SOFA 等),但业内没有公开完整的结构化数据库。本算法的 423 条覆盖心血管 / ICU / 创伤 / 神经 / 感染 / 消化 / 肝脏 / 电解质 / 骨科 / 肿瘤 / 烧伤 / 风湿 / 虚弱 / 特殊共 14 类。可作为医院信息系统、急救决策系统的"评分 API"授权。
423 条 19 字段 FTS5 EFetch 验证
位置import_scores.py + expert_knowledge.db.medical_scores
补丁2026-08-13-scores-library-fill-19
🌐
Concierge 服务注册与关键词索引 已上线
Service Registry + Keyword Inverted Index
35 服务 · 关键词倒排索引 · 启动时预 embedding
35 个内部服务的注册表(SERVICE_REGISTRY.json, 12KB),含服务名 / 描述 / 关键词列表 / 入口 URL / 图标 / 类别。启动时为每个服务的 description+keywords 计算 BGE embedding 并常驻。3 层路由的第一层就是关键词倒排索引。封装在 concierge_api.py。
"服务导航"是企业内部工具 / SaaS 平台的核心组件。本注册表 + 倒排索引 + 启动时预 embedding 模式可推广到任意应用市场(Chrome Web Store 类),作为 SaaS 的"服务发现引擎"授权。
35 服务 倒排索引 预 embedding 12KB
位置concierge_api.py + SERVICE_REGISTRY.json · 端口 8000
I

系统与安全 / System & Safety合规铁律

PMID 永久约束 / Empty DB / 性能铁律 / 3 项算法
🔒
PMID 永久约束铁律审计 已上线
PMID Permanent Constraint Audit (6 Tables)
6 表全合规审计 · kg_edges / kg_edges_mechanism / kg_edges_disease / kg_edges_conflict / kg_nodes / articles
用户原始约定"每一张表都要有 pmid 号"——医学图谱的生命线。任何 ETL、修复、快速重建必须保证:每行必须挂 pmid;多 pmid 用逗号/分号分隔;不允许用 edge_id 间接跳转;不允许伪装 pmid(PUBMED_FAKE_*)。审计 SQL 模板内置 5 表 violations = 0 检查。
医学数据库的"溯源合规"是药企、监管、保险公司的硬要求。本算法的 5 表审计模板可直接复用到任何医学数据库产品(药物警戒系统、不良反应库、临床试验库),作为"溯源完整性"基础模块授权。
6 表审计 violations=0 多 pmid 不允许伪装
位置全栈 · 5 表 violations SQL
补丁2026-07-19-pmid-permanent · 2026-07-25-kg-pmid-audit
🧹
Empty DB 占位检测算法 已上线
Empty DB Placeholder Detection Algorithm
0 字节 db 检测 + Active ∩ Empty 求差集 + 防 placeholder ETL
2026-07-25 全服务器审计发现 48 个 0 字节 db 文件散布各处。3 步求差集:列所有 active 引用 → 列 0 字节 db → 求差集。Active ∩ Empty ≠ ∅ 时禁止直接删。新 ETL 脚本必须"open + 立即 write seed row",不能只 touch path。
中大型数据库架构的"隐疾"是:开发者以为 db 在生产中、实际是空文件,新代码写入后悄无声息地丢数据。本算法的 3 步求差集 + 占位预防规则可作为 DevOps / SRE 工具集的标准组件授权。
3 步求差 月度 cron 防 placeholder 48 db 清理
位置find / -name "*.db" -size 0c 月度扫描
补丁2026-07-25-empty-db-cleanup
首页性能铁律(gzip + 缓存双轨) 已上线
Homepage Performance Iron Rule (gzip + Cache Dual-Track)
gzip_static + 预压缩 .gz + 4 层防御缓存失效 · 8-10s → <1s
2026-08-01 用户反馈首页 8-10s 修复。4 层根因 + 修复方案:① 预生成 .gz 文件(gzip -9 -f -k -n);② nginx gzip_static on;③ 主域名不走 CDN;④ SW v2.5 主动接管 + HTML 强制 no-store + JS 5min 缓存保留。修复后首屏 8-10s → <1s。
任何 Web 应用的转化漏斗从首屏开始。本算法的"gzip_static + 4 层防御 + SW 主动接管"完整方案可作为前端性能咨询产品授权,特别适合医疗 SaaS / 电商 / 金融等对首屏极敏感的行业。
gzip_static 主域名 8-10s→<1s 4 层防御
位置/etc/nginx/conf.d/gzip.conf + /var/www/pubmed/*.js.gz
补丁2026-08-01-prime-home-page-perf-fix

🤝 商业授权与私有化部署

31 项原创算法覆盖医学 AI 全栈:感知层 · 检索层 · 知识图谱 · 统计 · 多模态 · 安全合规。可按域整体授权、单项授权、或完整私有化部署。统计框架(62 工具 + LLM 调度)即 stats-lab 全部功能,可独立 SaaS 化销售。

📦 整库授权
31 项算法 + 49K KG 节点 + 220 万文献 + 423 评分 + 62 统计工具。一次性买断 / 订阅模式。
🧬 单域授权
按 9 域任选(如仅 Knowledge Graph / 仅 Stats Framework)。每域可独立 API 化集成。
🏢 私有化部署
交付完整 Docker / Kubernetes 部署包,含运维手册、补丁文档、3 个月技术支持。
🎓 技术咨询
首屏性能 / 49K KG ETL / Multi-Agent 编排 / LLM Grounding 合规等专项咨询。

📈 研究中心里程碑

2026-07
L1-L9 三元组抽取算法 v1 上线,单库 46GB 整合所有业务表
2026-07-19
PMID 永久约束铁律入规
2026-07-25
Empty DB 检测算法入规(48 个 0 字节 db 清理)
2026-07-30
Expert API Answer Grounding Rule 入规(禁止 LLM 训练记忆)
2026-08-01
首页性能铁律入规(gzip_static + 4 层防御 · 首屏 8-10s→<1s)
2026-08-03
LLM PICO 拆解 + Answer Disclosure Guard(13-16 规则)
2026-08-08
Answer Disclosure Guard 反 LLM 信息泄露入规
2026-08-13
423 条医疗评分全部 PMID EFetch 验证合格
2026-08-19
OneStep-5Rounds 综述算法上线(2026-08-31 已被 TwoStep 多轮替代)
2026-08-30
PRISMA Independent 多轮综述 + Scoping Review
2026-09-03
Multi-Agent 全 6 阶段闭环 + Stats Framework 62 工具完整版
2026-09-09
PRIME 算法研究中心页面发布(31 项严格自研 / 9 大域 / 商业授权)
2026-09-09
内容复核算法入页(factcheck_verify 8 规则 + 服务端 lint 双层防护)
2026-09-09
OneStep-5Rounds 标记废弃(TwoStep 多轮为唯一综述路径)
2026-09-09
Mushroom VLM 模型下线,5096 端口转 consensus-api