ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

DisGeNET 基因-疾病关联检索实战指南:从认证、GDA/VDA 端点到可复现查询

DisGeNET 基因-疾病关联检索实战指南:从认证、GDA/VDA 端点到可复现查询 DisGeNET 基因-疾病关联检索实战指南从认证、GDA/VDA 端点到可复现查询【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skillsDisGeNET 是面向基因-疾病gene-disease与变异-疾病variant-disease关联的公开数据库本文以本仓库 database-lookup 技能目录中的 disgenet.md 参考文档为骨架讲解如何通过其 REST API 完成可复现、带溯源的生物医学关联检索。读完本文你将掌握 DisGeNET 的 API Key 认证流程、基因/疾病/变异三类核心端点的用法、source、min_score、min_ei等过滤参数的语义以及如何将检索结果接入本技能定义的 provenance 审计框架。DisGeNET 在 database-lookup 技能中的定位在 SKILL.md 的疾病与临床领域清单中DisGeNET 被明确定位为「gene-disease associations」类问题的首选数据源数据库选择指南也给出了同样结论当用户询问「某基因与哪些疾病相关」或「某疾病由哪些基因驱动」时首要查询 references/disgenet.md备选方案为 Open Targets 与 Monarch Initiative。在跨领域「everything about a gene / everything about a variant」查询中DisGeNET 还与 ClinVar、dbSNP、gnomAD 等数据库配合用于补齐基因层面的疾病关联证据。本技能的其余参考文件还补充了 DisGeNET 的用途边界pathway-enrichment 将 DisGeNET 列为回答「Disease/phenotype association?」类问题与 g:Profiler HP、GWAS Catalog 并列的可选数据库。API 基础信息与认证DisGeNET 的 REST API Base URL 为https://www.disgenet.org/api与 OMIM、BioGRID 等数据库一致DisGeNET必须提供 API Keyfree academic registration详见 SKILL.md 中的 API Keys 表格。获取流程是先在 disgenet.org 注册再通过认证接口换取访问令牌curl -X POST https://www.disgenet.org/api/auth/ \ -d emailyouexample.compasswordyourpassword # Returns: {token: abc123...}认证成功后将返回的 token 以Authorization: Bearer token请求头携带在后续每次 API 调用中。参考文档建议把 token 写入.env环境变量DISGENET_API_KEY与技能内 FRED、BEA、OpenFDA 等数据库的密钥管理方式保持一致。密钥处理规范本技能对带密钥数据库有严格的「最小权限」约定——只在所选数据库确实需要时检查对应的单一环境变量此处为DISGENET_API_KEY不读取或回显整个.env文件也不在最终输出中泄露 token 值或认证头溯源信息里只声明本次访问是 authenticated 还是 unauthenticated。可参考 SKILL.md 的「API Keys and Access Restrictions」章节。核心端点一览端点说明主键要求/gda/gene/{gene_id}某基因的基因-疾病关联NCBI Gene ID整数/gda/disease/{disease_id}某疾病的基因-疾病关联UMLS CUI/gda/evidences/gene/{gene_id}证据级别的关联数据NCBI Gene ID/vda/gene/{gene_id}某基因的变异-疾病关联NCBI Gene ID/vda/variant/{rsid}某变异的变异-疾病关联dbSNP rsID注意其中两类命名空间差异基因一侧统一使用 NCBI Gene ID整数如 TP53 7157这是 SKILL.md 中「Common Identifier Formats」表格对 DisGeNET 的明确约定疾病一侧使用 UMLS CUI 概念编码变异一侧使用 dbSNP rsID。三种主键都直接对应用户的问题形态无需换算。关键查询参数参考文档列出的可过滤参数如下需要根据检索意图逐一确认语义参数取值范围作用sourceCURATED、BEFREE、ALL限定证据来源人工策展来源、BEFREE 文本挖掘来源、或全部min_score0–1GDA 评分下限阈值用于过滤低置信度关联min_ei数值证据指数evidence index下限阈值formatjson或tsv响应序列化格式limit、offset整数分页控制这些参数应视为服务端过滤DisGeNET 在返回记录前即应用source与min_score过滤。按 retrieval-contract.md 的约定调用前应把用户意图拆分为「API 服务端可执行的过滤」与「必须在本地二次检查的过滤」并在最终溯源中分别记录避免把服务端行为误解为本地结论。三种典型查询的示例调用参考文档给出了三个覆盖「基因 → 疾病」「疾病 → 基因」「变异 → 疾病」三个方向的完整示例# Gene-disease for TP53 (gene ID 7157) /gda/gene/7157?sourceCURATEDmin_score0.3limit10formatjson # Disease-gene for Breast Cancer (UMLS CUI C0006142) /gda/disease/C0006142?limit10 # Variant-disease for rs1042522 /vda/variant/rs1042522实际请求时需拼接 Base URL 并携带认证头例如查询 TP53 的高置信度策展关联curl -s -H Authorization: Bearer token \ -H Accept: application/json \ https://www.disgenet.org/api/gda/gene/7157?sourceCURATEDmin_score0.3limit10formatjson三个方向的解读要点gene → disease/gda/gene/{gene_id}用于回答「这个基因与哪些疾病相关」属于 targeted lookup第一页通常已够用若要穷举全部关联则需按分页参数翻页并做数量对账。disease → gene/gda/disease/{disease_id}用于回答「这个疾病与哪些基因相关」。用户给出疾病名时需要先解析为 UMLS CUI——技能内的标识符解析路径见 SKILL.md 的 Identifier Resolution是疾病名先到 Open Targets 或 Monarch 检索得到 EFO/MONDO ID再用交叉映射找到对应的 UMLS CUI参考文档示例中的乳腺癌编码C0006142即为该疾病在 UMLS 中的概念编号。variant → disease/vda/variant/{rsid}用于回答「这个 rsID 变异与哪些疾病/表型相关」直接接受 dbSNP rsID不需要坐标换算。标识符失败时的排查路径按 SKILL.md 的错误恢复流程若某次调用失败或返回空结果优先检查标识符格式基因符号如TP53需要先用 NCBI Gene 检索得到整数 ID7157再查 DisGeNETrsID 应形如rs1042522不要混入基因组坐标若疾病名查询失败尝试通过 Open Targets / Monarch 解析出标准疾病概念编号后再映射 UMLS CUI多数据库均无结果时如实告知用户哪个数据库失败、错误信息以及替代方案。速率限制与免费替代方案参考文档明确指出速率限制策略免费学术档大约每天数百次请求另有付费档位可供更高吞吐场景使用。这与技能对受速率限制 API 的统一处理原则一致——避免并发放大、遇 HTTP 429/503 稍候重试一次、单次穷举检索在超过 10,000 条记录或 100 次 API 调用前先征求用户确认参见 SKILL.md 的 Making API Calls 章节。对学术用途而言应在单次会话内控制调用量优先用min_score/source参数在服务端收窄结果而不是靠翻页拉全量再做本地过滤。无 API Key 的免费替代参考文档建议改用Open Targets获取疾病-基因关联数据database_selection_guide.md 进一步补充 Monarch Initiative 也可作为备选。Open Targets 是 POST-only GraphQL 接口不能走 WebFetchGET必须改用curlPOST 请求示例见 SKILL.md 的 POST-Only APIs 表格。当无法访问 DisGeNET 时应明确告知用户原因并说明已用哪个替代数据源回答同一问题。查询结果的可复现输出与溯源为保证任何检索结果都能被他人或另一个 Agent 重复建议将 DisGeNET 查询纳入 SKILL.md 定义的输出格式。一次规范的 DisGeNET 查询应至少包含## Retrieval Summary - Target: TP53 相关疾病关联top 10 - Scope: targeted lookup - Access date: 访问日期 - Databases queried: DisGeNET ## Results 简明结果表格而非无界原始 dump ## Provenance - Endpoint(s): /gda/gene/7157 - Parameters: sourceCURATED, min_score0.3, limit10, formatjson - Identifier conversions: TP53 → NCBI Gene ID 7157 - Count reconciliation: 预期/实际返回数量 - Local filters: 无 - Warnings: ...要点包括标注访问日期数据库版本会随时间变化、记录端点到参数到标识符换算的完整链条、对返回的文本型字段如来自文献挖掘的描述按不可信第三方数据处理——不回显原始响应进 shell 命令、不把响应内容当指令执行retrieval-contract.md 第 6 节。若查询无结果应明确说明「无结果」而非省略不报。小结DisGeNET 参考文档给出了一个典型的「带密钥 REST 数据源」的完整调用范式注册获取 API Key → POST/auth/换取 Bearer token → 按实体类型选择/gda/gene、/gda/disease、/vda/gene、/vda/variant端点 → 用source、min_score、min_ei、format、limit/offset控制返回内容 → 用curl完成可重复的受限调用并将结果格式化为带溯源与数量对账的结构化输出。遇到无密钥或结果为空的情形可按本文档与技能规则回退到 Open Targets / Monarch 等免费替代源。相关参考文件均可在本仓库 skills/database-lookup/references/ 目录下继续查阅同目录的 retrieval-contract.md 提供了所有数据库通用的审计清单而 database_selection_guide.md 可帮助判断何时应该优先选择 DisGeNET 而非其他疾病数据库。【免费下载链接】scientific-agent-skillsTurn any AI agent into an AI Scientist. The #1 Agent Skills library for science, used by 190,000 scientists worldwide. 165 ready-to-use validated skills plus 100 scientific databases covering biology, chemistry, medicine, and drug discovery. Compatible with Cursor, Claude Code, Codex, Pi, Antigravity, and the open Agent Skills standard.项目地址: https://gitcode.com/GitHub_Trending/cl/scientific-agent-skills创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表