微信扫码
与创始人交个朋友
我要投稿
这是一个与任务无关的框架,它将知识图谱(KG)的显性知识与大型语言模型(LLM)的隐含知识结合起来。这是该工作的arXiv预印本 https://arxiv.org/abs/2311.17330 。
我们在这里利用一个名为SPOKE(https://spoke.ucsf.edu/)的大规模生物医学知识图谱作为生物医学背景的提供者。SPOKE已经整合了来自不同领域的40多个生物医学知识库,每个知识库都专注于生物医学概念,如基因、蛋白质、药物、化合物、疾病及其相关连接。
SPOKE由21种不同类型的超过2700万个节点和55种类型的5300万条边组成(https://doi.org/10.1093/bioinformatics/btad080)。
KG-RAG的主要特点是从SPOKE KG中提取“提示感知上下文”,其定义为:足以回答用户提示的最小上下文。
因此,这个框架通过从生物医学KG中获得的优化领域特定的“提示感知上下文”,赋予了一个通用型的LLM更强大的功能。
询问 GPT-4 关于上述药物:
没有KG-RAG
注意:此示例是使用KG-RAG v0.3.0运行的。我们是通过终端来启动GPT,而不是通过chatGPT浏览器。分析中的温度参数设置为0。参考此yaml文件进行参数设置,包括KG-RAG。
有KG-RAG
注意:此示例是使用KG-RAG v0.3.0运行的。分析过程中,温度参数设置为0。有关参数设置,请参阅此yaml文件。
conda create -n kg_rag python=3.10.9
conda activate kg_rag
cd KG_RAG
pip install -r requirements.txt
Step 4: 更新config.yaml
注意:还有另一个名为system_prompts.yaml的yaml文件。它已经填充好,并保存了KG-RAG框架中使用的所有系统提示。
设置脚本以交互方式运行。
运行设置脚本将:
1.为KG-RAG创建疾病向量数据库
2.在您的机器上下载Llama模型(可选,您可以跳过此步骤,完全没有问题)
python -m kg_rag.run_setup
你可以使用GPT和Llama模型来运行KG-RAG。
python -m kg_rag.rag_based_generation.GPT.text_generation -g <your favorite gpt model - "gpt-4" or "gpt-35-turbo">
示例:注意:以下示例在AWS p3.8xlarge EC2实例上运行,并使用KG-RAG v0.3.0。
用GPT的交互模式
python -m kg_rag.rag_based_generation.GPT.text_generation -i True -g <your favorite gpt model - "gpt-4" or "gpt-35-turbo">
python -m kg_rag.rag_based_generation.Llama.text_generation -m <method-1 or method2, if nothing is mentioned it will take 'method-1'>
示例
注意:以下示例是在AWS p3.8xlarge EC2实例上运行,并使用KG-RAG v0.3.0。
用Llama交互模式
python -m kg_rag.rag_based_generation.Llama.text_generation -i True -m <method-1 or method2, if nothing is mentioned it will take 'method-1'>
@article{soman2023biomedical,
title={Biomedical knowledge graph-enhanced prompt generation for large language models},
author={Soman, Karthik and Rose, Peter W and Morris, John H and Akbas, Rabia E and Smith, Brett and Peetoom, Braian and Villouta-Reyes, Catalina and Cerono, Gabriel and Shi, Yongmei and Rizk-Jackson, Angela and others},
journal={arXiv preprint arXiv:2311.17330},
year={2023}
}
SPOKE KG可以通过以下链接访问:
https://spoke.rbvi.ucsf.edu/neighborhood.html。也可以使用REST-API访问
(https://spoke.rbvi.ucsf.edu/swagger/)。
KG-RAG代码可在
https://github.com/BaranziniLab/KG_RAG 下载。本研究中使用的生物医学数据集(一跳问题、两跳问题、真假问题、多选题问题、药物重新定位问题、SPOKE KG中的疾病上下文)可供研究界使用,位于同一GitHub存储库中。
原文 - [2311.17330] Biomedical knowledge graph-enhanced prompt generation for large language models (arxiv.org)
欢迎点赞关注
----------------------------
愿景:
打造世界领先的认知智能引擎
加速人类知识工作自动化
欢迎加微信交流
个人简介
人工智能创业公司柯基数据(KG Data)创始人&CEO,中国致公党
毕业于中科院软件所人机交互与智能信息处理专业,曾在全球领先的智能数据公司汤森路透担任中国区首席顾问
20年人工智能(KG知识图谱、GenAI大模型)研发、产品、咨询和产业化落地解决方案经验。医药和工业制造等行业数智化转型及落地深度实践者。服务了数十家世界五百强跨国和国内药械企业、CRO,国家卫健委、三甲医院和医疗科研院所,能源制造及工信部、中电科、航天等政府和央国企大客户
现任职
中国人民大学信息学院、东南大学信息工程学院企业硕导
中文信息学会语言与知识计算专业委员会委员、医疗健康与生物信息专委委员,中国科学技术情报学会知识组织专委会委员
开放知识图谱联盟(OpenKG.cn)发起成员,技术监督委员会委员
中华预防医学会慢性病预防与控制分会委员,世界中医药学会联合会理事,中国中医药信息学会标准委员会常务理事,中国生物医药产业链创新与转化联盟医药情报专委会副主委,中国卫生信息与健康医疗大数据学会委员
中国计算机学会CCF高级会员,工信部知识图谱标准委员会委员
53AI,企业落地应用大模型首选服务商
产品:大模型应用平台+智能体定制开发+落地咨询服务
承诺:先做场景POC验证,看到效果再签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2024-03-30
2024-04-26
2024-05-10
2024-04-12
2024-05-28
2024-05-14
2024-04-25
2024-07-18
2024-04-26
2024-05-06
2024-12-22
2024-12-21
2024-12-21
2024-12-21
2024-12-21
2024-12-20
2024-12-20
2024-12-19