我要投稿

MedBench医疗大模型测评平台升级

发布日期：2024-07-21 10:44:31 浏览次数： 2313

近日，中文医疗大模型开放评测平台MedBench迎来全面升级，新增大模型API评测方式，对于开放性问答评估，由医学专家人工标注“给分点”，进一步确保了评测结果的专业性与公正性。

模型的能力评测不仅是技术进步的度量衡，更是推动模型迭代和优化的重要驱动力。MedBench由上海人工智能实验室与上海市数字医学创新中心联合多家机构推出。作为医疗领域的专业评测基准，MedBench已加入司南大模型开源开放评测体系（OpenCompass）。自发布以来，MedBench已为387个医疗大模型提供评测。

该成果相关论文《MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models》近期已刊发于全球计算机系统领域期刊《Big Data Mining and Analytics》（中科院一区期刊，近两年平均影响因子10.6）。

论文标题：MedBench: A Comprehensive, Standardized, and Reliable Benchmarking System for Evaluating Chinese Medical Large Language Models

论文链接：https://www.sciopen.com/article/10.26599/BDMA.2024.9020044

立即参与评测：https://medbench.opencompass.org.cn/home

全面升级：丰富评测方式，扩充数据集

依托专业医疗机构的专家经验和知识储备，MedBench设置了医学语言理解、医学语言生成、医学知识问答、复杂医学推理和医疗安全和伦理等5大维度评测维度，为推动医疗大模型的研发与应用实践提供指标参考。

近期，上海AI实验室联合团队对MedBench进行了全面升级，新增加模型API接入评测，并优化了开放性问答的评估指标，由医学专家人工标准评测“给分点”，进一步确保评测结果的专业性和公正性。

同时，MedBench的评测数据集、评测方法以及系统功能方面也迎来扩充及升级，提供更为丰富、真实的医疗实践场景。

动态评估：提升评测准确性

MedBench集纳了约30万道中文医疗专业测评题目，囊括医学考试、医学问答、患者服务、医学问诊、病历分析、病历生成和辅助诊断等场景数据，覆盖多个临床科室。

为了对医疗大模型的能力进行全面评估，MedBench包含5个评估维度：医学语言理解、医学语言生成、医学知识问答、复杂医学推理以及医疗安全和伦理。评测过程采用全自动化、云基础架构，有效解决标准化和答案泄露问题。通过动态评估机制，将选项循环打乱和随机提示匹配，显著提高评估的科学性和准确性。

开放共享：推动专业互认体系建设

自发布以来，MedBench即面向全球开放，与各界共同推进医疗大语言模型全面、专业、互认的评测体系建设。自发布以来，MedBench已为387个医疗大模型提供了能力指标和提升方向参考。

目前，上海交通大学医学院附属瑞金医院、上海交通大学医学院附属新华医院、四川大学华西医院、广州实验室、上海交通大学、复旦大学、华东理工大学、同济大学、香港中文大学（深圳）、上海市卫生健康统计中心、华东师范大学等机构陆续加入平台共建序列，汇聚行业经验，助力医疗智慧化转型。

基于医疗大模型评测领域的积累和实践，上海AI实验室与上海市卫生健康统计中心联合支持《第二届全国数字健康创新应用大赛》相关成果评估工作，加速人工智能与医疗的交叉研究与协同创新。

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-04-20

Google A2A的野心：AI Agent全球大一统

2025-04-20

我对扣子空间与Manus的产品的思考

2025-04-20

MCP很好，但安全问题不容忽视，智能体安全框架可以解决

2025-04-20

赛博中医大师已经开始为你把脉了

2025-04-20

OpenAI 官方定义：到底什么是 AI Agent？

2025-04-20

AIGC应用必坑指南与落地实战方法论

2025-04-20

「合成用户」进化：基于访谈生成的 1000 个虚拟用户，能产出洞察吗

2025-04-20

扣子空间火了，是国产通用 agent 一个好的开始，比 manus 还差不少

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

本地部署大模型？看这篇就够了，Ollama 部署和实战

2024-08-13

16个具有“联网搜索”功能的AI：总有一个适合你！

2024-06-13

Cursor 一个真正让程序员产生危机感的 AI 编程工具

2024-08-21

OpenAI o1与GPT4o的对比分析

2024-09-23

大模型｜“上下文长度”和“上下文窗口”不再傻傻分不清楚！

2024-07-31

一文带你了解大模型——智能体（Agent）

2024-05-28

50+个AI大模型在不同领域的应用案例

2024-08-04

全面对比dify、coze、streamlit、chainlit

2024-04-26

【深度】AI搜索产品深度分析-搜索原理和商业模式分析

2024-07-09

一文读懂OpenAI新发布o1系列大模型

2024-09-17

大家都在问

OpenAI 官方定义：到底什么是 AI Agent？

2025-04-20

大概念模型（Large Concept Models）会取代提示工程吗？

2025-04-18

LLM中的Token和Embedding到底是啥？

2025-04-16

探秘 LLM Agents：ReAct 框架藏着哪些惊喜？

2025-04-13

MCP、Function Calling 有什么区别？与 AI Agent 有什么关系？

2025-04-13

有了MCP，还需要深入研究Agent吗？

2025-04-13

大模型备案详解：哪些企业需要备案？如何高效准备？

2025-04-12

一夜之间，所有AI都会“说普通话”！谷歌A2A协议到底有多猛？

2025-04-12

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB

应聘简历请发送至： ceo@53ai.com

友情链接：

CopyRight © 2012-2024 深圳市博思协创网络科技有限公司版权所有

粤ICP备17114055号

广州：广州市华景路37号(华景软件园)暨南大学科技大厦6楼（整层）

深圳：深圳市福田区泰然四路29号天安创新科技广场一期A座1204

上海：上海市浦东新区金新路58号1602室

微信扫码
和创始人交个朋友

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部