微信扫码
与创始人交个朋友
我要投稿
今天给大家带来一篇腾讯最新开源的向量模型的论文,模型开源,在CMTEB上拿了第一名!嵌入/向量模型是Agent、RAG中很关键的一个组件,所以也是一个卷的很激烈的一个领域。
Conan-embedding: General Text Embedding with More and Better Negative Samples
随着RAG(检索增强生成)技术的日益普及,嵌入模型的能力正受到越来越多的关注。嵌入模型主要通过对比学习进行训练,其中负样本是一个关键组件。以往的研究提出了各种硬负样本挖掘策略,但这些策略通常被作为预处理步骤使用。在本文中,我们提出了conan-embedding模型,该模型最大化地利用更多、更高质量的负样本。具体来说,由于模型处理预处理负样本的能力在训练过程中不断发展,我们提出了一种动态硬负样本挖掘方法,以便在整个训练过程中使模型接触到更多具有挑战性的负样本。其次,对比学习需要尽可能多的负样本,但受限于GPU内存的限制。因此,我们使用了Cross-GPU平衡损失(Cross-GPU balancing Loss)来提供更多的负样本进行嵌入训练,并在多个任务之间平衡批量大小。此外,我们还发现LLM(大型语言模型)生成的提示-响应对可以用于嵌入训练。我们的方法有效地增强了嵌入模型的能力,目前在Chinese Massive Text Embedding Benchmark(CMTEB)排行榜上排名第一。
模型开源地址:https://huggingface.co/TencentBAC/Conan-embedding-v1
Conan-embedding模型,主要是提出了两个的新点子:Dynamic Hard Negative Mining和Cross-GPU Batch Balance Loss
论文里还提到了,用LLM生成的prompt-response对来训练嵌入模型,这样可以让模型更聪明,处理起文本来更得心应手。
Conan-embedding在CMTEB的六个任务上都取得了优异的成绩,超越了之前所有的模型。消融研究也证明了动态硬负样本挖掘和CBB Loss这两个方法的有效性。
53AI,企业落地应用大模型首选服务商
产品:大模型应用平台+智能体定制开发+落地咨询服务
承诺:先做场景POC验证,看到效果再签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2024-07-18
2024-05-05
2024-07-09
2024-05-19
2024-07-09
2024-06-20
2024-07-07
2024-07-07
2024-07-08
2024-07-09
2024-11-25
2024-11-06
2024-11-06
2024-11-05
2024-11-04
2024-10-27
2024-10-25
2024-10-21