我要投稿

告别传统的文档切块！JinaAI提出Late Chunking技巧

发布日期：2024-09-05 04:57:39 浏览次数： 2284 作者：探索AGI

正常在处理大规模数据建索引的时候，一般我们需要先对文档进行分块，建立向量索引。而这个分块大小，设置的都是比较短的，比如512。一方面是早期bert的处理长度的限制，另一个方面是如果文本太长，包含的信息就越多，那么可能比较难用一个向量来表征出来。

对于前者，如果持续关注向量模型的同学可以发现，无论是开源的BGE系列，还是闭源的API，都在往一个较长的上下文靠齐（比如说8192）。那这就有一些矛盾了，如果工业界只需要512的上下文的向量模型，为什么还要往更长的8192模型发展呢？

对于传统的分块，类似于固定长度的分块。带来的一个比较大的问题是，上下文缺失。就像下图一样，一个句子的主语在段落开头，后面的段落/句子中，有一些代词比如 It's， The city等等来表示主语。这种情况下确实主语的句子基本上就变得比较断章取义了~

与先分块后向量化不同，JinaAI最新提出的“Late Chunking”方法是一个相反的步骤，首先将整个文本或尽可能多的文本输入到嵌入模型中。在输出层会为每个token生成一个向量表示，其中包含整个文本的文本信息。然后我们可以按照需要的块大小对对向量进行聚合得到每个chunk的embedding。这样的优势是，充分利用长上下文模型的优势，同时又不会让每个块的信息过多，干扰向量表征。

在测试中，在所有情况下，与常规的分块相比，Late Chunking提高了召回ndcg@10。在某些情况下，它的性能也优于将整个文档编码为单个嵌入。并且，文档越长，Late Chunking策略就越有效。

开源的实验代码：https://colab.research.google.com/drive/15vNZb6AsU7byjYoaEtXuNu567JWNzXOz?usp=sharing&ref=jina-ai-gmbh.ghost.io

53AI，企业落地大模型首选服务商

产品：场景落地咨询+大模型应用平台+行业解决方案

承诺：免费场景POC验证，效果验证后签署服务协议。零风险落地应用大模型，已交付160+中大型企业

相关资讯

2025-04-08

智谱CEO张鹏：模型仍是核心，工程化只是权宜之计

2025-04-08

All in 医疗，百川胜算几何？

2025-04-08

数势科技黎科峰：CEO们极度焦虑，怕错过AI时代

2025-04-08

奇点降临，Manus 诞生背后丨青源Workshop观点集锦

2025-04-08

Copilot：您的AI伴侣-微软50周年系列更新

2025-04-08

基于Flow-matching的扩散模型原理解读

2025-04-08

如何看待MCP？大模型工具调用的解耦！

2025-04-07

如何理解政务大模型？

了解更多

了解更多

160+中大型企业正在使用53AI

立即咨询预约演示

把握AI发展的机遇，共同探索、共同进步

2025-01-22

如何打造基于GenAI的员工服务机器人

2025-01-22

热点资讯

本地部署大模型？看这篇就够了，Ollama 部署和实战

2024-08-13

16个具有“联网搜索”功能的AI：总有一个适合你！

2024-06-13

Cursor 一个真正让程序员产生危机感的 AI 编程工具

2024-08-21

OpenAI o1与GPT4o的对比分析

2024-09-23

大模型｜“上下文长度”和“上下文窗口”不再傻傻分不清楚！

2024-07-31

一文带你了解大模型——智能体（Agent）

2024-05-28

50+个AI大模型在不同领域的应用案例

2024-08-04

全面对比dify、coze、streamlit、chainlit

2024-04-26

【深度】AI搜索产品深度分析-搜索原理和商业模式分析

2024-07-09

一文读懂OpenAI新发布o1系列大模型

2024-09-17

大家都在问

All in 医疗，百川胜算几何？

2025-04-08

如何理解政务大模型？

2025-04-07

伯克利最新研究：为什么多 Agent 系统总是“高期待、低表现”？

2025-04-07

刚刚，DeepSeek公布推理时Scaling新论文，R2要来了？

2025-04-07

【AI知识点】什么是 Agentic Workflows？

2025-04-07

VSCode发布Agent+MCP，Cursor劲敌又回来了？

2025-04-06

深入解析Agentic AI架构：如何打造自主决策的智能体？

2025-04-06

大语言模型是如何推理的？

2025-04-05

热门标签

内容创作大模型技术个人提效 langchain llamaindex 多模态技术 RAG技术智能客服知识图谱模型微调 RAGFlow coze Dify Fastgpt Bisheng Qanything AI+汽车 AI+金融 AI+工业 AI+培训 AI+SaaS 提示词框架提示词技巧 AI+电商 AI面试数字员工 ChatBI 知识管理开源大模型智能营销智能硬件智能化改造 AI+医疗 MaxKB

应聘简历请发送至： ceo@53ai.com

友情链接：

CopyRight © 2012-2024 深圳市博思协创网络科技有限公司版权所有

粤ICP备17114055号

广州：广州市华景路37号(华景软件园)暨南大学科技大厦6楼（整层）

深圳：深圳市福田区泰然四路29号天安创新科技广场一期A座1204

上海：上海市浦东新区金新路58号1602室

微信扫码
和创始人交个朋友

联系我们

售前咨询

预约演示

微信扫码

添加专属顾问

回到顶部