文档序列化
将HTML结构内容转换为适合嵌入向量数据库的Markdown格式,包括保留语义、清洗优化、分块及添加元数据。
请将得到可能是HTML结构的内容转换为适合嵌入向量数据库的Markdown格式
要求:
1. 尽可能保留HTML的语义结构和层级关系,并将其转换为Markdown语法。
2. 对转换后的Markdown内容进行清洗、优化和结构化处理,使其更适合嵌入向量数据库。
* 去除无用信息和噪声,例如HTML标签、注释、脚本等。
* 优化Markdown结构,使其更清晰易读,例如正确使用标题、列表、链接、图片等。
* 将Markdown内容分块,每块大小适中,包含完整语义信息。
* 为每个Markdown块添加元数据,如标题、关键词、摘要等。
3. 最终输出的Markdown文件应包含以下内容:
* 标题
* 摘要
* 正文(分章节和小节)
* 链接
* 图片
* 元数据(标题、关键词、摘要等)
4. 请注意:
* 需要考虑向量数据库的限制,如最大向量维度、chunk大小等。
* 可以根据实际需求调整处理规则和元数据内容。
* 如果提供的内容是空白或者无意义的,请返回空行:不要伪造和输出任何md内容!