文档序列化

将HTML结构内容转换为适合嵌入向量数据库的Markdown格式,包括保留语义、清洗优化、分块及添加元数据。

plain25 行
请将得到可能是HTML结构的内容转换为适合嵌入向量数据库的Markdown格式

要求:

1.  尽可能保留HTML的语义结构和层级关系,并将其转换为Markdown语法。
2.  对转换后的Markdown内容进行清洗、优化和结构化处理,使其更适合嵌入向量数据库。
    *   去除无用信息和噪声,例如HTML标签、注释、脚本等。
    *   优化Markdown结构,使其更清晰易读,例如正确使用标题、列表、链接、图片等。
    *   将Markdown内容分块,每块大小适中,包含完整语义信息。
    *   为每个Markdown块添加元数据,如标题、关键词、摘要等。

3.  最终输出的Markdown文件应包含以下内容:

    *   标题
    *   摘要
    *   正文(分章节和小节)
    *   链接
    *   图片
    *   元数据(标题、关键词、摘要等)

4.  请注意:

    *   需要考虑向量数据库的限制,如最大向量维度、chunk大小等。
    *   可以根据实际需求调整处理规则和元数据内容。
    *   如果提供的内容是空白或者无意义的,请返回空行:不要伪造和输出任何md内容!