欢迎光临
我们一直在努力

文本分割(Chunking)策略+向量化与嵌入 数据库构造B

Python编程分割实现

目录结构:

⚙️ 参数说明(用默认值)
| 参数 | 简写 | 默认值 | 说明 |
|——|——|——–|——|
| `–input` | `-i` | 必需 | 输入目录或PDF文件路径 |
| `–output` | `-o` | `output` | 输出目录 |
| `–chunk-size` | – | `700` | Chunk大小(字符数) |
| `–overlap` | – | `150` | Chunk重叠大小(字符数) |
| `–format` | – | `csv` | 输出格式(csv/json) |
| `–csv-mode` | – | `merged` | CSV输出模式(merged/standard) |
| `–single-file` | – | `False` | 处理单个文件 |
| `–output-name` | – | `dify_knowledge_base` | 输出文件名 |
| `–add-separator` | – | `True` | 启用Dify分隔符 |
| `–no-separator` | – | `False` | 禁用Dify分隔符 |
| `–separator` | – | 特殊字符串 | 自定义Dify分隔符 |

LLM安全(9924 chunks)+漏洞挖掘(11576 chunks)+漏洞修复(2974 chunks)+其他(4216 chunks)

共计 28690 chunks

Dify上传csv,分段设置:

分段最大长度 1024 characters(防止csv本身切割数据收到损害)

分段重叠长度:0 characters(在python脚本中已完成分段重叠,此处不需要)

分段标识符:(预先设置,保持python脚本分割后的chunk完整性)

索引方式:高质量

Embedding模型:qwen3-embedding:4b

检索设置:向量检索

Rerank模型:bge-reranker-v2-m3

Top K:3 Score阈值:0.5 (均为暂定,可改)

赞(0)
未经允许不得转载:171主机测评 » 文本分割(Chunking)策略+向量化与嵌入 数据库构造B
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址