Python编程分割实现
目录结构:
⚙️ 参数说明(用默认值)
| 参数 | 简写 | 默认值 | 说明 |
|——|——|——–|——|
| `–input` | `-i` | 必需 | 输入目录或PDF文件路径 |
| `–output` | `-o` | `output` | 输出目录 |
| `–chunk-size` | – | `700` | Chunk大小(字符数) |
| `–overlap` | – | `150` | Chunk重叠大小(字符数) |
| `–format` | – | `csv` | 输出格式(csv/json) |
| `–csv-mode` | – | `merged` | CSV输出模式(merged/standard) |
| `–single-file` | – | `False` | 处理单个文件 |
| `–output-name` | – | `dify_knowledge_base` | 输出文件名 |
| `–add-separator` | – | `True` | 启用Dify分隔符 |
| `–no-separator` | – | `False` | 禁用Dify分隔符 |
| `–separator` | – | 特殊字符串 | 自定义Dify分隔符 |
LLM安全(9924 chunks)+漏洞挖掘(11576 chunks)+漏洞修复(2974 chunks)+其他(4216 chunks)
共计 28690 chunks
Dify上传csv,分段设置:
分段最大长度 1024 characters(防止csv本身切割数据收到损害)
分段重叠长度:0 characters(在python脚本中已完成分段重叠,此处不需要)
分段标识符:(预先设置,保持python脚本分割后的chunk完整性)
索引方式:高质量
Embedding模型:qwen3-embedding:4b

检索设置:向量检索
Rerank模型:bge-reranker-v2-m3
Top K:3 Score阈值:0.5 (均为暂定,可改)





