先在本地检查 CSV 的列名、行数、空值和重复,再按需写入新副本;保留原文件,结构异常先修,不把坏行送去分类。
来源 · JevLog 原创 · 本站原创
2026-09-21 · 编辑整理,未调用真实模型
背景 / 问题
Section titled “背景 / 问题”分类前先确认 CSV 读到正确列,避免空值、重复导出或行宽错位影响结果。脚本仅本地预检,不联网、不补猜缺失内容,也不静默删行。
- Python 3.10+;使用 UTF-8 的 CSV、TSV 或分号分隔文件。
- 知道待判断文本列的名字。

分类前先查 CSV 列名、空值、重复与行宽。AI 概念插画。
1. 从源系统导出一个小范围副本
Section titled “1. 从源系统导出一个小范围副本”导出含稳定 ID 和文本列的小样本,保留原件并核对表头;Excel 先选定要导出的工作表。
2. 只检查,不急着写文件
Section titled “2. 只检查,不急着写文件”先运行预检,只报告行数、列名、空白和重复,不生成新 CSV;路径列名错先修正。
python scripts/prepare_csv.py examples/customer_feedback.csv --text-column feedback3. 先修复结构错误
Section titled “3. 先修复结构错误”修复缺列、重复列或行宽错误后重跑;让 CSV 解析器处理带引号的逗号和换行。
4. 弄清楚你到底要对什么去重
Section titled “4. 弄清楚你到底要对什么去重”按 ID 查看重复文本;不同客户记录不删,缓存也只用于请求和上下文一致的情况。
5. 写出新副本,重新核对行数
Section titled “5. 写出新副本,重新核对行数”另存到不存在的新文件,再核对行数、ID 和原文;用表格打开前检查公式风险。
python scripts/prepare_csv.py examples/customer_feedback.csv --text-column feedback --output clean_feedback.csv练习可用样本:下载 customer_feedback.csv(CSV Studio / 本地练习;非本站实测结果)。
你能生成本地预检报告,并按需另存副本,用 ID 确认原始行未丢失;预检不代表分类正确。
- 你能说明输入来自哪里、哪些字段会参与处理。
- 你保留了原始记录及不确定、失败和人工修改的结果。
- 你能区分本地练习、作者演示与自己真实调用后的测试。
可以直接上传 XLSX 吗?
Section titled “可以直接上传 XLSX 吗?”这个原型接受 CSV/TSV。请从原应用导出 UTF-8 文本表格,不要只把扩展名改成 .csv。