每年到了满意度调研、用户访谈、内部评优的时候,各部门最怕的不是发问卷,而是收上来那一堆根本没法直接分析的脏数据。开放题有人填“无”、有人填“没意见”、还有人把姓名写进年龄列;同样的性别,“男/女性/M/F/1/0”能出现六种写法;同一道题因为逻辑跳转,一半人留下空白列。过去这类活儿要么人工在 Excel 里一点点改,要么把整份带着手机号、部门、评分的表往某个云端 AI 工具上一传了事。前者费人,后者费心——毕竟问卷里往往夹着受访者的敏感信息。
场景与功能框架图

场景与功能框架图
为什么问卷数据总是这么脏
问卷的“脏”不是偶发,而是结构性的。填空题没有下拉约束,填什么全凭受访者心情;矩阵题在导出的 Excel 里会被拉成几十列,量表和开放项混在一起;逻辑跳转会造成大量“本不该有值”的空单元格;复制粘贴又带来全角半角、首尾空格、不可见字符。更麻烦的是,同一道单选题在不同批次的导出里,编码可能从“A/B/C”变成“1/2/3”。这些脏东西不处理,后面所有的交叉分析、显著性检验都是空中楼阁。
传统做法为什么越改越乱
最朴素的办法是人工对着 Excel 改。可一份两三千份的问卷,光是统一性别写法、清理开放题、拆矩阵题,就得耗掉两三天,而且边改边出错——你永远不知道自己漏了哪一行。另一条路是把表传上云端 AI 工具,让对方帮你清洗。听起来省事,但问卷数据常常包含受访者手机号、工号、部门归属,一旦离开本地,数据外泄的风险就不在你手里了;加上这类工具大多是积分或订阅制,用一次烧一次额度,月底一看账单比外包还贵。
方案登场:本地跑脚本,而不是把数据交给别人
数以轻舟Agent 是一款本地安装的 Excel 数据清洗工具,数据文件全程在本地处理(不进聊天框、不传第三方 SaaS)。你用自然语言下指令,它在本地调用大模型生成并运行 Python(pandas/openpyxl)脚本,把脏问卷跑成干净的底表;你不用自己写代码,也能拿到结果和一份可读、可改的脚本。它是“软件一次买断(算力需自购)”的模式——你买的是软件本体,模型算力(token)由你自己接入、自己购买,平台不代充、不绑定套餐。并且它目前只处理 Excel(.xlsx/.xls)和 CSV(.csv),不支持 PDF、图片、Word 这类非表格文件,这一点我后面还会强调。
分步实操:三句话跑完一次清洗

操作步骤参考
实际用起来很简单。第一步,把问卷导出的 Excel 放进本地工作台,文件不传到任何网上;第二步,用一句话下指令,比如“统一性别写法、清理开放题里的‘无/没意见’、把矩阵题拆成独立列、删除全空列”;第三步,几十秒后拿到干净底表,每一步生成了什么脚本都能回看、能改。整个过程数据始终在你自己的电脑上。
真实场景:2000 份满意度问卷,从 3 天到 20 分钟
有个做内部满意度调研的同事,过去每次回收两千多份问卷,光清洗就要熬夜三天。后来他在本地用 数以轻舟Agent 下了一条指令:去重(同一手机号只留一条)、统一五级量表的编码、把开放题里的“无/暂无/—”统一成空值、删除占比超 90% 的空白列。二十分钟后,他拿到一张可以直接做交叉分析的干净表,连带着一份 pandas 脚本,后续每月复用到下一批问卷上。他说最爽的不是快,是“数据从来没离开过我这台电脑”。
对比:本地清洗 vs 云端上传型工具
和 ChatExcel 这类需要把文件上传的云端工具比,最大的差别在两点:一是数据流向,数以轻舟Agent 是本地处理,文件不进聊天框、不传第三方;二是成本结构,它是一次买断软件、算力自己管,而不是按月订阅或按积分扣费。对于问卷这种常带敏感信息的场景,前者几乎是刚需。当然,对比只在 xlsx/csv 场景里成立——PDF、图片、Word 它暂不支持,别拿去比这些。
什么情况适合,什么不适合
适合谁:手里有问卷导出的 Excel/CSV、被脏数据折磨、愿意用本地工具、不排斥“背后跑 Python 脚本处理数据”的人;本就卡在数据处理上、想省掉自己写代码的人尤其对路。不适合谁:坚决只要纯云端点击式操作界面、听到“脚本/代码”就排斥的人,请谨慎——它本就不是云端黑盒 SaaS,而是脚本驱动的本地工具。关于买断:产品是软件一次买断,但模型算力(token)需你自行接入与购买,平台不代充;没有 token 额度,生成脚本这一步跑不了,这点必须讲在前面。能力边界:目前只处理 .xlsx/.xls 与 .csv,不支持 PDF/图片/Word,如果你要处理的是扫描件或 Word,这篇可能帮不上。

