跳转到内容

表格数据分析与可视化

  • 上传一份销售/运营数据,要分析和图表
  • 几十个表格要合并成一个总表
  • 需要写复杂公式(VLOOKUP、透视、条件汇总)
  • 数据清洗(去重、格式统一、缺失值处理)

别直接说“分析一下”。先让它报结构:

读一下 ~/data/sales.xlsx,告诉我:

  1. 有几个 sheet,分别是什么
  2. 每个 sheet 的行数、列名、数据类型
  3. 有没有缺失值、重复行、格式不一致的地方

关键:这一步能发现 80% 的坑。比如日期列其实是文本格式、金额列混了货币符号、有隐藏的空行。

AI 不知道你关心什么指标。要说清楚:

❌ "分析一下这份销售数据"
✅ "按地区汇总销售额和订单量,找出 Top 5 地区和环比下滑超过 20% 的地区,
输出结论 + 一张柱状图 + 一张趋势折线图"

数据没洗干净就分析,结论一定是错的。常见清洗项:

问题 处理
重复行 按主键去重,保留最新一条
日期是文本 转成真日期格式
金额带符号/单位 统一成数值
缺失值 明确策略:填 0 / 删除 / 单独标注

一定要问它清洗掉了多少行。删了 30% 的数据却不告诉你,分析结论就不可信。

指定图表类型和维度:

生成三张图:

  1. 各地区销售额柱状图(降序)
  2. 月度趋势折线图(12 个月)
  3. 品类占比饼图 图表要有标题和轴标签,配色统一

如果它写了公式,一定要校验

校验工作簿里所有公式,列出计算错误的单元格

这一步能抓出引用错位、除零、类型不匹配等问题。写完公式不校验 = 埋雷。

常见需求:几十个分表合成一个总表。

把 ./reports/ 目录下所有 xlsx 合并成一个总表:

  • 每个文件的数据追加到同一个 sheet
  • 新增一列“来源文件”记录数据出处
  • 列名不一致的先对齐,对齐不了的列出来给我看
  • 合并后校验总行数 = 各分表行数之和

加“来源文件”列很重要——后面发现某批数据有问题,能追溯到源头。

分析完后追一句:

这个结论是怎么算出来的?用的是哪几列、什么口径?

它说不清计算口径,说明结论可能有问题。这一步能抓出“看起来合理其实算错了”的情况。

坑一:大文件很慢 十万行以上的表,直接处理会卡。先抽样或聚合再分析。

坑二:中文乱码 导出 CSV 时注意编码,中文场景用 UTF-8-BOM,否则 Excel 打开是乱码。

坑三:日期格式 跨地区数据的日期格式(2026/09/08 vs 09/08/2026)容易解析错误,清洗时明确指定。

AI 长文写作流水线——从选题到成稿。