W07 · 验收 W06 / 发布任务 3

先验收 W06,再把脏数据变成可信表

本周课堂先核验 W06 支付实验报告;课堂结束后再开始本页数据实验。W08 周二 24:00 截止,W08 周四核验。

验收 W06+课后任务 3教材线索:第 9 章:BI 工具;第 11 章:数据管理、ETL、仓库、湖、SQL 与 NoSQL
任务开始W07 周四课后

课堂结束后,按本页开始课后自学与实验。

提交截止W08 周二 24:00

提交一份飞书实验报告,并保持链接可访问。

报告评阅W08 周三

进入逐份评阅;不要在未说明的情况下替换链接。

课堂核验W08 周四

课堂核验本页任务时,需要现场解释数据问题、清洗规则和图表结论。

07
01

本周先看懂什么

Core concepts
W07 课堂先完成核验 W06 实验报告

先共享屏幕、现场复现并接受概念拷问;课堂结束后,再开始本页的新任务。不要把两份报告混在一起。

回看 W06 核验要求
结构化数据Structured Data

按固定字段和类型组织,适合表格与数据库。

主键Primary Key

唯一识别一条记录,重复主键意味着身份冲突。

数据质量Data Quality

至少检查唯一、完整、准确、一致和及时。

ETLExtract, Transform, Load

从来源抽取,按规则转换,再加载到目标系统。

数据血缘Data Lineage

追踪一项数据从哪里来、怎样变、去了哪里。

BIBusiness Intelligence

通过查询、报表、可视化和监控支持决策。

COURSE MAP · 本周定位数据与 BI

从脏数据、清洗规则和血缘走向可信分析。

02

学完后大致能做到

Learning outcomes
自查完成度0 / 4

勾选只保存在当前浏览器,用于自查,不会自动提交成绩。

03

零基础起步

Lower the first step
LEVEL 01

先迈一步

找出至少三类数据质量问题,并说明它们可能导致什么错误。

LEVEL 02

完整复现

完成抽取、转换、加载三个步骤,输出干净表和一张简单汇总图。

LEVEL 03

自由拓展

为表设计主键、字段类型和两条校验规则,并画出最小数据血缘。

从这里开始

下载 transactions_dirty.csv,并先备份原文件。
用表格软件打开,观察列名、行数和数据类型。
检查重复交易编号、缺失金额和类别拼写差异。
使用站内清洗器查看规则前后的变化。
把清洗步骤写成可重复执行的编号清单。
04

问题驱动的 AI 自学路线

Question-driven learning

本周大问题

一张看起来正确的 BI 图表,为什么仍可能建立在不可信的数据之上?

带着问题读教材

不要求逐页背诵。先读标题和小节,再围绕本周问题精读;教材、AI 和实验结果三者不一致时,把差异写进报告。

选读

Chapter 9,pp. 163–174

BI 战略、查询、数据挖掘、可视化、仓库与仪表板。

精读

Chapter 11,pp. 197–210

ETL、市场数据、仓库、湖、血缘、结构化数据、SQL 与 NoSQL。

先问自己,再问 AI

每个问题都必须留下三层痕迹:你的初始判断、AI 的解释、本人核验后的修正。

问题驱动协议

不以「帮我总结本章」开场;改为提出一个可以比较、反驳或验证的问题。要求 AI 说明边界、给出反例,并接受你用教材和实验结果纠正它。

四个驱动问题

PROBLEM 01

删除脏数据是不是最安全的清洗方法?

向 AI 追问

让 AI 分别讨论重复、缺失、异常和格式不一致,并提出保留、修复、隔离三种策略。

本人验证

对每类问题写规则和影响,保留原始文件,不直接覆盖。

PROBLEM 02

数据仓库和数据湖为什么不能只按大小区分?

向 AI 追问

让 AI 从数据状态、治理程度、用户、查询方式和成本比较。

本人验证

把本周 CSV 放入假想仓库或湖,说明选择理由和前提。

PROBLEM 03

没有数据血缘时,图表出了问题应从哪里查?

向 AI 追问

让 AI 设计「来源—转换—加载—指标—图表」五段追踪链。

本人验证

为自己的清洗结果画出最小血缘,并能指出每一步文件。

PROBLEM 04

BI 工具能否自动保证业务结论正确?

向 AI 追问

让 AI 区分计算正确、口径正确、数据正确和解释正确。

本人验证

给同一批数据设计两种汇总口径,观察结论是否变化。

建议完成五轮对话

第 0 轮|先做数据体检:只记录问题,不急着清洗。
第 1 轮|让 AI 为每个问题提供至少两种处理方案及副作用。
第 2 轮|要求 AI 解释哪些步骤属于抽取、转换和加载。
第 3 轮|用行数、主键、缺失和汇总金额验证清洗结果。
第 4 轮|把数据血缘和口径写入报告,让同学能够追查。

写进报告的不是聊天全文

只保留与学习有关的关键节点:初始答案、AI 的关键建议、反例或边界、本人验证证据、最后修正。不要另交 AI 聊天记录表。

05

让 AI 一步一步带你做

Prompt scaffold

使用方式

先把提示词交给 AI;每完成一步就把真实结果贴回去。不要让 AI 一次倾倒整套答案,也不要把建议写成已经验证的事实。

我是一名零基础学生,要清洗一份合成交易 CSV。请不要一次给完答案。先让我观察表结构,再依次检查唯一性、完整性、准确性和一致性。每发现一类问题,都让我先提出修复规则,再提示风险。最后帮助我用一句话解释 ETL 和数据血缘。
06

实验 3:清洗合成交易表并制作微型 BI

Browser micro-lab

操作步骤

读取原始 CSV 并记录文件信息。
检查重复、缺失、格式和异常金额。
写出清洗规则并逐项执行。
输出干净表,按交易类型汇总金额与笔数。
画出数据来源—清洗—结果—图表的血缘。

可展示证据

原始与清洗后行数问题清单与规则干净 CSV一张汇总图或站内结果数据血缘

常见坑

  • 直接覆盖原始文件
  • 把删除当作唯一修复方法
  • 主键仍然重复
  • 图表口径与清洗规则不一致

微型 ETL 清洗器

先观察、再写规则、最后清洗;不要直接覆盖原始文件。

W07 · DIRTY CSV
transaction_idcustomer_idcategoryamount
T001C01支付36.00
T002C02转账120.00
T002C02转账120.00
T003C03PAYMENT18.50
T004C04支付
T005C05payment42.00
6有效行候选
1重复组
1缺失金额
2格式差异
先观察表格,再点击「标出问题」。
07

只交一份实验报告

One report
本页报告截止W08 周二 24:00

按时提交同一份飞书报告;W08 周三进入评阅,W08 周四课堂展示、复现并接受随机拷问。

建议结构

  1. 本周目标与实际完成情况
  2. 电脑环境、文件与数据来源
  3. 编号步骤、真实结果和错误记录
  4. AI 建议、本人验证和修正
  5. 核心概念卡与课堂拷问准备
  6. 结论、限制与下一步

模板仅供参考

不要求照抄固定目录。可以删减、合并、重排或自建结构;只要真实过程、证据、AI 参与、本人验证、概念理解、限制与隐私说明清楚即可。

08

下次课堂核验与随机拷问

Live verification
这份报告在哪里核验W08 周四

课堂核验本页任务时,需要现场解释数据问题、清洗规则和图表结论。

01

打开 · 共享飞书报告

30 秒说明目标与完成度

02

复现 · 现场操作关键步骤

从本人电脑重新得到结果

03

展示 · 解释证据与踩坑

说明哪里曾失败、怎样修正

04

拷问 · 脱离屏幕答概念

随机解释术语和关系

05

旁听 · 同学提问

提出具体、可检验的问题

不看电脑手机,你能回答吗?

为什么同一张表需要主键?
删除缺失值总是正确的吗?
数据库、数据仓库和数据湖分别更适合什么?
数据清洗后为什么还要保留原始文件?
BI 图表好看是否等于结论可信?
09

📋 本周课堂积分

Weekly points
积分时间不要看错:这里列的是本页实验报告的积分项目;实际记录时间为 W08 周四 课堂核验,不是在 W07 课堂提前计算。

✅ 考勤

+0~3

出勤 +3;迟到 +2;早退 +2;请假 +1;旷课 +0。

💻 复现

+0 / +1

现场成功复现实验 +1;未能复现 +0。

🚀 拓展

+0~2

无拓展 +0;有拓展 +1;多拓展 +2。

🖥️ 展示

+0 / +3

课堂自愿共享屏幕展示 +3。

🥇 首讲

+0 / +1

每节课堂最先自愿开讲的前 3 人 +1。

💡 提问

+0 / +0.5

认真旁听并提出被采纳的好问题 +0.5。

🔍 拷问

−1~+2

空心代工 −1;一知半解 +1;融会贯通 +2。

🤝 双分

双方 +1

仅凭文档现场复现成功,作者与复现者都 +1。

🏆 精选

+0 / +3

最佳文档进入知识库,获得席位、署名与 +3。

本页报告在 W08 周四 按以上各项记录积分。积分是过程激励,不设固定满分。
10

自由拓展与下一步

Explore further

如果还有余力

  • 把表拆成客户表与交易表
  • 为字段设计数据类型
  • 尝试用 SQL 复现汇总

报告收尾三问

  • 我亲手完成并验证了什么?
  • 我仍然不能解释什么?
  • 如果重做一次,我会先改变哪一步?