🕸️ 真实网页源码输入
粘贴我们网站公开页面的 HTML 源码,例如首页、冒险、实验室、作品页。留空则使用本站公开导航样本。
📖 学员手册
代码讲解已合并到高亮预览的代码注释里
第二季第6课:Python网络情报爬虫 · 学员手册
一、本节课作品:公开数据情报雷达
本节课不是做演示图,而是做一个能读取数据、计算指标、生成网页预览的 Python 工具原型。
二、新模块 / 新语法
html.parser.HTMLParsercsv.DictWriterStringIOrobots.txt 合法边界class 自定义解析器
三、6 个实验室关卡
| 关卡 | 训练目标 |
|---|---|
| 1 | 读取或创建原始数据 |
| 2 | 提取关键字段 |
| 3 | 统计核心指标 |
| 4 | 排序、过滤或识别风险 |
| 5 | 生成建议或判断结果 |
| 6 | 发布完整 HTML_PREVIEW 网页作品 |
四、代码讲解方式
点击实验室顶部 高亮预览,再点 全屏查看。新版预览只显示代码本身和代码里的有效注释,不再重复生成无意义解释。
五、作品标准
- 能运行第 1-6 关。
- 至少修改 3 处数据,让结果发生变化。
- 第 6 关能生成完整的 公开数据情报雷达。
- 能说清楚用到了哪些模块、哪些数据、哪条判断规则。
六、合法边界
- 只采集公开授权网页。
- 不绕过登录、付费、会员或隐私保护。
- 不下载盗版电影、音乐、游戏资源。
七、进化舱升级方向
进入进化舱,选择或输入“公开数据情报雷达”,把实验室原型升级成更完整的可交互应用。
真实练习:用我们自己的网站练爬虫
本课不再只看模拟页面。课堂练习请使用 AI少年冒险团网站的公开页面:
- 首页:
https://ai-adventure-squad.vercel.app/ - 冒险课件:
/adventure - 实验室:
/lab - 进化舱:
/upgrade - 作品广场:
/works
操作步骤
- 打开我们网站任意公开页面。
- 复制页面 HTML 源码或老师准备好的 HTML 片段。
- 粘贴到实验室顶部的“真实网页源码输入”。
- 运行第 2 关看标题,运行第 3 关看所有链接,运行第 4 关看哪些链接被拦截。
为什么不是直接自动抓网页?
浏览器实验室运行在安全沙箱里,直接跨站请求会遇到 CORS、安全策略、登录权限等问题。课堂先练核心能力:
- HTML 是什么结构;
<title>、<h1>、<a href>怎么被解析;- 哪些链接属于公开学习页面;
- 哪些链接如
/api/、/admin、/teacher不应该采集。
这比一上来教学生绕限制更重要。真正项目里,爬虫的第一课永远是合法边界。
Ctrl+/ 注释 · ▶ 运行
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
点击 ▶ 运行或按 Ctrl+Enter
预览区(HTML / turtle 输出)
📋 任务卡
1robots 合法边界
分析我们网站哪些页面适合作为公开练习数据,哪些接口、后台、教师页不应该采集。
💡运行第1关,先看本站采集边界+10 XP
2解析本站标题
用 HTMLParser 从我们网站页面源码里找 title 和 h1,理解网页结构。
💡粘贴网站HTML后运行第2关+10 XP
3提取本站链接
从 a 标签提取 href 和文字,得到网站导航情报表。
💡运行第3关,看冒险/实验室/作品链接+10 XP
4过滤非公开目标
自动保留公开学习页面,拦截 /api、/admin、/teacher 和外部链接。
💡运行第4关,比较允许和拦截+10 XP
5导出 CSV 情报表
把我们网站公开链接整理成 CSV,后面可接入数据分析或课程地图。
💡运行第5关,复制结果+10 XP
6发布本站情报雷达
Boss关:用真实网站页面源码生成公开数据侦察报告。
💡运行第6关,截图保存+10 XP
🎁 完成全部 +30 XP
加载中
▶▼ 🧩 扩展
📦numpy
📦matplotlib
📦pillow
📦requests
📦sympy
📦pandas
📦scipy
📦beautifulsoup4
📦pygame
📦flask
📦opencv-python
📦nltk
📦sqlalchemy
📦plotly