20 分钟
实战专项

BeautifulSoup 解析

解析 HTML 提取数据

  • HTML 结构和 DOM
  • 使用 BeautifulSoup 查找元素
  • 提取属性和文本

HTML 解析概念

示例代码(可运行)

CSS 选择器

示例代码(可运行)
预测输出
import re
print(re.findall(r"<b>(\w+)</b>", "<b>a</b><b>b</b>"))
填空题填写空白处的代码
soup.find_all("a") # 找所有标签
选择题

获取元素文本用?

资深工程师加餐

底层原理 · 大厂视角 · 工程经验,点卡片展开

从输入网址到看到结果,大致是:DNS 解析拿到 IP → TCP 三次握手 →(HTTPS 还要 TLS 协商)→ 发出请求 → 服务端经过中间件、路由、业务逻辑、查库 → 返回响应 → 连接复用或四次挥手。理解状态码、幂等方法(GET/PUT/DELETE)与非幂等(POST),是做 Web 和联调的基本功。

挑战任务

爬虫挑战

简单+50 XP

从HTML中提取文章标题和链接。

爬虫挑战
2 个测试用例

课后作业

图片爬虫

中等+20 XP

提取页面中所有图片URL。

图片爬虫
1 个测试用例