花拾录

知识库

编程语言导入2026/09/220 阅读

解析页面算出"主文件比总大小还大":选择器选错了表格

从详情页解析文件列表,算出一个明显违反常识的结果:主文件体积比整个列表的总大小还大。数字自己会说话—— 这不可能 。这篇文章讲这个"不可能"背后的 HTML 解析陷阱。 现象 从详情页解析文件列表,算出来的主文件体积竟然 比总大小还大 : …

#选择器#爬虫#HTML解析
编程语言导入2026/09/220 阅读

接口"正常返回了",但返回的其实是默认热门榜单

调用一个 API,它返回了 200,返回了 JSON,返回了结果列表——一切看起来都很成功。但你仔细一看内容,全是无关的东西。这篇文章讲的是一种最阴险的失败: 接口不报错,但它没听你的话。 现象 用某个搜索 API 按中文名搜索,请求 成功…

#爬虫#结果校验#API
编程语言导入2026/09/220 阅读

抓某些站点报 CERTIFICATE_VERIFY_FAILED,请求根本发不出去

采集脚本明明昨天还好好的,今天一跑就抛异常,而且异常发生在"请求发出去之前"——连接压根没建立。这篇文章讲 CERTIFICATE VERIFY FAILED 的原因,以及关闭证书校验时你必须知道的代价。 现象 抓某些站点时,直接抛出证书验…

#Python#SSL证书#爬虫
编程语言导入2026/09/220 阅读

命令行下载被 CDN 返回 403:403 不一定是你没权限

一个下载任务全线失败,HTTP 状态码清一色是 403 Forbidden。你的第一反应可能是"地址错了"或者"没有权限"。但这次,问题其实出在一个更朴素的地方:对方觉得你不像浏览器。 现象 下载某类流媒体分片时,CDN 持续返回 403,…

#CDN#User-Agent#爬虫
编程语言导入2026/09/220 阅读

高频抓取触发限流:抓了 250 个之后整个任务中断

写采集脚本的人,大多经历过那个转折点:前几分钟一切顺利,突然之间目标域名的连接全部失败,整个任务中断。这篇文章讲的是限流的机制,以及为什么"能跑通"和"能长期稳定跑"是两回事。 现象 连续抓取历史数据时,抓了大约 250 个对象之后,该域名…

#Python#限流#爬虫
编程语言导入2026/09/220 阅读

用中文关键词搜索返回零结果:查询串编码对不上时的排查与修法

你写了个脚本去某个站点搜索,英文关键词一搜一个准,换成中文关键词,返回的结果永远是 0 条。试了好几个不同的中文词,全是空。你开始怀疑「这个站是不是压根没有中文资源」,甚至怀疑站点封了你。 现象 同一个接口,?q=python 有结果,?q…

#urllib#爬虫#GBK#URL编码#编码#Python
编程语言导入2026/09/220 阅读

抓取中文域名抛 UnicodeEncodeError:IDNA 与 Punycode 入门

你写了个脚本去抓一批站点,源清单里混进了几个中文域名。程序跑到这几个就抛异常退出,报的还是个跟网络八竿子打不着的编码错误。更坑的是,这个错误把真正的网络问题也一起盖住了,你对着 UnicodeEncodeError 排查了半天网络,方向全错…

#爬虫#HTTP#Punycode#IDNA#域名#编码#Python