
写爬虫的兄弟,先别划走。
你有没有被这几种场面气到过——
网站一改版,你那堆写死的 div > ul > li:nth-child(3) 选择器当场暴毙;Cloudflare 一道 Turnstile,你的脚本直接被拦在门外,浏览器指纹一查一个准;代理池要自己搭、并发要自己管、爬到一半断网还得从头再来……
今天这个神器,专门治上面这些「爬虫老毛病」:Scrapling —— 一个会「自适应」的爬虫框架,从单条请求到全站规模爬取,它一个库全包了。
🔥 开源成就:69,858 Star(≈6.9 万)|🍴 6,919 Fork|Python|BSD-3-Clause|建仓 2024-10|微软 Trendshift 上榜|项目地址:https://github.com/D4Vinci/Scrapling
Scrapling 是一个「自适应」网页爬虫框架,从一次请求到全站规模爬取都能搞定。它的解析器会学习网页变化,页面改版时自动重新定位你的元素;它的 Fetcher 开箱即过 Cloudflare Turnstile 等反爬;它的 Spider 框架支持并发、多会话、断点续爬和自动代理轮换——几行 Python 全搞定。一个库,零妥协。
说人话:它把 请求层(Fetcher)、解析层(Parser)、爬行层(Spider) 三层全塞进一个库里,你要单页抓取就单页,要全站就全站,API 还刻意做得跟 Scrapy / BeautifulSoup 几乎一样,老玩家零成本上手。

(官方 logo.png)
🕷️ 爬虫框架(Spider)——全站规模
start_urls + 异步 parse 回调,Request/Response 一脉相承async for item in spider.stream() 实时吐数据 + 实时统计,长任务不心慌robots.txt 遵守🛡️ 进阶抓取(Fetcher)——自带隐身
Fetcher 能伪装浏览器 TLS 指纹、头部,甚至用 HTTP/3DynamicFetcher 调动 Playwright Chromium / Chrome 跑 JSStealthyFetcher 指纹伪造,开箱过 Cloudflare Turnstile/InterstitialProxyRotator,循环/自定义策略,按请求覆盖🔄 自适应 + AI 集成——它最狠的一招
⚡ 性能——快到离谱

(官方 spider_architecture.png · Spider 架构一览)
第一步:装好
pip install "scrapling[all]" # 装解析+抓取+全部
scrapling install # 顺手把浏览器和指纹依赖拉齐只要 Python 3.10+,一行起飞。
第二步:单页隐身抓(过 Cloudflare 就这么简单)
from scrapling.fetchers import StealthyFetcher
page = StealthyFetcher.fetch('https://nopecha.com/demo/cloudflare',
solve_cloudflare=True)
data = page.css('#padded_content a').getall()第三步:全站并发爬(还能断点续爬)
from scrapling.spiders import Spider, Response
class QuotesSpider(Spider):
name = "quotes"
start_urls = ["https://quotes.toscrape.com/"]
concurrent_requests = 10
async def parse(self, response: Response):
for quote in response.css('.quote'):
yield {"text": quote.css('.text::text').get(),
"author": quote.css('.author::text').get()}
nxt = response.css('.next a')
if nxt:
yield response.follow(nxt[0].attrib['href'])
QuotesSpider(crawldir="./crawl_data").start() # 爬崩了?同目录再 start 接着爬还嫌写代码麻烦?命令行零代码直接抓:
scrapling extract get 'https://example.com' content.md
scrapling shell # 交互式爬虫 shell,curl 都能转 Scrapling
(官方 scrapling_shell_curl.png · 交互式 Shell 实测)
爬一次崩一次、反爬劝退、代理自理的日子,真的可以翻篇了。Scrapling 把 请求 / 解析 / 爬行 三层焊死在一个库里,自适应防改版 + 隐身过 Cloudflare + 代理轮换 + 断点续爬,新手能三行跑通,老手能全站拉满。
6.9 万 Star 不是吹的,试一次你就回不去了。
👉 项目地址:https://github.com/D4Vinci/Scrapling