首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏程序员的知识天地

    Python爬虫入门,8个常用爬虫技巧盘点

    这些脚本有一个共性,都是和web相关的, 总要用到获取链接的一些方法,故累积了不少爬虫抓站的经验, 在此总结一下,那么以后做东西也就不用重复劳动了。 4.伪装成浏览器访问 某些网站反感爬虫的到访,于是对爬虫一律拒绝请求。 这时候我们需要伪装成浏览器, 这可以通过修改http包中的header来实现: ? 8、多线程并发抓取 单线程太慢的话,就需要多线程了, 这里给个简单的线程池模板 这个程序只是简单地打印了1-10, 但是可以看出是并发的。 虽然说Python的多线程很鸡肋 但是对于爬虫这种网络频繁型, 还是能一定程度提高效率的。 ? 9. 并且作为开源软件,Python允许对代码进行阅读,拷贝甚至改进。 这些性能成就了Python的高效率,有“人生苦短,我用Python”之说,是一种十分精彩又强大的语言。

    75610发布于 2018-12-13
  • 来自专栏机器学习算法与Python学习

    Python 爬虫8 个常用的爬虫技巧总结!

    文 / j_hao104 用python也差不多一年多了,python应用最多的场景还是web快速开发、爬虫、自动化运维:写过简单网站、写过自动发帖脚本、写过收发邮件脚本、写过简单验证码识别脚本。 爬虫在开发过程中也有很多复用的过程,这里总结一下,以后也能省些事情。 ,于是对爬虫一律拒绝请求。 StringIO.StringIO(compresseddata) gzipper = gzip.GzipFile(fileobj=compressedstream) print gzipper.read() 8、 虽然说python的多线程很鸡肋,但是对于爬虫这种网络频繁型,还是能一定程度提高效率的。

    1.6K20发布于 2019-07-04
  • 来自专栏啄木鸟软件测试

    软件性能测试(连载8

    snvcswch/s Command 08:18:31 0 1 0.20 0.00 systemd 08:18:31 0 8

    1.2K30发布于 2020-02-19
  • 来自专栏爬虫逆向案例

    012:tkinter+爬虫设计对联软件

    今天用Python设计一个小的对联软件! 其中运用到tkinter模块: tkinter是Python下面向tk的图形界面接口库,可以方便地进行图形界面设计和交互操作编程。 先看下我们的软件效果图: 首先,程序的界面设计还是利用tkinter来进行设计。 通过tkinter的Entry类来输入我们的上联,然后通过button按钮,来启动程序进行设计。 通过绑定的函数实现了爬虫的抓取和对联的保存。 row=1, column=0, sticky=W,pady=10) root.mainloop() 界面设计完成了,而且绑定的函数也已经确定,接下来就是如何利用绑定的函数,来实现我们的后续操作,也就是爬虫抓取和保存 但是在后续又出现了乱码的问题,对于乱码的问题,我们将爬取到的数据采用“utf-8”编码进行解决。而针对于json库不能解析,我们采用正则表达式的方式,匹配“下联”,并将“下联”返回。

    1.3K10发布于 2021-11-22
  • 来自专栏测试开发技术

    Python爬虫必备的8大技巧,收藏!

    想要快速学习爬虫,最值得学习的语言一定是Python,Python应用场景比较多,比如:Web快速开发、爬虫、自动化运维等等,可以做简单网站、自动发帖脚本、收发邮件脚本、简单验证码识别脚本。 爬虫在开发过程中也有很多复用的过程,今天就总结一下必备的8大技巧,以后也能省时省力,高效完成任务。 ,于是对爬虫一律拒绝请求。 StringIO.StringIO(compresseddata) gzipper = gzip.GzipFile(fileobj=compressedstream) print gzipper.read() 8、 虽然说Python的多线程很鸡肋,但是对于爬虫这种网络频繁型,还是能一定程度提高效率的。

    45110编辑于 2024-11-06
  • 来自专栏运维经验分享

    Scrapy爬虫8)scrapy-splash的入门

    scrapy_splash.SplashAwareDupeFilter' HTTPCACHE_STORAGE = 'scrapy_splash.SplashAwareFSCacheStorage' 1 2 3 4 5 6 7 8 创建爬虫文件phoneSpider.py, 代码如下: # -*- coding: utf-8 -*- from scrapy import Spider, Request from scrapy_splash ').extract() print('='*40) print(''.join(info)) print('='*40) 1 2 3 4 5 6 7 8 运行爬虫,scrapy crawl phone, 结果如下: ?   

    2.2K30发布于 2019-03-11
  • 来自专栏超级码力

    🦀️ 后羿采集器——最良心的爬虫软件

    看完这两类教程后还可以看看他们的文档中心[8],写的也非常详细,基本覆盖了该软件的各个功能点。 3.XPath/CSS/Regex 无论是什么爬虫软件,他们都是基于一定的规则去抓取数据的。XPath/CSS/Regex 就是几个常见的匹配规则。 定时抓取 定时抓取非常好理解,就是到了某个固定的时间爬虫软件就会自动抓取数据。市面上有一些比价软件,背后就是运行着非常多的定时爬虫,每隔几分钟爬一下价格信息,以达到价格监控的目的。 这时候爬虫软件就会自己维护一个 IP 池,用不同的 IP 发送请求,降低 IP 封锁的概率。 打码功能 这个功能就是内置了验证码识别器,可以实现机器打码 or 手动打码,也是绕过网站风控的一种方法。 type=post&pid=2619 [8] 文档中心: http://www.houyicaiji.com/?

    7K21编辑于 2022-02-23
  • 来自专栏若城技术专栏

    爬虫入门指南(8): 编写天气数据爬虫程序,实现可视化分析

    本文介绍了如何使用Python编写一个简单的天气数据爬虫程序,通过爬取指定网站上的天气数据,并使用Matplotlib库对数据进行可视化分析。 首先,我们使用requests库向指定的URL发送GET请求,并指定编码为utf-8。然后,我们使用BeautifulSoup库解析网页内容,并通过CSS选择器获取温度数据。 shtml' # 天气预报页面的URL response = requests.get(url) # 发送GET请求,获取网页内容 response.encoding = 'utf-8' 将编码设置为utf-8,以确保正确解析中文。 使用BeautifulSoup(response.text, 'html.parser')解析网页内容。 运行效果 完结 历时一个星期 终于将爬虫这点东西搞完了, 可能会有写欠缺,但是也还好, 希望可以帮助各位辛勤劳作的朋友

    1.1K10编辑于 2024-02-29
  • 来自专栏机器学习算法与Python学习

    Python:爬虫系列笔记(8) -- 爬去MM图片

    转载于:静觅 » Python爬虫实战四之抓取淘宝MM照片 链接:http://cuiqingcai.com/1001.html 1.抓取淘宝MM的姓名,头像,年龄 2.抓取每一个MM的资料简介以及写真图片 我们首先抓取本页面的MM详情页面地址,姓名,年龄等等的信息打印出来,直接贴代码如下 123456789101112131415161718192 __author__ = 'CQC'# -*- coding:utf-8 ".txt" f = open(fileName,"w+") print u"正在偷偷保存她的个人信息为",fileName f.write(content.encode('utf-8' else: # 如果目录存在则不创建,并提示目录已存在 return False 3.代码完善 主要的知识点已经在前面都涉及到了,如果大家前面的章节都已经看了,完成这个爬虫不在话下 spider.savePagesInfo(2,10) 1 tool.py 123456789101112131415161718192 __author__ = 'CQC'#-*- coding:utf-8

    1.2K60发布于 2018-04-04
  • 来自专栏嘘、小点声

    python网络爬虫8)多媒体文件抽取

    回调函数中,count表示已下载的数据块,size数据块大小,total表示总大小。

    66620发布于 2019-07-31
  • 来自专栏友弟技术工作室

    go爬虫框架colly源码以及软件架构分析

    安装使用 colly 官网 go get -u github.com/gocolly/colly/... import "github.com/gocolly/colly" 架构特点 了解爬虫的都知道一个爬虫请求的生命周期 of a collector ID uint32 // DetectCharset can enable character encoding detection for non-utf8 As this a is irrelevant if e.Attr("class") == "Button_1qxkboh-o_O-primary_cv02ee-o_O-md_28awn8- data-timespan=\"7d\"]", "data-percentusd"), }) }) 总结 好了,介绍完了,我没有介绍如何使用,我自己也没有写任何的代码, 我只想分享给你这种软件架构的特点以及设计模式 下面这张图很形象,爬虫框架就这些东西。 通用爬虫框架架构

    2.4K40发布于 2019-05-19
  • 来自专栏FreeBuf

    勒索软件新玩家:8Base

    数据泄露网站 8Base 勒索软件 8Base 是一个勒索软件团伙,自从 2022 年 3 月以来一直保持活跃,且在 2023 年 6 月攻击大幅增强。 另一个有趣的地方是 8Base 团伙的沟通方式与另一个已知的勒索软件组织 RansomHouse 十分类似。 除了勒索信息与扩展名为 .8Base 的加密文件外,其实大家对 8Base 勒索软件知之甚少。 受害者排行 到底是谁的勒索? ,并不自行开发,对于 8Base 也未能找到任何勒索软件变种。 8Base 与 Phobos 研究人员发现了使用 .8Base 扩展名的 Phobos 勒索软件样本,尚不清楚这是勒索软件的早期版本还是 8Base 使用不同的勒索软件进行攻击。

    62240编辑于 2023-08-08
  • 来自专栏Python程序员杂谈

    python爬虫,从sohu上抓小说《人形软件

    上次发的从sina上抓小说的代码,这次来一个sohu的,不过总结python爬虫的方法,其实无外乎urllib和正则表达式的使用。掌握了这俩,基本就是有了就抓。

    87920发布于 2019-02-28
  • 来自专栏啄木鸟软件测试

    软件安全性测试(连载8

    <html> <head> <metahttp-equiv="Content-Type" content="text/html;charset=utf-<em>8</em>" /> <scripttype="text/javascript <html> <head> <metahttp-equiv="Content-Type" content="text/html;charset=utf-<em>8</em>"> <title>演示十七:验证码的破解</title 获取地理坐标 对于在线地图软件而言,获取本地经纬度值是非常重要的功能,在HTNL5中实现了这个功能。效果如22所示。 ? 22 获取当前的经纬度 类似本地经纬度信息属于个人隐私的范畴,软件如果要获取这些信息,应该在使用之前得到用户的许可,特别是在APP端。

    1.1K20发布于 2019-12-23
  • 来自专栏分布式爬虫

    8、web爬虫讲解2—urllib库爬虫—ip代理—用户代理和ip代理结合应用

    /usr/bin/env python # -*- coding: utf-8 -*- import urllib import urllib.request import random #引入随机模块文件 请求时自动使用代理IP #请求 url = "https://www.baidu.com/" data = urllib.request.urlopen(url).read().decode("utf-8" /usr/bin/env python -- coding: utf-8 -- import urllib from urllib import request import random #引入随机模块文件 /usr/bin/env python # -*- coding: utf-8 -*- import urllib from urllib import request import json def random import re import urllib.erro def hq_html(hq_url): """ hq_html()封装的爬虫函数,自动启用了用户代理和ip代理

    1.2K50发布于 2019-07-05
  • 来自专栏全栈程序员必看

    Dreamweaver8 网站制作软件使用教程

    Dreamweaver是我喜欢做网站的软件。之所以喜欢Dreamweaver 8 是因为这个版本有折叠功能。 下面说说它的使用方法。 1、创建站点文件。 如果你喜欢软件EditPlus,可以看看这篇文章:网站制作工具之EditPlus的使用 附上这个软件的下载地址:Dreamweaver 8 (访问密码:7509) ————恢复内容开始———— Dreamweaver 是我喜欢做网站的软件。 之所以喜欢Dreamweaver 8 是因为这个版本有折叠功能。 下面说说它的使用方法。 1、创建站点文件。 如果你喜欢软件EditPlus,可以看看这篇文章:网站制作工具之EditPlus的使用 附上这个软件的下载地址:Dreamweaver 8 (访问密码:7509) 发布者:全栈程序员栈长,转载请注明出处

    1.9K10编辑于 2022-09-07
  • 来自专栏腾讯专有云

    运维专题第8期:软件

    软件源管理系统是云平台为出厂预设软件源及客户自定义软件源提供的统一的管理框架。 生命周期管理 是指软件源的生命周期管理,主要包括新建、删除和修改三个方面。 新建软件源 用来新建一个TCE出厂预置数据之外的软件源。比如自有软件制品库。 修改软件源 修改指定软件源的数据源设置、同步周期和帮助信息。 删除软件源 当某一个软件源目录下的数据为空时,才可以删除此软件源。 监控告警 查看软件源在运行时出现的告警信息。 历史记录 用于运维人员查看指定软件源的同步操作事件,便于判断软件源的整体工作状态。 操作记录 用于运维人员或者审计人员来查看指定软件源的操作记录(新建、修改和删除)。 软件源产品未来会进一步扩充支持的软件源类型,比如 Pypi、Maven等,产品也将持续优化,助力腾讯专有云为客户提供更优质的服务。

    89920编辑于 2022-06-24
  • 来自专栏Mac应用教程

    CADintosh X 8 Mac(CAD制图软件)8.8.2

    CADintosh X 8 mac版,这是一款非常专业的cad绘图工具,适用于工程和建筑行业,类似Autocad等软件,主要特点有交互式的绘图界面,多种功能模块,支持HPGL、DXF、PICT输入输出格式 ,可以用英制单位或自己定义的单位等,非常优秀的一款软件。 CADintosh X 8 Mac图片cadintosh x mac下载功能介绍1.工作流程改进和可用性优势单一窗口界面(快速访问所有功能,无需任何额外的工具窗口)视网膜显示支持元素的数量仅受限于可用内存为每个图纸保存预设置 2.主要特点:线条和工具8笔可自由定义的线宽和线条颜色6种线型:实线,虚线,点划线,双点虚线,锯齿线,短虚线独立模式:线宽从0.0到99.99毫米,每个元素可以指定不同的颜色和宽度(与HPGL不兼容)可用于线条

    59630编辑于 2022-08-15
  • 来自专栏WindCoder

    高效软件生产的8条规则

    你看,有效的软件生产知识本身就是一种力量。事实上,这是一种黑魔法,即时用简单的话来解释,也没有多少人掌握。你将免费得到它。如果你想被认为是软件生产魔法师,请继续阅读。  这是给谁的? 规则2:不要混合软件生产和软件开发方法 软件生成是基于软件开发的。但是,这两者有完全不同的目标、思维方式和实践。试图用另一个领域的方法解决一个领域的问题将产生可笑的结果。 软件开发是艺术和工艺的结合。艺术成分将永远在那里,无论自动化工具和软件开发方法如何。因此,解决开发任务需要最大程度的集中和屏蔽所有其他分心的信号。 假设这是正确的,应该明白,该项目在平均8个月的时间内将有50%的机会。 了解统计预测有如此令人难以置信的效果。一个聪明的经理只会对这样一个项目进行十二个月的估计,然后尽早完成这个项目。 规则8:重视团队合作 关于团队合作的信息,与上述任何一个主题有关。每个人都知道团队合作更好,但如何建立和维护团队依然是一个谜。

    70020发布于 2018-09-20
  • 来自专栏Debian中国

    Debian8安装TeamViewer远程协助软件

    软件第一次启动在两台计算机上生成 ID。只需要输入你的伙伴的ID到TeamViewer,就会立即建立起连接。 这篇教程介绍如何在Debian Jessie系统安装TeamViewer远程协助软件。 Debian 8安装TeamViewer 到 TeamViewer.com下载32位的deb安装包。 64位的Debian8系统要先输入下面的命令启用i386架构。

    1.9K50发布于 2018-12-20
领券