首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏网络爬虫

    采集的热点数据

    如何用 python 也做个热搜排名动态变化,动态看到排名变化经过这几天的实践也是通过python做出了获取热点的动态变化。 实现过程简单来说分为两个内容: 1、定时采集热搜排名数据 2、用 matplotlib 画出动态排名图 1.我们需要用到requests 模拟请求,去采集的热搜数据信息,可以直接打开网页,找到热搜然后打开浏览器的自带分析功能 只需要每分钟采集一次,让采集的数据储存在文件中备用。 2.用matplotlib.animation画出动图然后,将文件中采集的数据进行读取放进去。 如果要采集的热搜数据可以参考一下方案代码: #!

    94410发布于 2021-06-17
  • 来自专栏四楼没电梯

    新浪 OAuth2 NodeJs发

    想用nodejs写个博客户端发,无奈新浪的nodejs sdk是OAuth1.0的。 只能自己根据OAuth1.0 改了改。 ', appkey = '2849184197', appsecret = '7338acf99a00412983f255767c7643d0'; var userId = "帐号", passwd = "密码"; var baseurl = "https://api.weibo.com/2/"; var weibo = module.exports = function() { //statuses/destroy 删除信息 //statuses/update 发布一条信息 //statuses/upload 上传图片并发布一条 //statuses /* args参数: * id : id * status : 转发文本 * is_comment 0-不发评论 1-发评论给当前 2-发评论给原

    1.2K10编辑于 2024-10-12
  • 来自专栏二爷记

    爬虫,python用户主页小姐姐图片内容采集爬虫

    python爬虫,爬虫,需要知晓用户id号,能够通过抓取用户主页内容来获取用户发表的内容,时间,点赞数,转发数等数据,当然以上都是本渣渣结合网上代码抄抄改改获取的! ? 要抓取的地址:https://weibo.com/u/5118612601 BUT,我们实际应用的抓取地址:https://m.weibo.cn/u/5118612601(移动端的地址) ? ----" + "\n") fh.write(f"地址: {str(scheme)}\n内容:{raw_text}\n" 手里头有二份爬虫的源码,不同的爬取地址和思路,一起分享给大家,仅供参考学习! 一份还包含GUI界面,当然这是本渣渣参考的主要来源代码! ? 亲测可运行哈!! 关注本渣渣信公众号:二爷记 ? 后台回复关键字:“爬虫” 获取所有源码

    1.5K20发布于 2020-12-11
  • 来自专栏爬虫逆向案例

    Flask实现画像采集小工具

    本文将使用Flask开发一个用户画像的生成器。 开发步骤如下: 抓取用户数据; 分析数据,生成用户画像; 网站实现,美化界面。 一、抓取 我这里使用移动端的(m.weibo.cn),以为例。本教程使用chrome浏览器进行调试。 } # 获取性别,中m表示男性,f表示女性 if json_data['userInfo']['gender'] == 'm': gender = '男' 二、生成用户画像 1.提取关键词 这里从文列表中提取出关键字,分析出主的发表的热词 import jieba.analyse from html2text import html2text content , request # 创建一个Flask应用 app = Flask(__name__) # 相关函数 # # 定义获取主信息的函数 # 参数uid为主的id def get_user_info

    83410发布于 2021-11-22
  • 来自专栏全栈数据化营销

    不用代码,采集知乎、信、58系列之二:实现无限页面采集

    之前的文章中,详细地介绍了web scraper的安装以及完整的采集流程,但是也只是局限在一个页面采集,那么如果我要实现多页面采集呢,这要如何实现呢? 首先我们先来看看有哪些多页面形式呢? 2、上面介绍的其实就是规律分页的形式,有明显的规律可循,这也是绝大多数网站采用的方式,但是这几年越来越多的网站为提高安全性和加强阅读体验,采用了诸如“点击阅读更多”“下拉加载”等不规律的分页方法,例如it word=%E4%BA%B2%E5%AD%90) 在观察页面的时候,我们看到it桔子是以“点击加载更多”来实现翻页的: ? element scroll down就可以实现鼠标滚动采集了,如下图所示: ? 至此,就介绍完了常见的绝大多数的翻页采集,此时就可以采集非常多的翻页网站了。

    1.6K40发布于 2018-05-07
  • 来自专栏月小水长

    自助采集及可视化网站汇总

    自助抓取网站系列陆陆续续更新了以下几篇。 带 ip 属地,无 Cookie 话题自助抓取网站上线 零配置构建多层转发网络可视化的网站来了 零配置构建用户关系网络的网站也来了 新增 ip 属地,抓得更多,超级评论爬虫大更新 中断可继续,10w+,无 cookie 评论抓取网站上线 可按关键词和时间段搜索,用户爬虫上新 每个爬虫都是一个站点,但是这几个站点没有任何关联,不能从一个跳转到另外一个,七八个站点不容易收藏 例如,之前访问多级转发网络构建站点的链接是: https://weibo-layer-repost.buyixiao.xyz/ 现在点击这个链接,它会自动跳转到当前站点下的对应子链接: https: 同时,以后若有功能更新,比如签到数据抓取和可视化,就不用开新链接了,直接在当前站点就能看到。

    1.1K10编辑于 2023-01-30
  • 来自专栏微博采集

    爬虫】用python开发采集指定主帖子的软件工具

    作为一名资深开发者,我注意到研究人员常需要获取v公开数据进行学术分析。为此,我开发了这款专业级数据采集工具:爬v主软件。旨在为学术研究提供技术支持。 界面如下:演示视频:BV1hJWyzDEsR二、工具核心特性2.1 系统兼容性支持Windows和Mac双平台运行无需复杂环境配置,开箱即用2.2 数据采集机制采用API接口协议进行数据获取智能分页采集 self.logger.addHandler(info_handler)info_handler.setFormatter(log_formatter)return self.logger日志文件:四、数据规范说明4.1 采集字段工具采集的数据包含以下维度 :字段:主昵称,主id,页码,wbid,wb_bid,wb链接,发布时间,发布于,转发数,评论数,点赞数,话题标签,帖子内容。 4.2 数据格式输出为标准化CSV文件:UTF-8编码确保中文兼容规范的字段命名五、使用规范与建议合法使用:仅限学术研究用途频率控制:建议设置合理采集间隔数据管理:妥善保存采集结果版权尊重:引用数据时注明来源六

    46510编辑于 2025-10-21
  • 来自专栏python3

    Python调用API获取内容

    一:获取app-key 和 app-secret     使用自己的账号登录开放平台,在开放中心下“创建应用”创建一个应用,应用信息那些随便填,填写完毕后,不需要提交审核,需要的只是那个app-key 三:安装 python SDK 有两种安装方式: 1:http://github.liaoxuefeng.com/sinaweibopy/下载新浪SDK 2:python有个简单的安装方式:直接在命令行下键入 2认证,我理解为就是用户访问我的应用后将页面导向新浪服务器然后用户输入信息到新浪服务器后授权给我的应用访问用户数据,这里我将的授权给下面的程序了),授权后浏览器中的URL类似:https://api.weibo.com /oauth2/default.html? 以下为我的关注用户的: ? ? ? ? 拿上边代码为例,这里我们获取的信息有: ?

    6.1K41发布于 2020-01-10
  • 来自专栏大数据

    爬虫

    全文简介 本文是用Python爬取移动端的数据。可以看一下Robots协议。另外尽量不要爬取太快。如果你毫无节制的去爬取别人数据,别人网站当然会反爬越来越严厉。 环境介绍 Python3 Windows-10-64位 移动端 网页分析 以获取评论信息为例(你可以以自己的喜好获得其他数据)。

    2.1K50发布于 2018-01-18
  • 来自专栏老高的技术博客

    通过的mid获取的URL

    function int10to62($int10) { static $str62keys; $str62keys = array("0","1","2" 0 : $i; $offset2 = $i + 7; $num = substr($mid, $offset1, $offset2 - $offset1); uid . '/' . getCodeByMid($mid); return $newUrl; } echo getNewUrl('phpgao', '3524952365496186'); 2.

    1.6K30编辑于 2022-12-24
  • 来自专栏坏男孩

    下饭:子域名跳转到腾讯

    下饭:子域名跳转到腾讯 如图所示: ? 新浪子域名 help.weibo.com 解析到 1.1.1.1 并且设置跳转 t.qq.com(腾讯)。 起因: 今天找回新浪密码时候访问到 help.weibo.com,结果是如下页面。 ? (发现时是不能访问的,至于跳转到腾讯,是后面help.weibo.com做了一些操作。) ? 为什么会这样? 当然最终的锅还是在上,(也许他的内网在用1.1.1.1?) 就等同于此人拥有了help.weibo.com的解析权,于是这位就带来了今天的下饭操作:跳转到腾讯。可能会找实习生背锅吧。 我们应该如何避免? 当然,这种行为是不恰当的。

    3.2K10发布于 2020-08-28
  • 来自专栏Python攻城狮

    Python采集热评进行情感分析祝你狗年脱单

    ,增量采集新闻数据,本文写的对新浪的数据采集和处理完整代码在我的Github。 玩的人大多数应该知道搞笑排行榜的,刚好写这篇文之前看到榜姐1月8号0点话题是一人说一个,追女孩的小道理,感觉这个话题简直是对广大单身男性的福利啊,ヾ(✿゚゚)ノ,故有了何不就采集一下评论来分析一波的想法 1.使用新浪提供的API对数据进行采集 作为一个爬虫菜鸟来说,如果不会使用代理IP池,同时对网站的反爬机制不太清楚,建议先去看下网站是否自己提供的有API,今天我们要爬取的网站是新浪,当然新浪网作为为全球用户 返回的字段说明 假设我们想要查看的是信息内容调用text即可 for info in content.comments: text = info.text 2.新浪爬虫 chrome 另外:代码是针对新浪移动端 https://m.weibo.cn/ 进行信息采集,之所以爬移动端而不是PC所有社交网站爬虫,优先选择爬移动版(不要来问我为什么好爬,我也不知道 逃 可以看到最新评论的

    92320发布于 2018-08-23
  • 来自专栏性能与架构

    都在使用的OAuth2是什么原理

    现在开放平台非常流行,例如信开放平台、开放平台等,开放平台都涉及用户授权问题,OAuth2就是目前的主流授权解决方案 OAuth2是什么 OAuth(Open Authorization,开放授权 只能登录授权层,以此将用户与客户端区分开 来,"客户端"登录授权层是使用令牌(token),"客户端"登录授权层以后,"服务提供商"根据令牌的权限范围和有效期,向"客户端"开放用户储存的 资料 OAuth2的实现机制 在OAuth2的授权机制中有4个核心对象 (1)Resource Owner(资源拥有者:用户) (2)Client (第三方接入平台:请求者,例如网站) (3)Resource Server (1)用户在第三方应用上点击登录,应用向认证服务器发送请求,说有用户希望进行授权操作,同时说明自己是谁、用户授权完成后的回调url (2)认证服务器展示给用户自己的授权界面 (3)用户进行授权操作,

    1.4K40发布于 2018-04-02
  • 来自专栏IT民工的代码世界

    Java网络爬虫抓取新浪个人记录

    接下来就是新浪的抓取,一般的http访问新浪网站得到的html都是很简略的,因为新浪主页是用js动态生成的并且要进过多次的http请求与验证才能访问成功,所以为了数据抓取的简便,我们走一个后门 ,也就是访问新浪的手机端,weibo.cn进行抓取,但随之而来的一个问题是,新浪的访问不管哪一端都需要强制的登陆验证,所以我们需要在http请求的时候附带一个cookie进行用户验证。 weibo.cn的cookie * @author hu */ public class WeiboCN { /** * 获取新浪的cookie,这个方法针对weibo.cn 有效,对weibo.com无效 * weibo.cn以明文形式传输数据,请使用小号 * @param username 新浪用户名 * @param password 新浪密码 * @return * @throws Exception */ public static String getSinaCookie(String

    1.6K40编辑于 2023-07-19
  • 来自专栏全栈数据化营销

    不用代码,10分钟会采集信、知乎、58同城数据和信息

    在学会python和火车头之前,web scraper是我最常用的采集工具了,设置简单,非常高效,采集咪蒙文章标题仅需2分钟,采集58同城5000条租房信息也就5分钟而已。 如果无法下载webscraper可以通过信zds369466004和我联系。 5、设置二级选择器:选择需要采集的元素内容。 (1)点击下图中红框内容,就进入一级选择器jiawei-scrap下: ? (2)点击add new selector创建二级选择器,来选择具体内容。 (2)点击后就会跳到时间设置页面,如下图,由于采集的数量不大,保存默认就可以,点击start scraping,就会跳出一个窗口,就开始正式采集了。 ? 除此之外,还利用web scraper采集了58同城租房信息、大众点评美食信息、信公众号咪蒙文章、京东小米手机评价等。

    2.9K90发布于 2018-05-07
  • 来自专栏微博采集

    爬虫】用python开发采集指定搜索关键词下的帖子

    无论是热点事件追踪、行业动态分析,还是用户舆论调研,上的海量文字、图片内容都极具参考价值。但实际操作中,大家常会遇到采集页数受限、多关键词切换繁琐、数据易丢失等问题。 1.2界面展示工具界面简洁直观,无需复杂操作,上手即用:1.3结果预览采集数据全面且结构化,包含11个核心字段,方便后续分析使用:采集结果.csv核心字段包括:关键词、页码、ID、链接、用户昵称 、用户主页链接、发布时间、转发数、评论数、点赞数、内容。 经多次测试,工具运行稳定,可持续采集不中断。需提前在cookie.txt文件中填写个人cookie(内附详细获取教程),便于重复使用。支持多关键词并行采集,关键词之间用|分隔即可。 可自定义采集时间范围,格式统一为YYYY-MM-DD,精准锁定目标内容。采集过程中按页保存CSV文件,每1-2秒自动存储一次,避免异常中断导致数据丢失。

    78110编辑于 2025-11-29
  • 来自专栏用户画像

    订阅评论

    参考:http://open.weibo.com/wiki/%E7%A4%BA%E4%BE%8B%E4%BB%A3%E7%A0%81 开放平台给出的代码有很多bug,在此纠正 如乱码问题的解决: String Exception e) { // 当连接断开时,重新连接 lastMsgLocation = lastMsgLocation + 2; index); byte[] newBuf = new byte[recBufSize]; if (recIndex > index + 2) { System.arraycopy(recBuf, index + 2, newBuf, 0, recIndex - index - 2); } recBuf = newBuf; recIndex = (recIndex - index - 2);

    1.1K21发布于 2018-08-24
  • 来自专栏乱码李

    情绪分析

    使用node.js爬虫每天从「新浪」上爬取一定数量的。主要实现登录,抓取发布,抓取关注人和粉丝的功能,暂时把数据存放在MongoDB中。 weibo_crawler 第一部分是准备数据,随机爬取50w左右的用户,然后每天爬取他们前一天发布的作为本项目的数据源。 由于新浪对爬虫有限制,因此爬取用户的时候采用定时器的方式。 由于只有登录了才能获取某个用户的个人信息和关注粉丝信息,而爬虫的难点就在于用户登录。 网络原因 2. 可能是新浪限制 3. 关注和粉丝不一定是“人” 采用的解决方案: 1. 对抓取失败的,Retry 5次 2. 放弃非人类 什么是非人类呢? 极性标注,0代表中性,1代表褒义,2代表贬义,3代表兼有褒贬两性。

    2K10发布于 2021-11-26
  • 来自专栏前端之路

    –图床

    首先感谢新浪提供的免费图床(对外链无限制),以及吊炸天的cdn图片加速服务,从此妈妈再也不用担心我的图床不能用了 图床原理: 访问 http://weibo.com/minipublish 使用新浪账号登陆 进入到发的界面: ? 不需要发布,图片只要上传就会存在于图床中 实用图床推荐 新浪图床 - Chrome 网上应用店 围脖是个好图床 - Chrome 网上应用店 实用云图床推荐 https网页一建生产图床

    2.5K40发布于 2018-07-17
  • 来自专栏苏生不惑

    再谈备份

    这个扩展将每500条(会展开长)存为一个HTML文件, 也可以在选项设置调整。 ? 稍等一会会在浏览器下载里生成2个HTML文件 :1.76MB的文件 歌手李健_01.html ? 之前文章 一键备份并导出生成PDF,顺便用Python分析账号数据 分析过李健的词云图,他的关键词为音乐,北京,朋友,歌手,电影,居然还提到了周杰伦。 ? 每个月转发评论点赞总数图,可以看到2016-2018年的数据是高峰期。 ? 原创和转发数据比例。 ? 李健发的工具主要为pc网页和iPad。 ? 麋鹿工具箱 如果你不想哪天被人挖坟,可以将批量删除、设置仅自己可见、仅好友可见,这里推荐一个工具麋鹿工具箱。 开始扫描你的多的话可能慢点。 ? ? 选择时间段,可以对删除,恢复公开,仅自己可见,仅粉丝可见,仅好友圈可见。 ?

    2.1K31发布于 2020-07-21
领券