首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏网络爬虫

    采集的热点数据

    如何用 python 也做个热搜排名动态变化,动态看到排名变化经过这几天的实践也是通过python做出了获取热点的动态变化。 实现过程简单来说分为两个内容: 1、定时采集热搜排名数据 2、用 matplotlib 画出动态排名图 1.我们需要用到requests 模拟请求,去采集的热搜数据信息,可以直接打开网页,找到热搜然后打开浏览器的自带分析功能 只需要每分钟采集一次,让采集的数据储存在文件中备用。 2.用matplotlib.animation画出动图然后,将文件中采集的数据进行读取放进去。 如果要采集的热搜数据可以参考一下方案代码: #!

    94410发布于 2021-06-17
  • 来自专栏二爷记

    爬虫,python用户主页小姐姐图片内容采集爬虫

    python爬虫,爬虫,需要知晓用户id号,能够通过抓取用户主页内容来获取用户发表的内容,时间,点赞数,转发数等数据,当然以上都是本渣渣结合网上代码抄抄改改获取的! ? 要抓取的地址:https://weibo.com/u/5118612601 BUT,我们实际应用的抓取地址:https://m.weibo.cn/u/5118612601(移动端的地址) ? ----" + "\n") fh.write(f"地址: {str(scheme)}\n内容:{raw_text}\n" 手里头有二份爬虫的源码,不同的爬取地址和思路,一起分享给大家,仅供参考学习! 一份还包含GUI界面,当然这是本渣渣参考的主要来源代码! ? 亲测可运行哈!! 关注本渣渣信公众号:二爷记 ? 后台回复关键字:“爬虫” 获取所有源码

    1.5K20发布于 2020-12-11
  • 来自专栏爬虫逆向案例

    Flask实现画像采集小工具

    本文将使用Flask开发一个用户画像的生成器。 开发步骤如下: 抓取用户数据; 分析数据,生成用户画像; 网站实现,美化界面。 一、抓取 我这里使用移动端的(m.weibo.cn),以为例。本教程使用chrome浏览器进行调试。 } # 获取性别,中m表示男性,f表示女性 if json_data['userInfo']['gender'] == 'm': gender = '男' ' .format(uid)) json_data = result.json() # 获取繁华信息中json内容 # 获取性别,中 id,则获取数据并生成相应云图 # request.method的值为请求方法 # request.form既为提交的表单 if request.method == 'POST

    83410发布于 2021-11-22
  • 来自专栏全栈数据化营销

    不用代码,采集知乎、信、58系列之二:实现无限页面采集

    之前的文章中,详细地介绍了web scraper的安装以及完整的采集流程,但是也只是局限在一个页面采集,那么如果我要实现多页面采集呢,这要如何实现呢? 首先我们先来看看有哪些多页面形式呢? 那么还有一种类似于今日头条、卖淘网网站滚动鼠标就会加载内容的翻页形式要怎么在web scraper实现翻页采集呢? ids=1,这是手机链接,这里需要说明的是,当一些网站网页端反爬虫比较强大的时候,我们通常会选择手机端来采集。 element scroll down就可以实现鼠标滚动采集了,如下图所示: ? 至此,就介绍完了常见的绝大多数的翻页采集,此时就可以采集非常多的翻页网站了。

    1.6K40发布于 2018-05-07
  • 来自专栏月小水长

    自助采集及可视化网站汇总

    自助抓取网站系列陆陆续续更新了以下几篇。 带 ip 属地,无 Cookie 话题自助抓取网站上线 零配置构建多层转发网络可视化的网站来了 零配置构建用户关系网络的网站也来了 新增 ip 属地,抓得更多,超级评论爬虫大更新 中断可继续,10w+,无 cookie 评论抓取网站上线 可按关键词和时间段搜索,用户爬虫上新 每个爬虫都是一个站点,但是这几个站点没有任何关联,不能从一个跳转到另外一个,七八个站点不容易收藏 例如,之前访问多级转发网络构建站点的链接是: https://weibo-layer-repost.buyixiao.xyz/ 现在点击这个链接,它会自动跳转到当前站点下的对应子链接: https: 同时,以后若有功能更新,比如签到数据抓取和可视化,就不用开新链接了,直接在当前站点就能看到。

    1.1K10编辑于 2023-01-30
  • 来自专栏微博采集

    爬虫】用python开发采集指定主帖子的软件工具

    作为一名资深开发者,我注意到研究人员常需要获取v公开数据进行学术分析。为此,我开发了这款专业级数据采集工具:爬v主软件。旨在为学术研究提供技术支持。 界面如下:演示视频:BV1hJWyzDEsR二、工具核心特性2.1 系统兼容性支持Windows和Mac双平台运行无需复杂环境配置,开箱即用2.2 数据采集机制采用API接口协议进行数据获取智能分页采集 self.logger.addHandler(info_handler)info_handler.setFormatter(log_formatter)return self.logger日志文件:四、数据规范说明4.1 采集字段工具采集的数据包含以下维度 :字段:主昵称,主id,页码,wbid,wb_bid,wb链接,发布时间,发布于,转发数,评论数,点赞数,话题标签,帖子内容。 4.2 数据格式输出为标准化CSV文件:UTF-8编码确保中文兼容规范的字段命名五、使用规范与建议合法使用:仅限学术研究用途频率控制:建议设置合理采集间隔数据管理:妥善保存采集结果版权尊重:引用数据时注明来源六

    46510编辑于 2025-10-21
  • 来自专栏python3

    Python调用API获取内容

    一:获取app-key 和 app-secret     使用自己的账号登录开放平台,在开放中心下“创建应用”创建一个应用,应用信息那些随便填,填写完毕后,不需要提交审核,需要的只是那个app-key 在“开放平台”的“管理中心”找到刚才创建的应用,点开这个应用,点开左边“应用信息”栏,会看见“App key”和“App Secret”的字样,这两个东西是要在后面程序中使用的。 三:安装 python SDK 有两种安装方式: 1:http://github.liaoxuefeng.com/sinaweibopy/下载新浪SDK 2:python有个简单的安装方式:直接在命令行下键入 : sudo pip install sinaweibopy 四:实例验证,获取当前登录用户及其所关注(授权)用户的最新 这里需要注意的是在浏览器弹出一个页面,要先点击“授权”(这里进行的OAuth 以下为我的关注用户的: ? ? ? ? 拿上边代码为例,这里我们获取的信息有: ?

    6.1K41发布于 2020-01-10
  • 来自专栏大数据

    爬虫

    全文简介 本文是用Python爬取移动端的数据。可以看一下Robots协议。另外尽量不要爬取太快。如果你毫无节制的去爬取别人数据,别人网站当然会反爬越来越严厉。 环境介绍 Python3 Windows-10-64位 移动端 网页分析 以获取评论信息为例(你可以以自己的喜好获得其他数据)。

    2.1K50发布于 2018-01-18
  • 来自专栏四楼没电梯

    新浪 OAuth2 NodeJs发

    想用nodejs写个博客户端发,无奈新浪的nodejs sdk是OAuth1.0的。 只能自己根据OAuth1.0 改了改。 ", passwd = "密码"; var baseurl = "https://api.weibo.com/2/"; var weibo = module.exports = function response_type'] = "code"; params['action'] = "submit"; params['userId'] = userId; // 帐号 //statuses/destroy 删除信息 //statuses/update 发布一条信息 //statuses/upload 上传图片并发布一条 //statuses /* args参数: * id : id * status : 转发文本 * is_comment 0-不发评论 1-发评论给当前 2-发评论给原

    1.2K10编辑于 2024-10-12
  • 来自专栏Python攻城狮

    Python采集热评进行情感分析祝你狗年脱单

    ,增量采集新闻数据,本文写的对新浪的数据采集和处理完整代码在我的Github。 玩的人大多数应该知道搞笑排行榜的,刚好写这篇文之前看到榜姐1月8号0点话题是一人说一个,追女孩的小道理,感觉这个话题简直是对广大单身男性的福利啊,ヾ(✿゚゚)ノ,故有了何不就采集一下评论来分析一波的想法 1.使用新浪提供的API对数据进行采集 作为一个爬虫菜鸟来说,如果不会使用代理IP池,同时对网站的反爬机制不太清楚,建议先去看下网站是否自己提供的有API,今天我们要爬取的网站是新浪,当然新浪网作为为全球用户 另外:代码是针对新浪移动端 https://m.weibo.cn/ 进行信息采集,之所以爬移动端而不是PC所有社交网站爬虫,优先选择爬移动版(不要来问我为什么好爬,我也不知道 逃 可以看到最新评论的 一个人说一个,追女孩的小道理 评论的情感值分布 可以看到情感值在接近0.6~1.0左右位置频率较高,说明粉丝们对于这则的评论积极态度占大多数,因为这个本身就是偏积极性的,得出的结果也说明了这个问题

    92320发布于 2018-08-23
  • 来自专栏坏男孩

    下饭:子域名跳转到腾讯

    下饭:子域名跳转到腾讯 如图所示: ? 新浪子域名 help.weibo.com 解析到 1.1.1.1 并且设置跳转 t.qq.com(腾讯)。 起因: 今天找回新浪密码时候访问到 help.weibo.com,结果是如下页面。 ? (发现时是不能访问的,至于跳转到腾讯,是后面help.weibo.com做了一些操作。) ? 为什么会这样? 当然最终的锅还是在上,(也许他的内网在用1.1.1.1?) 就等同于此人拥有了help.weibo.com的解析权,于是这位就带来了今天的下饭操作:跳转到腾讯。可能会找实习生背锅吧。 我们应该如何避免? 当然,这种行为是不恰当的。

    3.2K10发布于 2020-08-28
  • 来自专栏老高的技术博客

    通过的mid获取的URL

    参考:http://blog.csdn.net/k1988/article/details/6684114

    1.6K30编辑于 2022-12-24
  • 来自专栏IT民工的代码世界

    Java网络爬虫抓取新浪个人记录

    接下来就是新浪的抓取,一般的http访问新浪网站得到的html都是很简略的,因为新浪主页是用js动态生成的并且要进过多次的http请求与验证才能访问成功,所以为了数据抓取的简便,我们走一个后门 ,也就是访问新浪的手机端,weibo.cn进行抓取,但随之而来的一个问题是,新浪的访问不管哪一端都需要强制的登陆验证,所以我们需要在http请求的时候附带一个cookie进行用户验证。 weibo.cn的cookie * @author hu */ public class WeiboCN { /** * 获取新浪的cookie,这个方法针对weibo.cn 有效,对weibo.com无效 * weibo.cn以明文形式传输数据,请使用小号 * @param username 新浪用户名 * @param password 新浪密码 * @return * @throws Exception */ public static String getSinaCookie(String

    1.6K40编辑于 2023-07-19
  • 来自专栏全栈数据化营销

    不用代码,10分钟会采集信、知乎、58同城数据和信息

     学会信息和数据快速采集都是非常必要的,因为这能大大提高工作效率。 在学会python和火车头之前,web scraper是我最常用的采集工具了,设置简单,非常高效,采集咪蒙文章标题仅需2分钟,采集58同城5000条租房信息也就5分钟而已。 我也将在近期开始web scraper课程,有兴趣的朋友可以加我信:zds369466004 一、web scraper的安装 Web scraper是google浏览器的拓展插件,它的安装和其他插件的安装是一样的 如果无法下载webscraper可以通过信zds369466004和我联系。 除此之外,还利用web scraper采集了58同城租房信息、大众点评美食信息、信公众号咪蒙文章、京东小米手机评价等。

    2.9K90发布于 2018-05-07
  • 来自专栏微博采集

    爬虫】用python开发采集指定搜索关键词下的帖子

    一、工具开发背景与核心优势1.1开发初衷作为国内顶流社交媒体平台,以实时性强、热点传播快、KOL影响力大著称。 无论是热点事件追踪、行业动态分析,还是用户舆论调研,上的海量文字、图片内容都极具参考价值。但实际操作中,大家常会遇到采集页数受限、多关键词切换繁琐、数据易丢失等问题。 1.2界面展示工具界面简洁直观,无需复杂操作,上手即用:1.3结果预览采集数据全面且结构化,包含11个核心字段,方便后续分析使用:采集结果.csv核心字段包括:关键词、页码、ID、链接、用户昵称 、用户主页链接、发布时间、转发数、评论数、点赞数、内容。 经多次测试,工具运行稳定,可持续采集不中断。需提前在cookie.txt文件中填写个人cookie(内附详细获取教程),便于重复使用。支持多关键词并行采集,关键词之间用|分隔即可。

    78110编辑于 2025-11-29
  • 来自专栏用户画像

    订阅评论

    参考:http://open.weibo.com/wiki/%E7%A4%BA%E4%BE%8B%E4%BB%A3%E7%A0%81 开放平台给出的代码有很多bug,在此纠正 如乱码问题的解决: String

    1.1K21发布于 2018-08-24
  • 来自专栏乱码李

    情绪分析

    使用node.js爬虫每天从「新浪」上爬取一定数量的。主要实现登录,抓取发布,抓取关注人和粉丝的功能,暂时把数据存放在MongoDB中。 weibo_crawler 第一部分是准备数据,随机爬取50w左右的用户,然后每天爬取他们前一天发布的作为本项目的数据源。 由于新浪对爬虫有限制,因此爬取用户的时候采用定时器的方式。 由于只有登录了才能获取某个用户的个人信息和关注粉丝信息,而爬虫的难点就在于用户登录。 对抓取失败的,Retry 5次 2. 放弃非人类 什么是非人类呢? 分词 Big Bang 分词就是把一句话变成一个一个单词的过程。举个栗子吧: 我是中国人。

    2K10发布于 2021-11-26
  • 来自专栏前端之路

    –图床

    首先感谢新浪提供的免费图床(对外链无限制),以及吊炸天的cdn图片加速服务,从此妈妈再也不用担心我的图床不能用了 图床原理: 访问 http://weibo.com/minipublish 使用新浪账号登陆 进入到发的界面: ? 不需要发布,图片只要上传就会存在于图床中 实用图床推荐 新浪图床 - Chrome 网上应用店 围脖是个好图床 - Chrome 网上应用店 实用云图床推荐 https网页一建生产图床

    2.5K40发布于 2018-07-17
  • 来自专栏前端之路

    图床

    首先感谢新浪提供的免费图床(对外链无限制),以及吊炸天的cdn图片加速服务,从此妈妈再也不用担心我的图床不能用了 图床原理: 访问 http://weibo.com/minipublish 使用新浪账号登陆 进入到发的界面: ? 不需要发布,图片只要上传就会存在于图床中 实用图床推荐 新浪图床 - Chrome 网上应用店 围脖是个好图床 - Chrome 网上应用店 实用云图床推荐 https网页一建生产图床

    5.3K20发布于 2018-07-17
  • 来自专栏刘晓杰

    新浪SDKdemo

    最近几天做了一下新浪的sdkdemo。其实也就是把管网上给的demo下下来运行一下。顺便看了一些bug。 首先要了解Oauth2.0授权认证,和SSO 登录功能。 Constants.java 问题: 1.通过Code获取Token部分,WeiboAuth这个类根本没有封装在里面,导致无法响应AuthListener,功能失效 2.短信验证只能3次,3次以后就不能用了 ------分享 openapi.WBUserAPIActivity" />------获取<1>用户昵称<2>用户信息(粉丝数) <activity android:name=".openapi.WBStatusAPIActivity" />------获取状态 <activity android:name=".openapi.WBCommentAPIActivity" />------获取某条的评论列表 <activity android:name=".

    1.9K30发布于 2019-02-21
领券