首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏用户6291251的专栏

    MediaCrawler,轻松抖音小红评论数据!

    可以实现小红爬虫,抖音爬虫, 快手爬虫, B站爬虫, 微博爬虫。 目前能抓取小红、抖音、快手、B站、微博的视频、图片、评论、点赞、转发等信息。 环境搭建好以后,就可以执行代码啦~ # 从配置文件中读取关键词搜索相关的帖子并去帖子信息与评论 python main.py --platform xhs --lt qrcode --type search 这里以小红作为例子,来实验一下。 命令行运行代码,结果如下。 成功保存了csv数据,包含帖子及评论信息。 下一步就是对数据进行分析处理了,大家可以自行去学习使用。 这些平台(小红、抖音、快手、B站、微博)的笔记、视频评论和帖子评论可以为多个领域创造价值。 ⑤ 社交媒体趋势分析 分析评论数据可以揭示当前的社交媒体趋势、热议话题和病毒内容,为内容创新提供灵感。

    8K32编辑于 2024-04-15
  • 来自专栏小白实例

    python爬虫Scrapy框架小红图片频道

    ImgSpider(scrapy.Spider): name = 'img' allowed_domains = ['xiaohongshu.com']在`start_requests`方法中构造初始请求,小红的图片频道 channel_id=homefeed.fashion_v3' yield Request(url=start_url, callback=self.parse)解析函数`parse`里面提取图片链接并递归 img_data)并在settings.py中启用:pythonITEM_PIPELINES = { 'xiaohongshu.pipelines.ImgPipeline': 300,}最后我们运行爬虫,它将递归小红书中的图片 :scrapy crawl imgScrapy会按照我们定义的逻辑,先首页,提取图片链接,然后发送图片链接请求,获取图片数据后保存。 循环往复直到完指定范围内的页面。

    1.6K00编辑于 2023-07-09
  • 来自专栏小徐学爬虫

    Python爬虫实战:用简单四步小红图片

    小红是一个热门的社交分享平台,汇聚了大量精美的图片。如果您希望保存或使用这些图片,本文将为您详细介绍如何使用Python爬虫轻松小红图片。 您可以使用以下命令安装这些库: pip install requests 二、分析小红图片的URL 在开始小红的图片之前,我们需要找到图片的URL。 三、编写小红图片的代码 以下是一个示例代码,演示如何使用Python爬虫来小红的图片: import requests import os # 图片URL image_url = 'https 四、运行代码,小红图片 将替换了URL的代码保存为Python脚本,运行代码后,您将在目录中找到保存的小红图片。 根据自己的需要,您可以更多精美的小红图片,并在合法合规的前提下使用这些图片。请务必遵守相关法律规定和小红的使用规定。

    2.5K30编辑于 2023-09-25
  • 来自专栏cs

    淘宝评论

    文章禁止转载,违者必究 淘宝网页的评论数据动态加载的,首先要关闭adblock等屏蔽插件广告。还有我登陆了账号。 ="tb-tab-anchor" href="javascript:void(0);" hidefocus="true" shortcut-key="g c" shortcut-label="查看累计评论 image.png 通过firefox浏览器,终于找到了评论的url,如下。 ? image.png 评论的url 这几个url在html源代码中可以找到。 下面就是构造所有的url 下面是1,2页数的评论,主要currentPageNum变化。构造出需要的网站。 https://rate.taobao.com/feedRateList.htm? image.png 参考文章如下 Python爬虫 获得淘宝商品评论 Python淘宝商品详情页数据 通过Python抓取天猫评论数据 Python xlrd、xlwt 用法说明

    2.2K30发布于 2018-09-30
  • 来自专栏萝卜大杂烩

    豆瓣海王评论

    “ 最近海王大火,今天就来看看豆瓣上对于海王这个大片的评论吧” Just Do It By Yourself 01.分析页面 豆瓣的评论区如下 可以看到这里需要进行翻页处理,通过观察发现,评论的URL 02.分别获取评论 豆瓣的评论是分为三个等级的,这里分别获取,方便后面的继续分析 其实可以看到,这里的三段区别主要在请求URL那里,分别对应豆瓣的好评,一般和差评。 效果 好评 一般 差评 感觉豆瓣还是比较简单的,毕竟并没有设置什么反手段,小伙伴们也可以一起动手试试

    72220发布于 2019-07-17
  • 来自专栏数据魔术师

    如何微博评论

    数据 是的,今天,我们就来一下微博的评论,前面已经给大家介绍了很多经典算法,大家对于python基本的内容已经熟悉啦,今天,我们就简单的来学习一下如何数据。 Tip:准备工作 ? 首先,我们需要找到一个待的微博,微博主要是三种界面,分别是网页版、手机端和移动端,我们选取最简单的移动端来练手。 接下来,就开始我们的爬虫了,我们就选取前几天大热的范冰冰的博客吧。 我们的工作是对评论进行,点击“下一页”,可见评论页数高达28514页,看来大家对这个话题的关注度真的很高诶~~我们可以看到评论的链接为: https://weibo.cn/comment/HASs7tfjN uid=3952070245&rl=0&page=3 网址最后的数字代表了页数,这也就为我们的评论提供了基础! Tip:算法 ? 算法介绍:Requests算法 1. 总结 这次我们只介绍了新浪微博移动端的评论数据(因为这个比较简单....)大家可以用这个方法试着网页端或者手机端的数据哦~我们下期再见!

    2.3K40发布于 2019-07-10
  • 来自专栏数据结构笔记

    实战:之多线程(一)

    在上上篇我们编写了一个简单的程序框架来的文章信息,10分钟左右取了 1万 5千条数据。 现在,让我们先来做一个简单的算术题: 假设简有活跃用户一千万人(不知道简有多少活跃用户,我只能往小了算) 平均每人写了 15篇文章,那么一共有一亿五千万篇文章 我们10分钟取了 1万 5千篇,凑个整算 ,如果按照前面的脚本来整整 52天,那时候黄花菜都凉了呀。 这些数据的时间跨度如此大,如果要做数据分析的进行对比的话就会产生较大的误差。 所以,我们必须得提高速度!!! 这时候就轮到今天得主角登场了, 噔 噔 噔 蹬------》多线程 一、多线程简介 简单来讲,多线程就相当于你原来开一个窗口,现在开了10个窗口来。 最后,觉得不错的话,记得关注、点赞、评论哦(❤ ω ❤)

    1.2K40发布于 2018-09-28
  • 来自专栏渗透云笔记

    正则之豆瓣评论

    首先预热下,豆瓣首页 导入urllib库下的request import urllib.request 使用下urlopen打开网站返回HTML urllib.request.urlopen(" 简单点是用len看字节 >>> len(douban) 105653 豆瓣评论 导入正则模块(re) import re 写了个例子 #豆瓣评论小例子 import urllib.request from=showing 右键源代码 发现评论格式为 就是山西版本的《两杆大烟枪》或者说《疯狂的石头》,将山西风光和特色与影片融合的很好,虽然还是有所瑕疵,也难逃一些俗套烂大街的剧情和段子 所有评论被标签包裹,可以进行抓取,使用懒惰模式进行操作 .*? "." 保存到本地 fh = open("G:\\python\\doubanpinglun.txt","w")#打开文件并新建doubanpinglun.txt open里的路径为本地路径 完整代码如下 #豆瓣评论小例子

    76620发布于 2019-07-30
  • 来自专栏挖数

    网易云音乐评论

    本次通过网易云音乐的评论,即目前热歌榜第一名「出山」的评论。 来看看,在没被指出抄袭时,歌曲的评论画风是如何。 被指出抄袭后,又是怎样的一个画风。 / 01 / 网页分析 网上关于网易云音乐评论的方法,大多数都是讲如何构建参数去破解。 事实上不用那么复杂,直接调用接口就可以。 而且网易云音乐对评论也做了限制,只放出了2万条的评论数据。 包含了用户名、用户ID、年龄、性别、区域编码、个人介绍、评论评论ID、点赞数、评论发表时间。 按理说获取前500页,应该是有1w条的评论。 其中红圈为评论ID,都不一样,说明评论都是唯一的,不重复。 ? 第二位用户,一共25条评论,不过她并没有点赞数多的。 ? 第三位用户,一共24条评论,同样没有点赞数多的评论。 下面来看一下被爆抄袭后的评论用户。 ? 这位用户愣是评论了99条,其中评论都是一样的,不信看上图,就是末尾变了。 妥妥的水军,疯狂复制粘贴。 ? 这位用户,和评论区喷起来了... 一共94条评论

    4.8K75发布于 2019-06-20
  • 来自专栏前端小菜鸡yym

    当当网评论

    ---- 这是我参与8月更文挑战的第五天 活动详情查看:8月更文挑战 最近一直在当当网相关数据。 首先我们想要图书排行榜 我们分析一下网址http://bang.dangdang.com/books/newhotsales/01.00.00.00.00.00-24hours-0-0-1-1 如果换成最近七日就变成了01.00.00.00.00.00-recent7-0-0-1-1 我们可以看到它的分页是20本,每20本一分页。我们要太多也没有用。如果想多页怎么办那? return reduce(lambda x,y:int(x)+int(y)/10**len(y),l) 我们接下来相关的评论信息: 评论数对应的超链接就是我们想要评论信息的网址: 我想要爬到好评率还有商品评论的标签 但是就是不到相应的数据。

    1.2K30编辑于 2023-01-12
  • 来自专栏测试开发真货

    MediaCrawler 提取评论生词云:小红实例-麦琳评论

    MediaCrawler项目地址:https://github.com/NanmiCoder/MediaCrawler可以实现小红爬虫,抖音爬虫, 快手爬虫, B站爬虫, 微博爬虫。 目前能抓取小红、抖音、快手、B站、微博的视频、图片、评论、点赞、转发等信息。 安装依赖库pip install -r requirements.txt安装 playwright浏览器驱动playwright installPlaywright 是由微软开发的用于自动化测试和 Web 的多浏览器 小红帖子地址运行爬虫python main.py --platform xhs --lt qrcode --type detail--type detail参数表示指定帖子的评论。 本文中的爬虫技术仅限于学习和研究目的,不得用于其他平台的大规模或非法行为。

    1.9K31编辑于 2024-11-12
  • 来自专栏Python爬虫

    【爬虫实战】用Python采集任意小红笔记下的评论了10000多条,含二级评论

    一、目标您好!我是马哥python说,一名10年程序猿。我们继续分享Python爬虫的案例,今天小红书上指定笔记("巴勒斯坦"相关笔记)下的评论数据。 二、爬虫代码讲解2.1 分析过程任意打开一个小红笔记的评论,打开浏览器的开发者模式,网络,XHR,找到目标链接的预览数据,如下:由此便得到了前端请求链接,下面开始开发爬虫代码。 86.0.4240.198 Safari/537.36',# cookie需定期更换'Cookie': '换成自己的cookie值',}经过我的实际测试,请求头包含User-Agent和Cookie这两项,即可实现 经过分析,返回数据中有个节点sub_comment_count代表子评论数量,如果大于0代表该评论有子评论,进而可以从sub_comments节点中二级评论。 完整代码中,还包含转换时间戳、随机等待时长、解析其他字段、保存Dataframe数据、多个笔记同时循环等关键逻辑。三、演示视频代码演示:无感谢阅读,欢迎交流!

    17K42编辑于 2024-07-08
  • 来自专栏python进阶学习

    python热搜评论数据

    图片 关于粉丝们的各种评论我想大家肯定都比较感兴趣,这里我们可以使用python微博上有关tvb艺人直播热搜下得各种评论数据。 q=TV 经分析,微博热搜数据就在网页中,可以直接requests请求,然后BeautifulSoup解析获取内容,但是微博一直都有很严的反机制,特别是对IP的限制都很严格,所以在过程中我们可以使用 python爬虫+爬虫代理加强版IP+BeautifulSoup来完成数据的,完整代码如下: import java.io.IOException; import org.jsoup.Jsoup;

    1K40编辑于 2023-03-08
  • 来自专栏FSociety

    Python猫眼「碟中谍」全部评论

    我们将猫眼上碟中谍的全部评论保存下来,用于后期分析~ 总共评论3W条左右。 逻辑梳理 猫眼PC网页只能查看热门评论,只有在手机端页面才能查看全部评论。 我们用chrome手机模式打开碟中谍6的页面,然后找到了全部评论入口: [glzqq4u9kz.png] 当我们将评论页面向上拖,后台请求中变看到了我们想要的接口地址:http://m.maoyan.com 其实正常来说到这儿就差不多了,按照以往的套路循环传入offset参数就好了,不过当我爬到第67页的时候,就已经不返回值了,为啥是67,67$\times$15=1005,猫眼应该是控制了每个startTime只能往前1000 条评论,所以只能换个思路,将每页最早一条评论的时间作为startTime传入,offset固定15就好了。 nickName:用户昵称 cityName:城市 content:评论内容 score:用户评分 startTime:评论时间,每次最早的时间传入下次请求 ''' try

    65400发布于 2018-09-02
  • 来自专栏Eric杂货铺

    随机网易云音乐评论

    import requests import json for i in range(0,100,1): r = requests.get('http://api.heerdev.top:49

    1K41发布于 2020-09-24
  • 来自专栏极客猴

    网易云音乐精彩评论

    评论内容,让人泫然流涕的故事,就是让人深思的段子。 (二) 某天,猴哥突发奇想,想将自己平时喜欢听的歌曲的精彩评论取下来。以后就可以直接阅读这些评论,无须打开网页。 说干就干。 点击查看大图 那么思路是:使用 POST 方式携带参数 params 和 encSecKey 向该地址 http://music.163.com/weapi/v1/resource/comments 返回结果中的 Json 数据就是用户评论数据。 (三) 既然思路明确,编写代码就是容易多了。 这里,猴哥使用列表来保存想精彩评论的歌曲。 except UnicodeEncodeError: print("编码错误, 该数据无法写到文件中, 直接忽略该数据") 写到这里,小伙伴们应该了解如何运用 哈哈,最后请允许我贴下结果。 ?

    87320发布于 2018-08-16
  • 来自专栏FSociety

    Python猫眼「碟中谍」全部评论

    我们将猫眼上碟中谍的全部评论保存下来,用于后期分析~ 总共评论3W条左右。 逻辑梳理 猫眼PC网页只能查看热门评论,只有在手机端页面才能查看全部评论。 我们用chrome手机模式打开碟中谍6的页面,然后找到了全部评论入口: 当我们将评论页面向上拖,后台请求中变看到了我们想要的接口地址:http://m.maoyan.com/mmdb/ 其实正常来说到这儿就差不多了,按照以往的套路循环传入offset参数就好了,不过当我爬到第67页的时候,就已经不返回值了,为啥是67,67 15=1005,猫眼应该是控制了每个startTime只能往前1000 条评论,所以只能换个思路,将每页最早一条评论的时间作为startTime传入,offset固定15就好了。 startTime:评论时间,每次最早的时间传入下次请求 ''' time.sleep(random()) try: response

    96630发布于 2018-09-11
  • 来自专栏小红书采集软件

    【爬虫软件】2024小红采集工具,根据搜索关键词批量笔记下的评论

    一、背景分析 1.1 开发背景 众所周知,小红是国内流量数一数二的社区种草平台,拥有海量用户和上亿日活,尤其笔记下方的评论区有重大挖掘价值。 基于此,我用python开发了一个爬虫采集软件,叫【小红搜索评论软件】,支持2种模式的评论采集: 根据关键词采集评论思路:笔记关键词->笔记链接->评论 根据笔记链接采集评论思路:笔记链接 过程中,评论筛选同时进行。并非全部评论完再一次性筛选!所以效率较高! 10. cookie获取说明1: 3.1 根据关键词评论 思路:笔记关键词->笔记链接->评论 先填写左上区的笔记筛选项,再填写右上区的评论筛选项,点击按钮1。 3.2 根据笔记链接评论 思路:笔记链接->评论 先填写中上区的笔记链接,再填写右上区的评论筛选项,点击按钮2。 四、付费说明 4.1 卡密说明 付费如下: 日卡:使用期限1天,29元。

    1.1K00编辑于 2024-09-21
  • 来自专栏用户5305560的专栏

    【爬虫】简首页信息

    import requests from lxml import etree import pymongo from multiprocessing import Pool client = pymongo.MongoClient('localhost', 27017) mydb = client['mydb'] jianshu_shouye = mydb['jianshu_shouye'] def get_jianshu_info(url): html = requests.get(url)

    71220发布于 2021-08-11
  • 来自专栏用户5305560的专栏

    【爬虫】扇贝网单词

    # By Vax # At time - 2020/12/27 21:59 # linked from import json import requests from lxml import e

    92120发布于 2021-08-11
领券