00:02
哈喽,大家好,我是于小夏,那么这这些视频呢,我想跟大家聊一个做AI时绕不开的一个问题,就是训练一个模型,这个数据它到底从哪里来?很多人他的第一反应可能会是我自己去写一个爬虫,但是真正进入一个AI项目之后,可能会发现不同的阶段对数据的这个要求完全不一样,基于预训练更关注。数据的规模和覆盖的一个范围,垂直领域微调,那么的话会关注这个数据的结构和质量,而AG啊啊,那个IG或者是那个实时的一个AI应用,它就会更加的关注数据的一个新鲜度,所以那么这期视频我会实际看一下量数据,它给我们提供了一个三种数据的一个获取方式。看看他们分别都适合一个什么样的场景,那么首先的话呢,就是第一个。
01:01
这个web。这个是第一层,也就是一个网络的存档,它首先的话呢,是比较适合一个大量历史网页内容的一个场景,可以这里我们可以看到一个说明。它和普通实时爬虫最大的一个区别的话是,是不一定需要重新把网站全部都抓取一遍的,而是可以直接从已经积累的一个网络存档当中搜索,并且按照时间范围,域名,还有那个URL这个模式和语言的一个筛选的条件,然后去选中一个所需要的一个历史的内容。这里我们可以是看到它的一个是一个工作原理的。在这个用例当中,你看官方也是直接把这个LM训练和IG管道列为了一个经典的一个场景,如果我要解决的是大规模历史语料,历史数据一个回填,或者是给知识库填充过去的网页内容,那么这个web travel的话就会很合适。
02:09
那么你可以简单的理解,它主要就是解决的是历史规模这个问题。那么量数据的第二种方式的话,我们可以在控制台这里来看,它的话呢,其实就是一个数据集市场。和web不一样的是,这里的数据的话呢,是已经提前完成了采集和结构化的,比如如果我现在搜索一个量,搜索一个是亚马逊的话,那么它是可以直接可以找到现成的一个亚马逊的一个商品数据集的,也就是说这种需求的话,是不一定需要我自己从零搭建一个爬虫的。那我们可以看到,在这里有最受欢迎的6个数据机,也是使用比较多的,然后我们选中这个亚马逊这个产品。
03:06
那么在我们进来之后,可以看到它已经是把一个商品的信息拆成了一个明确的字段,那么在这里的话,我们是可以看到这个商品的一个标标题,还有这个卖家店铺的一个名称,或者说品牌和对这个商品的这个描述等等,那么这个对于做垂直模型或者说是行业分析的人来说哈。这种结构化的数据会比直接从整页的HTML开始整理的话,会方便了很多很多。啊,我们点一下字典。因为在我看来的话,就是一个数据集,第一件事情的话呢,首先我们不是直接去购买,而是先看一下样例,它会不会符合我们的一个需求,因为AI训练的话,它并不是那个数据越多,它就一定是越好,首先要确认这个字段和真实的记录是不是符合自己的一个任务的,那么从样例的话。
04:03
其实的话,我们就是可以提前判断出数据的结构和一个内容的。那么第二个的话,我会重点看的地方是一个数据的字典,它会告诉我们每一个字段的话呢,是什么样的一个意思,以及数据的类型是什么,对于训练管道来说,这一点的话是非常重要的。因为。不仅要知道有没有一个数据,还要去确认。它是是否是稳定的,这个字段的定义是否是符合我们自己的一个任务的。当我们了解了这个数据的一些内容之后,我们的话,如果需要进一步判断数据质量的话,还可以先下载一个免费的一个样样例嘛,然后在这里的话,然后我们选择下载,我这里选择下载是一个CSV。赶紧下载。
05:04
这里我们的CSV的话是已经下载好了,然后我们打开看看。这里的话,我们可以看到每一行的话呢,就是一条的记录,每一列的话呢,就是一个结构化的一个字段,对于小团队来说的话,一个比较实际的好处就是可以先通过样例验证字段和一个数据的质量,再决定是否需要完整的一个数据集的一个购买,而不是一上来的话我们就直接去购买,因为我们要根据自己的需求来嘛。好,我们给它擦掉。下面我给他们带来的是量数据的第三种,那么也就是custom collection, 也就是自定义。收藏机。
06:03
也就是一个定制的一个数据。当这个数据市场里面没有我们需要的一个数据的话,或者说我指定的一个网站,或者说字段,一个指定的范围,当它都没有的话,我们就可以考虑这条路线,官方的流程的话呢,是需要先描述数据的需求,然后再审核生成,然后检查一个数据的压力,也就是说它更适合线程数据集解决不了的实时获得一个高度定制的一个需求,可以看到。这边的一个描述。所以说这一层的话,主要解决的是一个定制的问题,当前两者都无法满足的要求的时候,我们我们就会选择这一种,如果把这三种方式放在一起来的话,其实就是很好筛选了。如果你需要的是一个大规模历史网网页内容或者说历史语量,那么肯定会优先考虑web travel, 如果是已经比较成熟的一个行业需求,比如电商、房产企业数据又主要是用于垂直模型或这个数据分析,可以看看量数据的这个数据及市场,也就是data set marketplace, 有没有现成的一个数据能够符合你的一个要求。
07:20
如果当现成的数据都无法满足你的要求的时候,那么就需要指定来源,或者说更加实时一个高度定制的一个数据,那么我们就会使用custom collection.数据进入后续流程的时候的中,它还会支它这个都是支持Jason,然后ndson,然后CSV。支持多种格式的,可以根据自己的技术站来进行一个选择。那么本期视频我们来总结一下,这这次看下来的话,我觉得这套方案最大的特点就是它不是简单的告诉我们这里有很多的数据,通过上述的话,三种方式我们都可以看到,这是第一种。
08:08
然后第一种,第二种的话,我们可以在这个数据集市场这边,然后第三种通过一个爬虫的API,我们可以这是一个爬虫的API,然后我们可以进行一个高度的一个自定义。这里的话,我们是把AI不同阶段的一个需求,我们都可以给他直接拆开来了。然后web travel的话,它解决了一个大规模历史内容的一个问题,然后data set market, 那个place解决了一个成熟行业结构化的一个数据问题,那么custom collection的话呢,则补充了实时和高度定制的一个数据的一个需求。对于A团队来说的话,更理想的思路并不是所有的数据都自己从零开始抓,而是判断自己到底需要,到底需要历史规模、成熟事业行距、成熟行业数据,还是实时定制数据,这样的话可以把更多的精力放在真正重要的一个数据质量清洗评估和模型的一个效果上。
09:11
如果屏幕前的你正准备模型的一个微调,或者是IGIG知识库,或者说其他AI项目的一个数据的话,可以通过本期视频简介下方的一个专属链接,然后了解量数据。注册时的话呢,建议大家是使用工作邮箱。那么注册后的话呢,是会有一个免费的一个额度的。本期视频就是到此为止。感谢大家观看。
我来说两句