写一个文章的初稿, 参考C:\Users\17917\Desktop\FanHao 。 然后是我的一些琐碎的想法。
资料库
文件结构的存储,是很难做整理的,很多的标签信息,在文件中,不管格式做的多好,数量一多就会混乱。这是仓鼠症,很难解决的问题。下载的方案,比如 115 ,百度云。 115下影视作品,百度云可以下 资料,分享的作品。 还有一些精校的小说,音乐 。剩下的基本就要全部依靠爬虫了。 python 可以爬数据,也可以清洗数据,但是会遇到一些问题,比如封锁,比如限制,这个时候,无头浏览器,模拟鼠标点击,验证码打码就是一环。拿到数据之后,是一些脏活,寻找数据的相似性,给数据做标注,分类打码。 清洗之后的数据就可以入库了。 数据库是天然的管理结构,可以把散落在本地的文件,和标签关联在一起,这样就可以追加评论,用户,点赞,等等信息,这些信息的关联,可以催出一些优秀的作品,就可以做排行。早期的小说网站的思路时这样的, 有爬虫,最后就有反爬。
种类 文字类, 小说,pdf ,严肃文学, 抓取的评论,资料 等等。 微信的聊天记录等等。
图片类。 (生成的图包,下载的图集 ,封面 等等)AI图片 ,地图
声音类。 音乐, mv ,音乐的分类就很多了。
视频类, 短视频 ,(可以从抖音下载,可以从b站下载,youtube 之类,也可以通过种子,115 ,百度云之类的下载) VR 视频是一个特殊的分支。 3D视频也是一个特殊的分支,(医疗3D , 以及建模文件 是更特殊的存在)
动漫。里番
其中抖音短视频。可以单独分类和长视频分离。
还有电影,电视剧。 短剧 ,AI 作品,
游戏 ,游戏类是很特殊的,尤其是有了Steam 之后,大多数的作品可以走steam ,或者是联网就可以,只有少数的,比如已经没了的flash 游戏,一些黄油不好下的,是需要保存的。
一些工具类。
核心是从网络归档回本地的资料,可以通过网站来更好的展示数据库中清洗好的数据。
这些存在本地,尤其是很多的时候,索引是很不方便的。
但是专业数据库的存储筒的逻辑就更麻烦了,大型公司可以这么做,并且这样可以缓存加速,但是本地存储,最好还是有一个特殊的规则,否则不好弄的
然后 爬虫脚本是需要特殊保存的。清洗脚本也是。 比如把文档特殊化格式成正确的文案。
这就是为什么手机版软件,大家都大同小异的原因。 尤其是都想要做 小贷,购物,短视频,AI 。因为其实也没有更多的东西了。
文字,图片,视频,已经被内化成基石了。
产生数据, 保存数据。以及嵌合在之中的处理数据。 落在外面的展示数据和导出数据。
像是聊天记录,评论,点赞,收藏,这些都是对数据进行标注的工作。
这也就是为什么字节,那么值钱。无数的人给他打工。
微信的逻辑不在其中,微信是基建,比字节更底层。但同样得的约束更多。字节能做的敢做的。 腾讯不能做,不敢做。
阿里的重点不在购物,就像是腾讯的重点不在游戏。
AI 让搭建资料库成为一个 个人可以实现的事情。并且可以轻松实现多端同步。
数据本身不值钱,清洗之后的数据,非常值钱。