V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
jakeyfly
V2EX  ›  问与答

我在写个爬虫,想问一下大家这种思路是不是错误的。

  •  
  •   jakeyfly · Nov 25, 2018 · 2076 views
    This topic created in 2710 days ago, the information mentioned may be changed or developed.

    因为是监控很多个一个网站的很多个不同的目标源,所以我决定用 APS 启动多个异步任务抓取(根据每个任务的特征,判断启动时间与结束时间,请求间隔设成五分钟一次这样)

    然后这些抓取的内容先不洗清,按事先搞好分类扔进不同的 KAFKA 频道。

    另一边不同的洗清模块从不同的 KAFKA 频道抽取,进行清洗,并存入 SQL 数据库,一般是 MYSQL

    这样的话,我很容易就写成,抓取与清洗是两个程序。等于需要启动两个程序。一个启动爬虫抓,另一个启动清洗程序,是否成熟的作法是只有一个入口文件,启动后两个都开始执行?

    Supplement 1  ·  Nov 25, 2018
    谢谢大佬们回复 ,另想问一下,KAFKA 占用资源大不,因为只是个小项目。
    6 replies    2018-11-25 14:47:01 +08:00
    leon0318
        1
    leon0318  
       Nov 25, 2018 via Android
    第一个分号之前的内容都没读明白
    leon0318
        2
    leon0318  
       Nov 25, 2018 via Android
    @leonme 逗号,不是分号
    Wincer
        3
    Wincer  
       Nov 25, 2018 via Android
    抓取和清洗应该是两个模块,但可以不用是两个程序。
    jakeyfly
        4
    jakeyfly  
    OP
       Nov 25, 2018
    @Wincer 我是两个模块,只是我现在写成,两个入口文件了,是不是写的有问题
    zn
        5
    zn  
       Nov 25, 2018 via iPhone
    说得挺明白了。

    这么说吧,两种方法都可以,并没太大优劣之分。

    如果是我,我会分开,会更方便开发和调试。还能一边默默爬,一边调试清洗程序,互不干涉。
    kslr
        6
    kslr  
       Nov 25, 2018
    一个项目随便跑一个 queue 不就行了
    我觉得分开比较好,因为可能速度不一致
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1815 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 48ms · UTC 16:23 · PVG 00:23 · LAX 09:23 · JFK 12:23
    ♥ Do have faith in what you're doing.