zoukankan      html  css  js  c++  java
  • Flume 1.5日志收集和存款mongodb安装结构

    Flume该演示是不是说。你可以自己搜索。

    但现在的互联网主要是Flume 1.4前版本号的信息。Flume 1.5在轰动的大变化。假设你准备尝试,我在这里给大家介绍一下程序最小化结构,和使用MongoSink的数据被存储mongodb。完全独立的执行,没有master。没有collector(说白了collector也就是一个agent,仅仅是数据来源于多个其它agent),仅仅有一个agent。把这套东西理解了你就能够自由发挥了微笑


    Flume是必需要求java执行环境的哈,jdk安装就不解释了。推荐yum安装。

    另外安装JDK好以后不用设置什么环境变量,flume事实上能够自己找到的,仅仅是会发出一个警告而已。无视之


    首先去下载Flume 1.5安装包

    http://flume.apache.org/download.html

    仅仅须要下载apache-flume-1.5.0.1-bin.tar.gz就能够了,32位64位系统通吃


    这里我们把安装包放到/home文件夹下,然后解压缩

    tar zxvf apache-flume-1.5.0-bin.tar.gz

    把解压得到的apache-flume-1.5.0-bin目录改名成flume,所以我们flume的路径是/home/flume


    网上非常多说要设置flume home环境变量,事实上不用的


    这里我们新增一个配置文件到/home/flume/conf/netcat.conf(当中的agent2/source2/sink2/channel2都是自定义的名称。随便改)

    # 定义组件名称
    agent2.sources = source2
    agent2.sinks = sink2
    agent2.channels = channel2
    
    # 定义数据入口
    agent2.sources.source2.type = netcat
    agent2.sources.source2.bind = 192.168.6.198
    agent2.sources.source2.port = 44444
    agent2.sources.source2.channels = channel2
    
    # 定义数据出口
    agent2.sinks.sink2.type = org.riderzen.flume.sink.MongoSink
    agent2.sinks.sink2.host = 192.168.6.222
    agent2.sinks.sink2.port = 27017
    agent2.sinks.sink2.model = single
    agent2.sinks.sink2.collection = events
    agent2.sinks.sink2.batch = 100
    agent2.sinks.sink2.channel = channel2
    
    
    
    # 使用内存管道
    agent2.channels.channel2.type = memory
    agent2.channels.channel2.capacity = 1000
    agent2.channels.channel2.transactionCapacity = 100
    


    以上配置文件相信大家一看就非常明了了。我简介一下:

    数据源是source2。而source2的定义是接收本机192.168.6.198:44444port发过来的数据,然后存放到channel2缓冲管道里面去
    channel2是什么呢?看最以下对channel2的定义,它是一个内存缓冲队列。容量是1000条数据,满100条就会被sink处理掉

    那么sink的定义呢?这里我们用到了Leon Lee(李龙?可能是国内哪位大神。感谢你哈)编写的一个MongoSink,作用是把从channel2取出的数据存入MongoDB,而且累计100条数据才提交

    MongoSink请到这里下载:https://github.com/leonlee/flume-ng-mongodb-sink


    MongoSink我简单说一下,仅仅须要把他打成jar包丢到/home/flume/lib里面即可了,当然别忘了把mongodb驱动也丢进去。以后你要是开发其它扩展包都是丢到lib里面就好


    好。那么我们就清楚了,flume的作用就是从source获取数据,存入channel缓冲队列。最后由sink放入永久存储


    执行下面命令启动flume

    /home/flume/bin/flume-ng agent --conf /home/flume/conf --conf-file /home/flume/conf/netcat.conf --name agent2 -Dflume.monitoring.type=http -Dflume.monitoring.port=34545
    

    大致解释一下:

    --name agent2                指定当前执行的这个agent的名称

    --conf /home/flume/conf        这个參数最好指定绝对路径,说明你的配置文件存放文件夹,不单单指agent的配置。当中还有log4j的配置。不然无法记录日志

    --conf-file /home/flume/conf/netcat.conf         这个是指当前要执行的agent所使用的配置文件

    -Dflume.monitoring.type=http          指定开启HTTP监控,能够通过浏览器直接訪问本机HTTP地址查看flume执行状态

    -Dflume.monitoring.port=34545            指定HTTP监控的端口


    假设你须要在控制台显示一些调试信息的话请自行配置/home/flume/conf/log4j.properties

    OK,等着成功吧微笑


    现眼下我们主要是攻克了日志数据不必直接写mongo库,仅仅要把IP和port告知其它项目团队,他们直接往这里发送数据即可了


    后期考虑到mongodb可能有些局限性,我们能够很灵活的改写sink,把数据存款hdfs,然后,和高大的hadoop与拉亲密接触


    版权声明:本文博客原创文章,博客,未经同意,不得转载。

  • 相关阅读:
    BeanFactory 简介以及它 和FactoryBean的区别
    由kill 和 kill -9 引发的Linux signal 学习
    验证整数和小数的正则表达式
    重构!重构!重构!
    Java常用命令:jps、jstack、jmap、jstat(带有实例教程)
    子网掩码是4个255代表什么?
    常见的访问控制模型 Access Control Policy:RBAC,DAC,MAC,ABAC
    安装驱动
    大话数据治理-01什么是治理,治理什么数据
    提高 nginx 服务器 安全性,稳定性、性能 --经验总结-持续更新
  • 原文地址:https://www.cnblogs.com/hrhguanli/p/4723913.html
Copyright © 2011-2022 走看看