zoukankan      html  css  js  c++  java
  • Hadoop之HDFS文件操作常有两种方式(转载)

    摘要:Hadoop之HDFS文件操作常有两种方式,命令行方式和JavaAPI方式。本文介绍如何利用这两种方式对HDFS文件进行操作。

    关键词:HDFS文件    命令行     Java API

    HDFS是一种分布式文件系统,为MapReduce这种框架下的海量数据分布式处理而设计。

    Hadoop之HDFS文件操作常有两种方式,一种是命令行方式,即Hadoop提供了一套与Linux文件命令类似的命令行工具;另一种是JavaAPI,即利用Hadoop的Java库,采用编程的方式操作HDFS的文件。

    方式一:命令行方式

    Hadoop文件操作命令形式为

    hadoop fs -cmd <args>

    说明:cmd是具体的文件操作命令,<args>是一组数目可变的参数。

    Hadoop最常用的文件操作命令,包括添加文件和目录、获取文件、删除文件等。

    1 添加文件和目录

    HDFS有一个默认工作目录/usr/$USER,其中$USER是你的登录用户名,作者的用户名是root。该目录不能自动创建,需要执行mkdir命令创建。

    hadoop fs -mkdir  /usr/root

    使用Hadoop的命令put将本地文件README.txt送到HDFS。

    hadoop fs -put README.txt  .

    注意上面这个命令最后一个参数是句点(.),这意味着把本地文件放入到默认的工作目录,该命令等价于:

    hadoop fs -put README.txt     /user/root

    使用Hadoop的ls命令,即

    hadoop fs -ls

    显示结果如图1所示。

    pic1

    图1  hadoop 中 ls命令Demo

    2 获取文件

    获取文件包含两层意思,一是HDFS从本地文件中获取文件,即前面介绍的添加文件;二是本地文件从HDFS中获取文件,可以使用Hadoop的get命令。例如若本地文件没有README.txt文件,需要从HDFS中取回,可以执行如下命令。

    hadoop fs -get  README.txt  .

    或者

    hadoop fs -get README.txt  /usr/root/README.txt

    3 删除文件

    Hadoop删除文件命令为rm。例如要删除从本地文件上传的README.txt,可以执行如下命令。

    hadoop  fs -rm  README.txt

    4 检索文件

    检索文件即查阅HDFS中的文件内容,可以使用hadoop中的cat命令。例如要查阅README.txt的内容,可以执行如下命令。

    hadoop fs -cat README.txt

    部分显示结果如图2所示

    pic2

    图2 hadoop中cat命令Demo

    另外,hadoop的cat命令的输出也可以使用管道传递给Unix 命令的head:

    hadoop fs -cat README.txt | head

    Hadoop也支持tail命令查看最后一千字节。例如要查阅README.txt最后一千个字节,可以执行如下命令。

    hadoop fs -tail README.txt

    5查阅帮助

    查阅Hadoop命令帮助,可以让我们很好地掌握和使用Hadoop的 命令。我们可以执行hadoop fs 获取所用版本Hadoop的一个完整命令列别,也可以使用help来显示某个具体命令的用法及简短描述。

    例如,要了解ls命令,可执行如下命令。

    hadoop  fs -help ls

    关于hadoop命令ls的描述如图3所示。

    pic3

    图3 Hadoop命令ls的介绍 

    Resource:

    1   http://www.wangluqing.com/2014/03/hadoop-hdfs-fileoperation/

    2  Hadoop in Action http://www.manning.com/lam/

     Hadoop删除文件夹 newout0530

     

     download hadoop dfs文件到本地

    原文链接

    http://blog.csdn.net/wangloveall/article/details/28578393

  • 相关阅读:
    ubuntu14.04 remmina远程连接rdp服务器失败解决办法
    python3测试手机suspend/resume(休眠/唤醒)
    链表和数组的区别
    在ubuntu下打开windows系统下编辑的.txt文件,中文显示为乱码的解决方法
    python实例:删除列表中重复的元素
    python中lambda函数
    STL-- vector
    Leetcode -- Two Sum
    Perl5的包和模块
    Perl中的面向对象编程
  • 原文地址:https://www.cnblogs.com/hdu-2010/p/4533654.html
Copyright © 2011-2022 走看看