Windows下使用IDEA搭建Hadoop开发环境的详细方法-FinClip官网

Windows下使用IDEA搭建Hadoop开发环境的详细方法

网友投稿 1205 2023-02-26

Windows下使用IDEA搭建Hadoop开发环境的详细方法

笔者鼓弄了两个星期，终于把所有有关hadoop的环境配置好了，一是虚拟机上的完全分布式集群，但是为了平时写代码的方便，则在windows上也配置了hadoop的伪分布式集群，同时在IDEA上就可以编写代码，同时在windows环境下进行运行。（如果不配置windows下的伪分布式集群，则在IDEA上编写的代码无法在windows平台下运行）。笔者在网络上找了很多有关windows下使用idea搭建hadoop开发环境的中文教程都不太全，最后使用国外的英文教程配置成功，因此这里整理一下，方便大家使用。

我的开发环境如下：

1.Windows10

2.java 8

3.VMware-workstation-pro

1.Hadoop在windows当中的安装

首先在Windows系统里打开浏览器，-hadoop的安装包（二进制文件）: http://hadoop.apache.org/releases.html

打开网址，我们会发现这样的界面：

由于hadoop在开发当中我们常常使用了2.x版本的，因此这里我们这里-2.10.1版本的。如果你想使用其他版本的进行-，那么在-之前需要检查以下maven仓库里是否有相应版本所对应的版本，不然在使用IDEA进行开发的时候，则无法运行。我们打开网址：https://mvnrepository.com/

在其中搜索hadoop.则会出现以下的界面：

鼠标往下滑动,发现果然！2.10.1的版本出现了！因此我们可以使用找个版本的hadoop，因为在maven仓库里是可以找到的，这样就不会出现无法编程调用hadoop的问题：

2.将-的文件进行解压

我们-之后的文件二进制文件后缀名为tar.gz，你可以来到你-的地方，使用windows下的压缩包软件直接进行解压，我使用的是2345压缩软件进行的解压。有些教程让我们必须在windows下模拟的linux环境下（MinGW）才能够解压，其实完全不用，就把tar.gz当作普通的压缩文件就好了，解压之后将文件夹更名为hadoop。

3.设置环境变量一方面是要设置好Java的环境变量另一方面是要设置好刚刚-的Hadoop的环境变量

我们在环境变量处分别设置JAVA_HOME和HADOOP_HOME（目的是为了hadoop在运行的时候能够找到自己和java的地方在哪儿）:

然后在Path里添加JAVA和hadoop的二进制文件夹，bin文件夹，目的是我们这样就可以使用cmd对java和haodoop进行操作：

4.验证环境变量的配置

打开你的cmd，输入以下命令，出现我这样的输出说明配置环境变量成功：

C:\Users\lenovo>hadoop -version

java version "1.8.0_162"

Java(TM) SE Runtime Environment (build 1.8.0_162-b12)

Java HotSpot(TM) 64-Bit Server VM (build 25.162-b12, mixed mode)

5.HDFS的配置

接下来就是配置HDFS的文件，进行伪分布式集群以适应你的计算机。（备注：伪分布式集群也是分布式集群，可以起动分布式计算的效果）

我们来到之前解压的hadoop文件夹下，打开etc/hadoop文件夹，发现里面有很多文件：

现在我们的任务就是修改这些文件当中的代码，务必修改，不然根本无法运行hadoop！！

6.修改 hadoop-env.cmd

打开这个文件，在找个文件当中的末尾添加上：

set HADOOP_PREFIX=%HADOOP_HOME%

set HADOOP_CONF_DIR=%HADOOP_PREFIX%\etc\hadoop

set YARN_CONF_DIR=%HADOOP_CONF_DIR%

set PATH=%PATH%;%HADOOP_PREFIX%\bin

7.修改core-site.xml

将configuration处更改为：

fs.defaultFS

hdfs://0.0.0.0:9000

8.hdfs-site.xml

将configuration处更改为如下所示，其中

file:///F:/DataAnalytics/dfs/namespace_logs

file:///F:/DataAnalytics/dfs/data

这两个文件夹一定需要是已经存在的文件夹，你可以在你的hadoop文件夹下随意创建两个文件夹，然后将下面的这两个文件夹的绝对路径替换成你的文件夹，这里我也是创建了两个新的文件夹，hadoop的-文件夹里本身是没有的。

dfs.replication

dfs.name.dir

file:///F:/DataAnalytics/dfs/namespace_logs

dfs.data.dir

file:///F:/DataAnalytics/dfs/data

9. mapred-site.xml

将下方的%USERNAME%替换成你windows的用户名！！！这个十分重要，不要直接复制！！！

mapreduce.job.user.name

%USERNAME%

mapreduce.framework.name

yarn

yarn.apps.stagingDir

/user/%USERNAME%/staging

mapreduce.jobtracker.address

local

10.yarn-site.xml

修改为如下所示：

yarn.server.resourcemanager.address

0.0.0.0:8020

yarn.server.resourcemanager.application.expiry.interval

60000

yarn.server.nodemanager.address

0.0.0.0:45454

yarn.nodemanager.aux-services

mapreduce_shuffle

yarn.nodemanager.aux-services.mapreduce.shuffle.class

org.apache.hadoop.mapred.ShuffleHandler

yarn.server.nodemanager.remonNDdhEvUte-app-log-dir

/app-logs

yarn.nodemanager.log-dirs

/dep/logs/userlogs

yarn.server.mapreduce-appmanager.attempt-listener.bindAddress

0.0.0.0

yarn.server.mapreduce-appmanager.client-service.bindAddress

0.0.0.0

yarn.log-aggregation-enable

true

yarn.log-aggregation.retain-seconds

-1

yarn.application.classpath

%HADOOP_CONF_DIR%,%HADOOP_COMMON_HOME%/share/hadoop/common/*,%HADOOP_COMMON_HOME%/share/hadoop/common/lib/*,%HADOOP_HDFS_HOME%/share/hadoop/hdfs/*,%HADOOP_HDFS_HOME%/share/hadoop/hdfs/lib/*,%HADOOP_MAPRED_HOME%/share/hadoop/mapreduce/*,%HADOOP_MAPRED_HOME%/share/hadoop/mapreduce/lib/*,%HADOOP_YARN_HOME%/share/hadoop/yarn/*,%HADOOP_YARN_HOME%/share/hadoop/yarn/lib/*

11.初始化环境变量

在windows下的cmd，输入cmd的命令，用于初始化环境变量。hadoop-env.cmd后缀为cmd，说明是cmd下可执行的文件：

%HADOOP_HOME%\etc\hadoop\hadoop-env.cmd

12.格式化文件系统（File System）

这个命令在整个hadoop的配置环境和之后的使用当中务必仅使用一次！！！！不然的话后续会导致hadoop日志损坏，NameNode无法开启，整个hadoop就挂了！

将如下的命令输入到cmd当中进行格式化：

hadoop namenode -format

输出：

2018-02-18 21:29:41,501 INFO namenode.FSImage: Allocated new BlockPoolId: BP-353327356-172.24.144.1-1518949781495

2018-02-18 21:29:41,817 INFO common.Storage: Storage directory F:\DataAnalytics\dfs\namespace_logs has been successfully formatted.

2018-02-18 21:29:41,826 INFO namenode.FSImageFormatProtobuf: Saving image file F:\DataAnalytics\dfs\namespace_logs\current\fsimage.ckpt_0000000000000000000 using no compression

2018-02-18 21:29:41,934 INFO namenode.FSImageFormatProtobuf: Image file F:\DataAnalytics\dfs\namespace_logs\current\fsimage.ckpt_0000000000000000000 of size 390 bytes saved in 0 seconds.

2018-02-18 21:29:41,969 INFO namenode.NNStorageRetentionManager: Going to retain 1 images with txid >= 0

13.向hadoop文件当中注入winutills文件

由于windows下想要开启集群，会有一定的bug，因此我们去网站：https://github.com/steveloughran/winutils

-对应版本的 winutils.exe 文件。打开这个Github仓库后如下所示：

我们打开hadoop2.8.3/bin，选择其中的 winutils.exe 文件进行-，然后将-的这个文件放入到本地的hadoop/bin文件当中。不然的话，你打开一会儿你的伪分布式集群，马上hadoop就会自动关闭，缺少这两个文件的话。

我本地的bin文件最终如下所示：

14.开启hadoop集群

下面就是最激动人心的开启hadoop集群了！！！！我们在cmd当中输入：

C:\Users\lenovo>%HADOOP_HOME%/sbin/start-all.cmd

This script is Deprecated. Instead use start-dfs.cmd and start-yarn.cmd

starting yarn daemons

这样就会跳出来很多黑色的窗口，如下所示：

然后可以使用JPS工具查看目前开启的node有哪些，如果出现namenode，datanode的话说明集群基本上就成功了。如下所示：

15.打开本地浏览器进行验证

我们在浏览器输入localhost:50070,如果能够打开这样的网页，说明hadoop已经成功开启：

接下来就可以开始IDEA的配置了

16.创建MAVEN项目工程

打开IDEA之后，里面的参数和项目工程名称随便写，等待工程创建完毕即可。然后我们编辑pom.xml文件，如下所示：

xmlns:xsi="http://w3.org/2001/XMLSchema-instance"

xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">

4.0.0

com.atguigu

hdfs1205

1.0-SNAPSHOT

junit

RELEASE

org.apache.logging.log4j

log4j-core

2.8.2

org.apache.hadoop

nNDdhEvU hadoop-common

2.10.1

org.apache.hadoop

hadoop-client

2.10.1

org.apache.hadoop

hadoop-hdfs

2.10.1

xmlns:xsi="http://w3.org/2001/XMLSchema-instance"

xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">

4.0.0

com.atguigu

hdfs1205

1.0-SNAPSHOT

junit

RELEASE

org.apache.logging.log4j

log4j-core

2.8.2

org.apache.hadoop

nNDdhEvU hadoop-common

2.10.1

org.apache.hadoop

hadoop-client

2.10.1

org.apache.hadoop

hadoop-hdfs

2.10.1

因为我使用了2.10.1版本，因此导入的包均为2.10.1，除了log4j，这个是固定的2.8.2版本的。

然后点击我箭头指向的同步maven仓库，如下所示：

同步完成之后，IDEA左边的external libararies处就会显示大量的有关hadoop的jar包，如下所示：

这样就说明我们导入maven仓库成功了。

17.编写代码

现在我们开始编写代码，在开启hadoop伪分布式集群之后，代码才可以运行哦！

代码如下所示：

import org.apache.hadoop.conf.Configuration;

import org.apache.hadoop.fs.FileStatus;

import org.apache.hadoop.fs.FileSystem;

import org.apache.hadoop.fs.Path;

import java-.URI;

public class Test {

public static void main(String[] args) throws Exception {

FileSystem fs = FileSystem.get(new URI("hdfs://127.0.0.1:9000"), new Configuration());

FileStatus[] files = fs.listStatus(new Path("/"));

for (FileStatus f : files) {

System.out.println(f);

}

System.out.println("Compile Over");

}

这段代码的含义是遍历hadoop文件系统(HDFS)下的root下所有文件的状态，并输出，由于我目前并没有在HDFS下put了任何文件，因此不会有输出，出现这样的输出，说明代码代码运行成功：

exit code 0，返回code为0说明运行成功！

小程序原生组件—提升你的小程序体验

1205 2023-02-26

Windows下使用IDEA搭建Hadoop开发环境的详细方法

小程序原生组件—提升你的小程序体验

在小程序中为图片添加圆角的方法

微信小程序分享至朋友圈的方法有哪些

最近发表

更多内容

小程序SDK

Finclip技术文档

小程序开发

小程序容器

小程序框架

Finclip小程序平台

Finclip用户投稿

车联网

推荐文章

小程序SDK是什么意思？小程序sdk和插件有什么区别？

小程序支付功能怎么实现？

企业app开发流程是什么？

app运营模式有哪些？

小程序多端引流怎么做？

小程序生态分析的机会和威胁

Flutter入门这一篇效率文章就够了

原生与跨平台解决方案分析,跨平台软件开发技术方案

热更新技术：让软件更新变得更加轻松快速

解决方案

银行解决方案

证券解决方案

互联网解决方案

政企OA解决方案

科技解决方案

loT解决方案

信任解决方案

热评文章

AppCan:基于混合模式的移动应用开发,移动混合模

Hybrid App混合模式开发的了解

小程序容器技术助力券商数字营销突围，小程序容器化的意

用mpvue开发微信小程序基础知识（vue.js开发

小程序多端框架全面测评对比，强烈推荐！

券商app架构 - 解析券商应用程序的构建与设计