公司动态

大数据运维:MapReduce 开发环境标准化搭建、Jar 打包与集群任务全流程运维

📅 2026/7/23 11:49:23
大数据运维:MapReduce 开发环境标准化搭建、Jar 打包与集群任务全流程运维
一、运维项目背景企业离线统计任务均基于 MapReduce 开发运维核心工作统一团队 IDEA Maven 标准化开发环境、规范 Jar 打包流程、编写集群任务提交自动化脚本、前置清理 HDFS 输出目录、排查版本 / 路径 / 权限类高频集群故障。本文基于 WordCount 基准词频统计案例形成可直接落地的运维标准化操作手册。二、集群前置运维校验脚本#!/bin/bash # MR任务运维前置巡检脚本 echo 1.校验Hadoop集群全部进程 jps | grep -E NameNode|DataNode|ResourceManager|NodeManager echo 2.清理历史输出目录避免任务启动失败 hdfs dfs -test -d /wordcount/output if [ $? -eq 0 ];then hdfs dfs -rm -r /wordcount/output echo 旧输出目录清理完成 fi echo 3.创建统一HDFS输入目录 hdfs dfs -mkdir -p /wordcount/input三、Windows 运维机标准化 Maven 环境配置统一团队 pom 依赖版本杜绝 Jar 包冲突、类加载异常打包插件内置主类无需集群传参。?xml version1.0 encodingUTF-8? project xmlnshttp://maven.apache.org/POM/4.0.0 xmlns:xsihttp://www.w3.org/2001/XMLSchema-instance xsi:schemaLocationhttp://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd modelVersion4.0.0/modelVersion groupIdcom.hadoop/groupId artifactIdWordCountDemo/artifactId version1.0/version properties hadoop.version3.3.4/hadoop.version maven.compiler.source8/maven.compiler.source maven.compiler.target8/maven.compiler.target /properties dependencies dependency groupIdorg.apache.hadoop/groupId artifactIdhadoop-common/artifactId version${hadoop.version}/version /dependency dependency groupIdorg.apache.hadoop/groupId artifactIdhadoop-mapreduce-client-core/artifactId version${hadoop.version}/version /dependency dependency groupIdorg.apache.hadoop/groupId artifactIdhadoop-mapreduce-client-jobclient/artifactId version${hadoop.version}/version /dependency /dependencies build plugins plugin groupIdorg.apache.maven.plugins/groupId artifactIdmaven-jar-plugin/artifactId version3.2.0/version configuration archive manifest mainClasscom.hadoop.WordCountDriver/mainClass /manifest /archive /configuration /plugin /plugins /build /project四、MapReduce 三核心运维通用代码1. Mapper 类内置空行脏数据过滤减少 Shuffle 传输2. Reducer 聚合类标准分组求和模package com.hadoop; import org.apache.hadoop.io.IntWritable; import org.apache.hadoop.io.Text; import org.apache.hadoop.mapreduce.Reducer; import java.io.IOException; public class WordCountReducer extends ReducerText, IntWritable, Text, IntWritable { Override protected void reduce(Text key, IterableIntWritable values, Context context) throws IOException, InterruptedException { int sum 0; for (IntWritable val : values) { sum val.get(); } context.write(key, new IntWritable(sum)); } }3. Driver 驱动类可动态传入 HDFS 输入输出路径package com.hadoop; import org.apache.hadoop.conf.Configuration; import org.apache.hadoop.fs.Path; import org.apache.hadoop.io.IntWritable; import org.apache.hadoop.io.Text; import org.apache.hadoop.mapreduce.Job; import org.apache.hadoop.mapreduce.lib.input.FileInputFormat; import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat; public class WordCountDriver { public static void main(String[] args) throws Exception { Configuration conf new Configuration(); Job job Job.getInstance(conf, wordcount-offline-task); job.setJarByClass(WordCountDriver.class); job.setMapperClass(WordCountMapper.class); job.setReducerClass(WordCountReducer.class); job.setMapOutputKeyClass(Text.class); job.setMapOutputValueClass(IntWritable.class); job.setOutputKeyClass(Text.class); job.setOutputValueClass(IntWritable.class); FileInputFormat.setInputPaths(job, new Path(args[0])); FileOutputFormat.setOutputPath(job, new Path(args[1])); boolean result job.waitForCompletion(true); System.exit(result ? 0 : 1); } }五、运维标准化 Jar 打包流程1、IDEA 右侧 Maven 面板先执行 clean 清理旧产物再执行 package 打包2、target 目录自动生成可执行 Jar内置主类集群直接运行无需指定全类名。六、集群全流程运维操作命令1. 本地测试文本创建vim /opt/word.txt # 文本内容 hello hadoop hello mapreduce hadoop mapreduce java hello java hadoop2. 集群启动与数据上传# 启动Hadoop集群 start-all.sh3. HDFS创建输入目录hdfs dfs -mkdir -p /wordcount/input4.上传本地测试文件到HDFShdfs dfs -put /opt/word.txt /wordcount/input5.MR 任务提交执行hadoop jar /opt/WordCountDemo-1.0.jar /wordcount/input /wordcount/output6. 结果校验运维报表核对标准操作hdfs dfs -cat /wordcount/output/part-r-00000 # 预期输出 hadoop 3 hello 3 java 2 mapreduce 2七、运维高频故障解决方案JDK 版本不匹配类版本异常 根因本地 IDEA JDK 与集群 JDK 版本不一致运维方案全环境统一 JDK8。输出目录已存在任务直接失败 运维标准动作前置 Shell 脚本自动递归删除旧输出路径。MRAppMaster 无法找到 根因 mapred-site 缺少运行配置运维修复补充 YARN、MR 配套配置文件。HDFS 安全模式禁止写入 修复执行hdfs dfsadmin -safemode leave手动退出安全模式。权限拒绝 规范所有 Hadoop 操作统一使用 hadoop 业务用户执行。八、运维落地小结整套 MapReduce 开发运维流程分为四层标准化管控开发层统一 Maven pom 配置规避 Jar、版本冲突打包层固定 cleanpackage 打包流程内置程序入口集群层前置巡检 清理脚本自动化减少人工失误故障层汇总版本、路径、安全模式等线上高频问题快速恢复离线统计任务。 整套流程可做成团队运维操作规范新人直接复刻大幅降低开发侧集群故障工单。