当前位置: 首页 > news >正文

速递物流系网站建设与维护/seo的范畴是什么

速递物流系网站建设与维护,seo的范畴是什么,呼和浩特网站建设公司,新乡网站建设设计公司哪家好企业中,由于领导们的要求,hive中有数据存储格式很多时候是会变的,比如为了优化将tsv,csv格式改为了parquet或者orcfile。那么这个时候假如是mr作业读取hive的表数据的话,我们又要重新去写mr并且重新部署。这个时候就很…
640?wx_fmt=png

企业中,由于领导们的要求,hive中有数据存储格式很多时候是会变的,比如为了优化将tsv,csv格式改为了parquet或者orcfile。那么这个时候假如是mr作业读取hive的表数据的话,我们又要重新去写mr并且重新部署。这个时候就很蛋疼。hcatalog帮我们解决了这个问题,有了它我们不用关心hive中数据的存储格式。详细信息请仔细阅读本文。

640?wx_fmt=png


本文主要是讲mapreduce使用HCatalog读写hive表。

hcatalog使得hive的元数据可以很好的被其它hadoop工具使用,比如pig,mr和hive。

HCatalog的表为用户提供了(HDFS)中数据的关系视图,并确保用户不必担心他们的数据存储在何处或采用何种格式,因此用户无需知道数据是否以RCFile格式存储, 文本文件或sequence 文件。

它还提供通知服务,以便在仓库中有新数据可用时通知工作流工具(如Oozie)。

HCatalog提供HCatInputFormat / HCatOutputFormat,使MapReduce用户能够在Hive的数据仓库中读/写数据。 它允许用户只读取他们需要的表和列的分区。 返回的记录格式是方便的列表格式,用户无需解析它们。

下面我们举个简单的例子。

在mapper类中,我们获取表schema并使用此schema信息来获取所需的列及其值。

下面是map类。

public class onTimeMapper extends Mapper {
   @Override
   protected void map(WritableComparable key, HCatRecord value,
    org.apache.hadoop.mapreduce.Mapper.Context context
)
    throws IOException, InterruptedException
{

    // Get table schema
    HCatSchema schema = HCatBaseInputFormat.getTableSchema(context);

    Integer year = new Integer(value.getString("year", schema));
    Integer month = new Integer(value.getString("month", schema));
    Integer DayofMonth = value.getInteger("dayofmonth", schema);

    context.write(new IntPair(year, month), new IntWritable(DayofMonth));
   }
}


在reduce类中,会为将要写入hive表中的数据创建一个schema。

public class onTimeReducer extends Reducer {
public void reduce (IntPair key, Iterable value, Context context)
 throws IOException, InterruptedException
{
 
 int count = 0; // records counter for particular year-month
 for (IntWritable s:value) {
  count++;
 }
 
 // define output record schema
 List columns = new ArrayList(3);
 columns.add(new HCatFieldSchema("year", HCatFieldSchema.Type.INT, ""));
 columns.add(new HCatFieldSchema("month", HCatFieldSchema.Type.INT, ""));
 columns.add(new HCatFieldSchema("flightCount", HCatFieldSchema.Type.INT,""));
 HCatSchema schema = new HCatSchema(columns);
 HCatRecord record = new DefaultHCatRecord(3);
 
 record.setInteger("year", schema, key.getFirstInt());
 record.set("month", schema, key.getSecondInt());
 record.set("flightCount", schema, count);
 context.write(null, record);
}
}


最后,创建driver类,并且表明输入输出schema和表信息。

public class onTimeDriver extends Configured implements Tool{
   private static final Log log = LogFactory.getLog( onTimeDriver.class );

   public int run( String[] args ) throws Exception{
    Configuration conf = new Configuration();
    Job job = new Job(conf, "OnTimeCount");
    job.setJarByClass(onTimeDriver.class);
    job.setMapperClass(onTimeMapper.class);
    job.setReducerClass(onTimeReducer.class);

    HCatInputFormat.setInput(job, "airline", "ontimeperf");
    job.setInputFormatClass(HCatInputFormat.class);
    job.setMapOutputKeyClass(IntPair.class);
    job.setMapOutputValueClass(IntWritable.class);
   
    job.setOutputKeyClass(Text.class);
    job.setOutputValueClass(DefaultHCatRecord.class);
    job.setOutputFormatClass(HCatOutputFormat.class);
    HCatOutputFormat.setOutput(job, OutputJobInfo.create("airline", "flight_count", null));
    HCatSchema s = HCatOutputFormat.getTableSchema(job);
    HCatOutputFormat.setSchema(job, s);
   
    return (job.waitForCompletion(true)? 0:1);
   }
   
   public static void main(String[] args) throws Exception{
 int exitCode = ToolRunner.run(new onTimeDriver(), args);
 System.exit(exitCode);
}
}


当然,在跑上面写的代码之前,应该先在hive中创建输出表。

create table airline.flight_count
(Year INT ,
Month INT ,
flightCount INT)
ROW FORMAT DELIMITED FIELDS TERMINATED BY ','
STORED AS TEXTFILE;

可能会引起错误的地方是没有设置$HIVE_HOME.

[完]

欢迎点击阅读原文扫二维码加入浪尖知识星球,获取更多优质的大数据学习资源和指导。

推荐阅读:

Hive性能优化(全面)

Hive高级优化

640?wx_fmt=jpeg

http://www.lbrq.cn/news/1365697.html

相关文章:

  • 网站开发工作分解结构/seo网站优化优化排名
  • 杭州优化公司多少钱/班级优化大师下载
  • 最新的网站建设软件有哪些/seo优化培训多少钱
  • 桂林漓江自由行攻略/windows优化大师官方下载
  • 做商务网站需要什么资料/搜狗网
  • 视频网站程序/海外发布新闻
  • 国际外贸网站/b站黄页推广
  • 怎么用国外的服务器做网站/最好用的磁力搜索器
  • 网站可以做动态背景吗/湖南中高风险地区
  • 响应式网站建设平台/最新注册域名查询
  • 怎么样做微网站/代写文章哪里找写手
  • 网页设计学校网站制作/网络营销ppt
  • WordPress招标采购/seo顾问服务咨询
  • 网站设计兼容模式/做优化的网站
  • 网站建设与网页设计是什么/seo的理解
  • 西安网站托管商家/域名交易中心
  • 网页做的很美的网站/搜索引擎网站推广如何优化
  • 做网站建设公司怎么样/谷歌网站优化
  • 免费招工人在哪个网站/seo优化员
  • 宁波网站建设运营/域名注册网站系统
  • 游戏攻略网站开发/优化关键词哪家好
  • 哪些网站做兼职可靠吗/seo优
  • 订制型网站费用/推广运营
  • 哪些网站不能备案/seo搜索工具栏
  • 北京网站开发要多少钱/潍坊seo按天收费
  • 珠海做网站制作/it培训机构学费一般多少
  • 贵阳做网站kuhugz/线上营销渠道有哪些
  • 手机怎么建立微信公众号/网页关键词排名优化
  • wordpress互动主题/城关网站seo
  • wordpress调用不同头部文件/友情链接seo
  • Planner 5D v2.29.0 安卓高级解锁版,手机3D家装,全套家具免费
  • e2studio开发RA4M2(6)----GPIO外部中断(IRQ)配置
  • Flutter开发 dart异步
  • python工具方法51 视频数据的扩充(翻转、resize、crop、re_fps)
  • 【学习笔记】MySQL技术内幕InnoDB存储引擎——第8章 备份与恢复
  • 深入 Go 底层原理(三):Goroutine 的调度策略