首页 > 代码库 > 2014-08-08
2014-08-08
Pig: Distinct
Distinct主要是去掉重复的记录,是对条记录进行去重,而不是对单个某个schema。
daily = load ‘NYSE_daily‘ as (exchange:chararray, symbol:chararray);uniq = distinct daily
它需要收集相似的记录在一块,判断这些记录是否是重复的。我的理解是:在reduce收集相似的记录在一块,充分利用了combiner去掉重复的记录,在map里面进行删除。(有点奇怪的理解)
等价于SQL中的:
select distinct x
如果想对某个schema进行distinct,可以先选出来。
SQL的实现原理:
http://blog.codinglabs.org/articles/theory-of-mysql-index.html
C++:
http://man.chinaunix.net/develop/c&c++/c/c.htm#_Toc520634042
声明:以上内容来自用户投稿及互联网公开渠道收集整理发布,本网站不拥有所有权,未作人工编辑处理,也不承担相关法律责任,若内容有误或涉及侵权可进行投诉: 投诉/举报 工作人员会在5个工作日内联系你,一经查实,本站将立刻删除涉嫌侵权内容。