WordCount em Python

Esta seção inclui o código-fonte e as instruções para executar o exemplo do WordCount escrito em Python.

A seguir, o código-fonte do mapeador. Salve esse código em um arquivo chamado ' WordCount_mapper.py:

#!/usr/bin/env python
import sys
for line in sys.stdin:
(key,value) = line.split('\t')
wordList = value.split(' ')
for word in wordList:
print(word.strip() + "\t1")

A seguir, o código-fonte do redutor. Salve esse código em um arquivo chamado ' WordCount_reducer.py:

#!/usr/bin/env python
import sys
word = ""
sum = 0
for line in sys.stdin:
(key,value) = line.split('\t')
if word == key:
sum = sum + int(value)
else:
if word != "":
print(word + "\t" + str(sum))
word = key
sum = 1
if key != "": print(key + "\t" + str(sum))

Para executar esse exemplo para os dados armazenados na tabela words1 (que inclui as colunas " id e " sentence ) no banco de dados " mapreduce_db, execute o seguinte comando:

mapreduce jar /nz/export/ae/products/netezza/mapreduce/current/mapreducestreaming.
jar
-db mapreduce_db
-input 'words1' 'id' 'sentence'
-output 'results' 'word' 'count'
-mapper 'WordCount_mapper.py'
-mapper_out_key_size 20
-mapper_out_value_size 20
-file <path to WordCount_mapper.py file>
-reducer 'WordCount_reducer.py'
-reducer_out_key_size 20
-reducer_out_value size 20
-file <path to WordCount_reducer.py file>

Após a execução, o comando cria uma tabela ' results contendo duas colunas: word e ' count, ambas do tipo VARCHAR(20).