WordCount en Python

Esta sección incluye el código fuente y las instrucciones para ejecutar el ejemplo WordCount escrito en Python.

A continuación se muestra el código fuente del mapeador. Guarda este código en un archivo llamado ' WordCount_mapper.py:

#!/usr/bin/env python
import sys
for line in sys.stdin:
(key,value) = line.split('\t')
wordList = value.split(' ')
for word in wordList:
print(word.strip() + "\t1")

A continuación se muestra el código fuente del reductor. Guarda este código en un archivo llamado ' WordCount_reducer.py:

#!/usr/bin/env python
import sys
word = ""
sum = 0
for line in sys.stdin:
(key,value) = line.split('\t')
if word == key:
sum = sum + int(value)
else:
if word != "":
print(word + "\t" + str(sum))
word = key
sum = 1
if key != "": print(key + "\t" + str(sum))

Para ejecutar este ejemplo para los datos almacenados en la tabla " words1 " (que incluye las columnas " id y " sentence ) dentro de la base de datos " mapreduce_db ", ejecute el siguiente comando:

mapreduce jar /nz/export/ae/products/netezza/mapreduce/current/mapreducestreaming.
jar
-db mapreduce_db
-input 'words1' 'id' 'sentence'
-output 'results' 'word' 'count'
-mapper 'WordCount_mapper.py'
-mapper_out_key_size 20
-mapper_out_value_size 20
-file <path to WordCount_mapper.py file>
-reducer 'WordCount_reducer.py'
-reducer_out_key_size 20
-reducer_out_value size 20
-file <path to WordCount_reducer.py file>

Tras la ejecución, el comando crea una tabla ' results ' que contiene dos columnas: word y ' count, ambas de tipo VARCHAR(20).