林子雨编著《数据采集与预处理(第2版)》教材在Windows系统下实验方法
内容提要
本文介绍《数据采集与预处理(第2版)》教材在Windows系统下的实验方法,涵盖Python、JDK、MySQL、Hadoop、MongoDB、Redis、Kafka、Flume及Kettle等工具的安装配置与使用,并说明各实验步骤及注意事项,旨在帮助不熟悉Linux的用户完成数据采集与预处理实验。
延伸解读
Windows实验的兼容性调整
第2版教材默认在Linux下实验,但本文提供了Windows下的替代方案。作者对部分软件版本做了调整,如Hadoop改用3.1.3并配套winutils,Python安装包改用3.10.11,这些调整不影响实验效果。读者在Windows下操作时,需注意版本差异,并确保按文中指引配置环境变量和路径。
环境配置的常见坑
文中多次强调环境变量和路径设置,如Python安装时勾选“Add python.exe to PATH”,JDK路径含空格会导致Hadoop格式化失败,需用PROGRA~1或双引号处理。Kafka启动失败时需删除CLASSPATH中的QTJava.zip。这些细节是Windows下实验成功的关键,建议严格按步骤操作。
跨平台代码一致性
本文指出,Python代码、Kettle操作等与操作系统无关,Linux和Windows下运行方法相同。但文件路径写法不同,如Windows用“C:/mylogs/”,Linux用“/home/...”。读者在Windows下实验时,只需调整路径格式,代码逻辑无需改动,这降低了跨平台迁移的难度。
Q&A
《数据采集与预处理(第2版)》教材在Windows系统下实验需要安装哪些主要软件?
需要安装Python、JDK、MySQL、Hadoop、MongoDB、Redis、Kafka、Flume和Kettle等软件。
在Windows系统下安装Python时,需要注意什么?
安装时需选中“Add python.exe to PATH”复选框,以便自动配置PATH环境变量。
如何在Windows系统下启动Hadoop伪分布式模式?
需要下载Hadoop3.1.3和配套的winutils,将winutils的bin目录替换Hadoop的bin目录,配置HADOOP_HOME环境变量,修改core-site.xml、hdfs-site.xml和hadoop-env.cmd文件,然后执行hdfs namenode -format格式化,再运行start-dfs.cmd启动。
在Windows系统下安装Kafka后,如何启动Zookeeper和Kafka服务?
打开两个cmd窗口,第一个窗口执行cd c:\kafka_2.12-3.6.1 和 .\bin\windows\zookeeper-server-start.bat .\config\zookeeper.Properties启动Zookeeper;第二个窗口执行cd c:\kafka_2.12-3.6.1 和 .\bin\windows\kafka-server-start.bat .\config\server.properties启动Kafka。启动后窗口会停住,不要关闭。
Flume采集目录数据到HDFS时,需要做哪些配置?
需要编写spooldir_hdfs.conf配置文件,设置Source为spooldir,指定监控目录,Sink为hdfs,设置HDFS路径等。同时需要删除Flume lib下的guava-11.0.2.jar,并复制Hadoop的guava-27.0-jre.jar到Flume lib下。
在Windows系统下,Flume采集MySQL数据到HDFS时,需要哪些准备?
需要下载flume-ng-sql-source-1.5.3.jar和mysql-connector-java-8.0.30.jar,并复制到Flume的lib目录下。同时需要创建MySQL数据库和表,并确保表有主键。
Kettle在Windows系统下如何启动?
下载Kettle安装文件pdi-ce-9.1.0.0-324.zip,解压后进入data-integration目录,双击spoon.bat即可启动Spoon。