林子雨编著《数据采集与预处理(第2版)》教材在Windows系统下实验方法

💡 原文中文,约22700字,阅读约需54分钟。
📝

内容提要

本文介绍《数据采集与预处理(第2版)》教材在Windows系统下的实验方法,涵盖Python、JDK、MySQL、Hadoop、MongoDB、Redis、Kafka、Flume及Kettle等工具的安装配置与使用,并说明各实验步骤及注意事项,旨在帮助不熟悉Linux的用户完成数据采集与预处理实验。

🔎

延伸解读

Windows实验的兼容性调整

第2版教材默认在Linux下实验,但本文提供了Windows下的替代方案。作者对部分软件版本做了调整,如Hadoop改用3.1.3并配套winutils,Python安装包改用3.10.11,这些调整不影响实验效果。读者在Windows下操作时,需注意版本差异,并确保按文中指引配置环境变量和路径。

环境配置的常见坑

文中多次强调环境变量和路径设置,如Python安装时勾选“Add python.exe to PATH”,JDK路径含空格会导致Hadoop格式化失败,需用PROGRA~1或双引号处理。Kafka启动失败时需删除CLASSPATH中的QTJava.zip。这些细节是Windows下实验成功的关键,建议严格按步骤操作。

跨平台代码一致性

本文指出,Python代码、Kettle操作等与操作系统无关,Linux和Windows下运行方法相同。但文件路径写法不同,如Windows用“C:/mylogs/”,Linux用“/home/...”。读者在Windows下实验时,只需调整路径格式,代码逻辑无需改动,这降低了跨平台迁移的难度。

Q&A

《数据采集与预处理(第2版)》教材在Windows系统下实验需要安装哪些主要软件?

需要安装Python、JDK、MySQL、Hadoop、MongoDB、Redis、Kafka、Flume和Kettle等软件。

在Windows系统下安装Python时,需要注意什么?

安装时需选中“Add python.exe to PATH”复选框,以便自动配置PATH环境变量。

如何在Windows系统下启动Hadoop伪分布式模式?

需要下载Hadoop3.1.3和配套的winutils,将winutils的bin目录替换Hadoop的bin目录,配置HADOOP_HOME环境变量,修改core-site.xml、hdfs-site.xml和hadoop-env.cmd文件,然后执行hdfs namenode -format格式化,再运行start-dfs.cmd启动。

在Windows系统下安装Kafka后,如何启动Zookeeper和Kafka服务?

打开两个cmd窗口,第一个窗口执行cd c:\kafka_2.12-3.6.1 和 .\bin\windows\zookeeper-server-start.bat .\config\zookeeper.Properties启动Zookeeper;第二个窗口执行cd c:\kafka_2.12-3.6.1 和 .\bin\windows\kafka-server-start.bat .\config\server.properties启动Kafka。启动后窗口会停住,不要关闭。

Flume采集目录数据到HDFS时,需要做哪些配置?

需要编写spooldir_hdfs.conf配置文件,设置Source为spooldir,指定监控目录,Sink为hdfs,设置HDFS路径等。同时需要删除Flume lib下的guava-11.0.2.jar,并复制Hadoop的guava-27.0-jre.jar到Flume lib下。

在Windows系统下,Flume采集MySQL数据到HDFS时,需要哪些准备?

需要下载flume-ng-sql-source-1.5.3.jar和mysql-connector-java-8.0.30.jar,并复制到Flume的lib目录下。同时需要创建MySQL数据库和表,并确保表有主键。

Kettle在Windows系统下如何启动?

下载Kettle安装文件pdi-ce-9.1.0.0-324.zip,解压后进入data-integration目录,双击spoon.bat即可启动Spoon。

🏷️

标签

➡️

继续阅读