博客
关于我
Ubuntu16.04安装Hadoop+Spark+pyspark大数据python开发环境
阅读量:329 次
发布时间:2019-03-04

本文共 2245 字,大约阅读时间需要 7 分钟。

Ubuntu环境下大数据开发全指南

安装JDK

安装Java Development Kit(JDK)是大数据开发的基础。以下是手动安装步骤:

  • 使用包管理器安装JDK:
    sudo apt-get install java-dev
  • 配置JDK环境变量:
    打开~/.bashrc文件,添加以下内容:
    export JAVA_HOME=/usr/lib/jvm/java  export JRE_HOME=${JAVA_HOME}/jre  export CLASSPATH=.:${JAVA_HOME}/lib:${JRE_HOME}/lib  export PATH=${JAVA_HOME}/bin:$PATH

    保存后执行:

    source ~/.bashrc
  • 验证安装:
    输入命令查看Java版本:
    java -version
  • 配置SSH免密登录

    SSH免密登录是开发过程中的常用需求。以下是配置步骤:

  • 安装SSH服务器:
    sudo apt-get install openssh-server
  • 生成SSH公钥:
    输入命令并连续敲击回车:
    ssh-keygen -t rsa
  • 将公钥添加到授权列表:
    cat ./id_rsa.pub >> ./authorized_keys
  • 测试免密登录:
    ssh localhost
  • 安装Hadoop

    Hadoop是大数据处理的核心框架。以下是手动安装步骤:

  • 解压Hadoop:
    sudo tar -zxvf hadoop-2.6.5.tar.gz -C /usr/local
  • 配置Hadoop环境:
    打开~/.bashrc文件,添加以下内容:
    export HADOOP_HOME=/usr/local/hadoop  export CLASSPATH=$($HADOOP_HOME/bin/hadoop classpath):$CLASSPATH  export HADOOP_COMMON_LIB_NATIVE_DIR=$HADOOP_HOME/lib/native  export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
  • 启动Hadoop:
    source ~/.bashrc  ./bin/hdfs namenode -format  ./sbin/start-dfs.sh  jps
  • 配置Hadoop相关文件:
    • hadoop-env.sh:
    export JAVA_HOME=/usr/lib/jvm/java
    • core-site.xml:
    hadoop.tmp.dir
    file:/usr/local/hadoop/tmp
    fs.defaultFS
    hdfs://localhost:9000
    • hdfs-site.xml:
    dfs.replication
    1
    dfs.namenode.name.dir
    file:/usr/local/hadoop/tmp/dfs/name
    dfs.datanode.data.dir
    file:/usr/local/hadoop/tmp/dfs/data
  • 安装Scala

    Scala是大数据处理的高级语言。以下是手动安装步骤:

  • 使用包管理器安装Scala:
    sudo apt-get install scala
  • 配置Scala环境变量:
    打开~/.bashrc文件,添加以下内容:
    export SCALA_HOME=/usr/share/scala-2.11
  • 验证安装:
    scala -version
  • 安装Spark

    Spark是大数据处理的通用框架。以下是手动安装步骤:

  • 解压Spark:
    tar zxvf spark-2.3.1-bin-hadoop2.7.tgz
  • 配置Spark环境:
    打开~/.bashrc文件,添加以下内容:
    export SPARK_HOME=/usr/local/spark
  • 验证安装:
    cd /usr/local/spark/bin  ./pyspark
  • 测试Spark+Python:
    from pyspark import SparkContext  sc = SparkContext()  lines = sc.textFile("/usr/local/spark/README.md")  lines.count()  lines.first()
  • 以上就是Ubuntu环境下大数据开发的完整安装指南。从JDK到Hadoop、Scala、Spark,每一步都详细指导,帮助您快速搭建开发环境。

    转载地址:http://uzwh.baihongyu.com/

    你可能感兴趣的文章
    php自定义函数: 文件大小转换成智能形式
    查看>>
    php英语单词,php常用英语单词,快速学习php编程英语(6)
    查看>>
    R3.4.0安装包时报错“需要TRUE/FALSE值的地方不可以用缺少值”,需升级到R3.5.0
    查看>>
    PHP获取curl传输进度
    查看>>
    PHP获取IP所在地区(转)
    查看>>
    PHP获取IP的方法对比
    查看>>
    php获取json里面内容
    查看>>
    R2的版本由来
    查看>>
    PHP获取图片宽度高度、大小尺寸、图片类型、用于布局的img属性
    查看>>
    PHP获取当前文件的绝对路径
    查看>>
    PHP获取当前时间、时间戳的各种格式写法汇总
    查看>>
    PHP获取当前页面的完整URL
    查看>>
    php获取数据库中数据生成json,中文乱码问题的解决方案
    查看>>
    php获取文件夹中文件的两种方法
    查看>>
    PHP获取日期的一些方法总结
    查看>>
    R2学习记录
    查看>>
    PHP获取本周的每一天的时间
    查看>>
    php获取用户真实IP和防刷机制
    查看>>
    php获取网页内容的三种方法
    查看>>
    R-CNN算法优化策略
    查看>>