Spark

[cloudera@quickstart ~]$ mongo --version
bash: mongo: command not found

[cloudera@quickstart ~]$ spark-shell
Setting default log level to "WARN".
To adjust logging level use sc.setLogLevel(newLevel).
SLF4J: Class path contains multiple SLF4J bindings.
SLF4J: Found binding in
[jar:file:/usr/lib/zookeeper/lib/slf4j-log4j12-1.7.5.jar!/org/slf4j/impl/
StaticLoggerBinder.class]
[jar:file:/usr/lib/flume-ng/lib/slf4j-log4j12-1.7.5.jar!/org/slf4j/impl/
[jar:file:/usr/lib/parquet/lib/slf4j-log4j12-1.7.5.jar!/org/slf4j/impl/
[jar:file:/usr/lib/avro/avro-tools-1.7.6-cdh5.12.0.jar!/org/slf4j/impl/
SLF4J: See http://www.slf4j.org/codes.html#multiple_bindings for an explanation.
SLF4J: Actual binding is of type [org.slf4j.impl.Log4jLoggerFactory]
Welcome to
____ __
/ __/__ ___ _____/ /__
_\ \/ _ \/ _ `/ __/ '_/
/___/ .__/\_,_/_/ /_/\_\ version 1.6.0
/_/
Using Scala version 2.10.5 (Java HotSpot(TM) 64-Bit Server VM, Java 1.7.0_67)
Type in expressions to have them evaluated.
Type :help for more information.
21/11/28 22:03:11 WARN util.NativeCodeLoader: Unable to load native-hadoop library
for your platform... using builtin-java classes where applicable
21/11/28 22:03:14 WARN util.Utils: Your hostname, quickstart.cloudera resolves to a
loopback address: 127.0.0.1; using 10.0.2.15 instead (on interface eth0)
21/11/28 22:03:14 WARN util.Utils: Set SPARK_LOCAL_IP if you need to bind to
another address
Spark context available as sc (master = local[*], app id = local-1638165801967).
21/11/28 22:03:33 WARN shortcircuit.DomainSocketFactory: The short-circuit local
reads feature cannot be used because libhadoop cannot be loaded.
SQL context available as sqlContext.
scala> val rdd=spark.sparkContext.parallelize(Seq(("Java", 20000),

| ("Python", 100000), ("Scala", 3000)))
<console>:25: error: not found: value spark
val rdd=spark.sparkContext.parallelize(Seq(("Java", 20000),
^
scala> rdd.foreach(println)
<console>:26: error: not found: value rdd
rdd.foreach(println)
^
scala> val rdd=spark.sparkContext.parallelize(Seq(("Java", 20000),

("Python",100000), ("Scala",3000)))
<console>:25: error: not found: value spark
val rdd=spark.sparkContext.parallelize(Seq(("Java", 20000),
("Python",100000), ("Scala",3000)))
^
scala> val rdd=sc.parallelize(Seq(("Java", 20000), ("Python",100000),
("Scala",3000)))
rdd: org.apache.spark.rdd.RDD[(String, Int)] = ParallelCollectionRDD[0] at
parallelize at <console>:27
scala> rdd.foreach(println)
(Java,20000)
(Python,100000)
(Scala,3000)
scala> val rddnew = sc.textFile("/home/cloudera/dim1.txt")

rddnew: org.apache.spark.rdd.RDD[String] = /home/cloudera/dim1.txt
MapPartitionsRDD[2] at textFile at <console>:27
scala> rddnew.foreach(println)
org.apache.hadoop.mapred.InvalidInputException: Input path does not exist:
hdfs://quickstart.cloudera:8020/home/cloudera/dim1.txt
at
org.apache.hadoop.mapred.FileInputFormat.singleThreadedListStatus(FileInputFormat.j
ava:287)
at
org.apache.hadoop.mapred.FileInputFormat.listStatus(FileInputFormat.java:229)
at
org.apache.hadoop.mapred.FileInputFormat.getSplits(FileInputFormat.java:315)
at org.apache.spark.rdd.HadoopRDD.getPartitions(HadoopRDD.scala:202)
at org.apache.spark.rdd.RDD$$anonfun$partitions$2.apply(RDD.scala:239)
at scala.Option.getOrElse(Option.scala:120)
at org.apache.spark.rdd.RDD.partitions(RDD.scala:237)
at
org.apache.spark.rdd.MapPartitionsRDD.getPartitions(MapPartitionsRDD.scala:35)
at org.apache.spark.SparkContext.runJob(SparkContext.scala:1959)
at org.apache.spark.rdd.RDD$$anonfun$foreach$1.apply(RDD.scala:912)
at
org.apache.spark.rdd.RDDOperationScope$.withScope(RDDOperationScope.scala:150)
at
at org.apache.spark.rdd.RDD.withScope(RDD.scala:316)
at org.apache.spark.rdd.RDD.foreach(RDD.scala:910)
at $iwC$$iwC$$iwC$$iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:30)
at $iwC$$iwC$$iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:35)
at $iwC$$iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:37)
at $iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:39)
at $iwC$$iwC$$iwC$$iwC.<init>(<console>:41)
at $iwC$$iwC$$iwC.<init>(<console>:43)
at $iwC$$iwC.<init>(<console>:45)
at $iwC.<init>(<console>:47)
at <init>(<console>:49)
at .<init>(<console>:53)
at .<clinit>(<console>)
at $print(<console>)
at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
at
sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:57)
at
sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:4
3)
at java.lang.reflect.Method.invoke(Method.java:606)
at org.apache.spark.repl.SparkIMain$ReadEvalPrint.call(SparkIMain.scala:1045)
at org.apache.spark.repl.SparkIMain$Request.loadAndRun(SparkIMain.scala:1326)
at org.apache.spark.repl.SparkIMain.loadAndRunReq$1(SparkIMain.scala:821)
at org.apache.spark.repl.SparkIMain.interpret(SparkIMain.scala:852)
at org.apache.spark.repl.SparkILoop.reallyInterpret$1(SparkILoop.scala:857)
at
org.apache.spark.repl.SparkILoop.interpretStartingWith(SparkILoop.scala:902)
at org.apache.spark.repl.SparkILoop.command(SparkILoop.scala:814)
at org.apache.spark.repl.SparkILoop.processLine$1(SparkILoop.scala:657)
at org.apache.spark.repl.SparkILoop.innerLoop$1(SparkILoop.scala:665)
at org.apache.spark.repl.SparkILoop.org$apache$spark$repl$SparkILoop$
$loop(SparkILoop.scala:670)
at org.apache.spark.repl.SparkILoop$
$anonfun$org$apache$spark$repl$SparkILoop$
$process$1.apply$mcZ$sp(SparkILoop.scala:997)
$anonfun$org$apache$spark$repl$SparkILoop$$process$1.apply(SparkILoop.scala:945)
at
scala.tools.nsc.util.ScalaClassLoader$.savingContextLoader(ScalaClassLoader.scala:1
35)
$process(SparkILoop.scala:945)
at org.apache.spark.repl.SparkILoop.process(SparkILoop.scala:1064)
at org.apache.spark.repl.Main$.main(Main.scala:35)
at org.apache.spark.repl.Main.main(Main.scala)
at
at
3)
at org.apache.spark.deploy.SparkSubmit$.org$apache$spark$deploy$SparkSubmit$
$runMain(SparkSubmit.scala:730)
at org.apache.spark.deploy.SparkSubmit$.doRunMain$1(SparkSubmit.scala:181)
at org.apache.spark.deploy.SparkSubmit$.submit(SparkSubmit.scala:206)
at org.apache.spark.deploy.SparkSubmit$.main(SparkSubmit.scala:121)
at org.apache.spark.deploy.SparkSubmit.main(SparkSubmit.scala)
scala> val rddnew = sc.textFile("/home/cloudera/dem1.txt")

rddnew: org.apache.spark.rdd.RDD[String] = /home/cloudera/dem1.txt
MapPartitionsRDD[4] at textFile at <console>:27
org.apache.hadoop.mapred.InvalidInputException: Input path does not exist:
hdfs://quickstart.cloudera:8020/home/cloudera/dem1.txt
at
org.apache.hadoop.mapred.FileInputFormat.singleThreadedListStatus(FileInputFormat.j
ava:287)
at
org.apache.hadoop.mapred.FileInputFormat.listStatus(FileInputFormat.java:229)
at
org.apache.hadoop.mapred.FileInputFormat.getSplits(FileInputFormat.java:315)
at org.apache.spark.rdd.HadoopRDD.getPartitions(HadoopRDD.scala:202)
at
org.apache.spark.rdd.MapPartitionsRDD.getPartitions(MapPartitionsRDD.scala:35)
at org.apache.spark.SparkContext.runJob(SparkContext.scala:1959)
at
at
at org.apache.spark.rdd.RDD.withScope(RDD.scala:316)
at org.apache.spark.rdd.RDD.foreach(RDD.scala:910)
at $iwC$$iwC$$iwC$$iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:30)
at $iwC$$iwC$$iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:35)
at $iwC$$iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:37)
at $iwC$$iwC$$iwC$$iwC$$iwC.<init>(<console>:39)
at $iwC$$iwC$$iwC$$iwC.<init>(<console>:41)
at $iwC$$iwC$$iwC.<init>(<console>:43)
at $iwC$$iwC.<init>(<console>:45)
at $iwC.<init>(<console>:47)
at <init>(<console>:49)
at $print(<console>)
at
at
3)
at org.apache.spark.repl.SparkIMain$ReadEvalPrint.call(SparkIMain.scala:1045)
at org.apache.spark.repl.SparkIMain$Request.loadAndRun(SparkIMain.scala:1326)
at org.apache.spark.repl.SparkIMain.loadAndRunReq$1(SparkIMain.scala:821)
at org.apache.spark.repl.SparkILoop.reallyInterpret$1(SparkILoop.scala:857)
at
org.apache.spark.repl.SparkILoop.interpretStartingWith(SparkILoop.scala:902)
at org.apache.spark.repl.SparkILoop.command(SparkILoop.scala:814)
at org.apache.spark.repl.SparkILoop.processLine$1(SparkILoop.scala:657)
at org.apache.spark.repl.SparkILoop.innerLoop$1(SparkILoop.scala:665)
$loop(SparkILoop.scala:670)
$anonfun$org$apache$spark$repl$SparkILoop$
$process$1.apply$mcZ$sp(SparkILoop.scala:997)
at
scala.tools.nsc.util.ScalaClassLoader$.savingContextLoader(ScalaClassLoader.scala:1
35)
$process(SparkILoop.scala:945)
at org.apache.spark.repl.SparkILoop.process(SparkILoop.scala:1064)
at org.apache.spark.repl.Main$.main(Main.scala:35)
at org.apache.spark.repl.Main.main(Main.scala)
at
at
3)
at org.apache.spark.deploy.SparkSubmit$.org$apache$spark$deploy$SparkSubmit$
$runMain(SparkSubmit.scala:730)
at org.apache.spark.deploy.SparkSubmit$.doRunMain$1(SparkSubmit.scala:181)
at org.apache.spark.deploy.SparkSubmit$.submit(SparkSubmit.scala:206)
at org.apache.spark.deploy.SparkSubmit$.main(SparkSubmit.scala:121)
at org.apache.spark.deploy.SparkSubmit.main(SparkSubmit.scala)
scala> val rdd3 = rdd.map(row=>{(row._1,row._2+100})

<console>:1: error: ')' expected but '}' found.
val rdd3 = rdd.map(row=>{(row._1,row._2+100})
^
scala> val rdd3 = rdd.map(row=>{(row._1,row._2+100)})

rdd3: org.apache.spark.rdd.RDD[(String, Int)] = MapPartitionsRDD[5] at map at
<console>:29
scala> rdd3.foreach(println)
(Java,20100)
(Python,100100)
(Scala,3100)
scala> val myRdd2 = s.range(20).toDF().rdd

<console>:25: error: not found: value s
val myRdd2 = s.range(20).toDF().rdd
^
scala> val myRdd2 = range(20).toDF().rdd

<console>:25: error: not found: value range
val myRdd2 = range(20).toDF().rdd
^
scala> val rddnew = sc.textFile("/input/File2.txt")

rddnew: org.apache.spark.rdd.RDD[String] = /input/File2.txt MapPartitionsRDD[7] at
textFile at <console>:27
hello world
abdul hello
hello world

Spark

Uploaded by

Copyright:

Available Formats

You might also like

Spark

Uploaded by

Document Information

Original Description:

Copyright

Available Formats

Share this document

Share or Embed Document

Sharing Options

Did you find this document useful?

Is this content inappropriate?

Copyright:

Available Formats

Spark

Uploaded by

Copyright:

Available Formats

[cloudera@quickstart ~]$ mongo --version

bash: mongo: command not found

scala> val rdd=spark.sparkContext.parallelize(Seq(("Java", 20000),

scala> val rdd=spark.sparkContext.parallelize(Seq(("Java", 20000),

scala> val rddnew = sc.textFile("/home/cloudera/dim1.txt")

scala> val rddnew = sc.textFile("/home/cloudera/dem1.txt")

scala> val rdd3 = rdd.map(row=>{(row._1,row._2+100})

scala> val rdd3 = rdd.map(row=>{(row._1,row._2+100)})

scala> val myRdd2 = s.range(20).toDF().rdd

scala> val myRdd2 = range(20).toDF().rdd

scala> val rddnew = sc.textFile("/input/File2.txt")

You might also like