From 484ea29bd97615f869e1891ca9d0f3ef2ba6cff4 Mon Sep 17 00:00:00 2001 From: Vatsal Gosaliya Date: Fri, 8 Jul 2016 16:06:00 +0530 Subject: [PATCH 01/10] info.txt --- clustering/info | 2 ++ 1 file changed, 2 insertions(+) create mode 100644 clustering/info diff --git a/clustering/info b/clustering/info new file mode 100644 index 0000000..29ba171 --- /dev/null +++ b/clustering/info @@ -0,0 +1,2 @@ +It is a package that contains modules that are used to implement clustering algorithms. +You will find the respective ".ser" files in the main(outermost) folder. From 130548c99b92529a5aba85601b709aaf588e9092 Mon Sep 17 00:00:00 2001 From: Vatsal Gosaliya Date: Fri, 8 Jul 2016 16:07:03 +0530 Subject: [PATCH 02/10] kmeans algo. --- clustering/KMeans.java | 112 +++++++++++++++++++++++++++++++++++++++++ 1 file changed, 112 insertions(+) create mode 100644 clustering/KMeans.java diff --git a/clustering/KMeans.java b/clustering/KMeans.java new file mode 100644 index 0000000..69d8f17 --- /dev/null +++ b/clustering/KMeans.java @@ -0,0 +1,112 @@ +package clustering; +import java.util.ArrayList; +import java.util.List; +import helperClasses.DataPoint; +import helperClasses.Serialization; + +public class KMeans { + static int K = 3; + public List means = new ArrayList(); + public List> clusters = new ArrayList>(); + + public void importClusterData(){ + ArrayList> c = null; + Serialization S = new Serialization(); + clusters = S.clustDeserialize(c, "kMeansClusterData.ser"); + } + + public double getClusterMean(int current){ + double sum = 0, mean=clusters.get(current).get(0).x; + for(int i=1; i> reviseClusters(){ + for(int i=0; i()); + } + for(int i=0; i> c = null; + Serialization S = new Serialization(); + c = S.clustDeserialize(c, "kMeansClusterData.ser"); + System.out.println("Clusters : "); + for(int i=0; i Date: Fri, 8 Jul 2016 16:09:14 +0530 Subject: [PATCH 03/10] Training data for the KNN classifier --- knnTrainingData.ser | Bin 0 -> 621 bytes 1 file changed, 0 insertions(+), 0 deletions(-) create mode 100644 knnTrainingData.ser diff --git a/knnTrainingData.ser b/knnTrainingData.ser new file mode 100644 index 0000000000000000000000000000000000000000..41229cee20838de31cad1240851d3503f28dfdd5 GIT binary patch literal 621 zcmZ4UmVvdnh(S0ju`E%qv?Mb}&#|Z|vC=2AxTK=-lI+amiF2757(E$SiZiQHD+(AG z7`V$>KqOF;ct&bYL28k6PGWI!YO$V6Vo72^er8_D%5PKTBR=k3&cwjs!oZROG|Gj6 zu>y!IeHa*>OBjTFK(^`UB<7{-2bUCO=A~QvFmPm)=4Pg3mQ)rp)G;voFtF#BmgMB; zXG6K%C8@bUyAn%Ei&CLNEajPbDPT6(T|h@MFgRF(DFz1t2wlR!=vM#)#UOP|5HX-C z#|ALdK>{KIl4QlA%nhnc0lzX6h_nNQV!&k@%u)^frg=f6?f;wsfwQ Date: Fri, 8 Jul 2016 16:09:57 +0530 Subject: [PATCH 04/10] Training data for the Linear Regression classifier --- linRegTrainingData.ser | Bin 0 -> 439 bytes 1 file changed, 0 insertions(+), 0 deletions(-) create mode 100644 linRegTrainingData.ser diff --git a/linRegTrainingData.ser b/linRegTrainingData.ser new file mode 100644 index 0000000000000000000000000000000000000000..3ace5e519c690fc43bbd43751103020962179ef7 GIT binary patch literal 439 zcmZ4UmVvdnh(S0ju`E%qv?Mb}&#|Z|vC=2AxTK=-lI+amiF2757(E$SiZiQHD+(AG z7}(2MKqOF;ct&bYL28k6PGWI!YO$V6Vo72^er8??`}4JO+e$OKm>4)*7+6w(M!7IB zRseCO4+Eof34@Ri$Tt0)#JqI<;F6-uymV_H29Au<+{~2BlFCAcItFGR2KM~YlAQef zY$%tzBsCXkS7J$NQ7Tl3r93k)1;m=7czpi(fU z*p!4o6gvbqfEn17K&2c49B?Y}1IsYrGX-W*@T5$WS-xsmEVBOqHN`q-TeR+UPOy>+ E0OfjSh5!Hn literal 0 HcmV?d00001 From 602b251bbd16c5cfc38d44501ddbd3e92be65653 Mon Sep 17 00:00:00 2001 From: Vatsal Gosaliya Date: Fri, 8 Jul 2016 16:10:48 +0530 Subject: [PATCH 05/10] Training data for the Logistic Regression classifier --- logRegTrainingData.ser | Bin 0 -> 404 bytes 1 file changed, 0 insertions(+), 0 deletions(-) create mode 100644 logRegTrainingData.ser diff --git a/logRegTrainingData.ser b/logRegTrainingData.ser new file mode 100644 index 0000000000000000000000000000000000000000..db442252bef3721d24f1822d3af7293483807957 GIT binary patch literal 404 zcmZ4UmVvdnh(S0ju`E%qv?Mb}&#|Z|vC=2AxTK=-lI+amiF2757(E$SiZiQHD+(AG z7}&~LKqOF;ct&bYL28k6PGWI!YO$V6Vo72^er8??`}4JO+e$OKm>4)*7+6w(M!7IB zRseCO4+Eof34@Ri$Tt0)#JqI<;F6-uymV_H29Au<+{~2BlFCAcItFGR2KM~YlAQef zY$%tzBsCXkS7J$NQ7Tl3r93k)1 Date: Fri, 8 Jul 2016 16:11:49 +0530 Subject: [PATCH 06/10] Training data for the Naive Bayes classifier --- nbcTrainingData.ser | Bin 0 -> 1034 bytes 1 file changed, 0 insertions(+), 0 deletions(-) create mode 100644 nbcTrainingData.ser diff --git a/nbcTrainingData.ser b/nbcTrainingData.ser new file mode 100644 index 0000000000000000000000000000000000000000..39cc18b54a08ecda491069bcf9596207c83c188a GIT binary patch literal 1034 zcmbW0Pfo%>6vkhnNDWa@OkC*^-~g@+m|#-D*oAR9kqL|r9h`ZE)`f{%Z{Wfk=+-N^ z_Y$tWgYyOqi6mHT(l70Fe(%rMH!ojMG8$^vY|QEj3RyqWnq{Fdm_B^$KfSZ(B6ug@ z8*#_e5ddsWd{PVT4Y(X}-IUB2Zt5+D>`aLm%b%|YZ^_`X06`1Z;K7(y^ehN34hyM=owhEP@sN~LaQuNCA&n~Pzh`E1Fbh`8sTU0t@Q z#S5X(=^}V-gi@5mafVQAE3_*YhS0(yGF_pMC6YCgGD%>mXgOu0UmiyeLkPNKuCJIu z2a~KXr)kT^4EE2NbrSqjAzhDoP+MPz@T%pSO39olU7IxrlI)UHa#rfF%~h~prfw6P zr#af^vblfZid+e+QhI~^201O6J2~&|k0Ph@NpoUHWIAC#$07X& DLeiv} literal 0 HcmV?d00001 From 71fbc61370ec2ccd33479f01814d24c7a7e55046 Mon Sep 17 00:00:00 2001 From: Vatsal Gosaliya Date: Fri, 8 Jul 2016 16:12:34 +0530 Subject: [PATCH 07/10] Clustered Data from K-Means algo. --- kMeansClusterData.ser | Bin 0 -> 665 bytes 1 file changed, 0 insertions(+), 0 deletions(-) create mode 100644 kMeansClusterData.ser diff --git a/kMeansClusterData.ser b/kMeansClusterData.ser new file mode 100644 index 0000000000000000000000000000000000000000..06916c20f07c591a736788dda75e1cd16b4ed6f0 GIT binary patch literal 665 zcmZ4UmVvdnh(S0ju`E%qv?Mb}&#|Z|vC=2AxTK=-lI+amiF2757(E$SiZiQHD+(AG z7?{ghKxAvNoi3kREVWKGcN_q2D=mNI0p_e1t$tX0PJ*Tn3w~M z0j04iA;J^^RAa!VRA2-W$ax5x)v)M6bDRocB^rd4V6%vj<17gqYeHCw9bqNdEUKsg E09i$J!T Date: Fri, 6 Jul 2018 13:25:50 +0530 Subject: [PATCH 08/10] GitTest --- notebooks/Shared/BYOD_POC.py | 17 +++++++++++++++++ 1 file changed, 17 insertions(+) create mode 100644 notebooks/Shared/BYOD_POC.py diff --git a/notebooks/Shared/BYOD_POC.py b/notebooks/Shared/BYOD_POC.py new file mode 100644 index 0000000..e10357d --- /dev/null +++ b/notebooks/Shared/BYOD_POC.py @@ -0,0 +1,17 @@ +# Databricks notebook source +from pyspark import SparkContext +from pyspark import SQLContext +from pyspark.sql.functions import * +target_query="SELECT * from databse_name.byod_dbfs_table" +sparkContext = SparkContext.getOrCreate() +sqlContext = SQLContext(sparkContext) +dataframe = sqlContext.sql(target_query) +dataframe.repartition(1).write.format('com.databricks.spark.csv').options(delimiter=",").save("s3n://amgen-edl-acux-aaaa123-bkt/BYOD/", header="true", mode="overwrite") + +# COMMAND ---------- + +print "test2" + +# COMMAND ---------- + +print "test3" \ No newline at end of file From a790a77aa5b11509175eedf68f64246345bb62cb Mon Sep 17 00:00:00 2001 From: Vatsal Gosaliya Date: Fri, 6 Jul 2018 18:15:53 +0530 Subject: [PATCH 09/10] Update: README.md classification clustering helperClasses kMeansClusterData.ser knnTrainingData.ser linRegTrainingData.ser logRegTrainingData.ser nbcTrainingData.ser notebooks From 4f0a9c06b71ec17364534f7965cf977ce60be42a Mon Sep 17 00:00:00 2001 From: Vatsal Gosaliya Date: Fri, 6 Jul 2018 18:40:35 +0530 Subject: [PATCH 10/10] Update: README.md classification clustering helperClasses kMeansClusterData.ser knnTrainingData.ser linRegTrainingData.ser logRegTrainingData.ser nbcTrainingData.ser notebooks