Skip to content

Commit 1807a8b

Browse files
committed
write cluster df also
1 parent f22f16c commit 1807a8b

1 file changed

Lines changed: 6 additions & 5 deletions

File tree

test/resAnalysisImages.py

Lines changed: 6 additions & 5 deletions
Original file line numberDiff line numberDiff line change
@@ -8,19 +8,20 @@
88

99
from PIL import Image
1010

11-
// read data from parquet
11+
#read data from parquet
1212
res_df = getSparkSession().read.parquet('/tmp/resultSmallImages')
1313
res_df.count()
1414
res_df.show()
1515

16-
// get another df having z_cluster count more than 1
16+
#get another df having z_cluster count more than 1
1717
cluster_df = res_df.groupBy('z_cluster').count()
1818
cluster_df = cluster_df.filter("count > 1")
1919
cluster_df = cluster_df.sort(fn.desc('count'))
20-
cluster_df.show()
20+
cluster_df = cluster_df.select('z_cluster','item_id','brand','item_name','path')
21+
cluster_df.write.csv('/tmp/res_image_cluster')
2122

22-
// write relavant cols to csv for analysis
23+
#write relavant cols to csv for analysis
2324
res_partial = res_df.select('z_cluster','item_id','brand','item_name','path').sort(fn.desc('item_name'))
2425
res_partial.show()
2526
res_partial.write.csv('/tmp/res_analysis_partial')
26-
// analyse first DF one by one for data
27+
#analyse above DF one by one for data

0 commit comments

Comments
 (0)