27 lines
1.0 KiB
Python
27 lines
1.0 KiB
Python
# 分析post中text block和code block数据的相关性
|
|
import pandas as pd
|
|
import numpy as np
|
|
|
|
textblkcnt = pd.read_csv('E:/学习相关资料/SOTorrent数据分析/posts_textblockcount.csv/posts_textblockcount.csv') # 读取text数据
|
|
codeblkcnt = pd.read_csv('E:/学习相关资料/SOTorrent数据分析/posts_codeblockcount.csv/posts_codeblockcount.csv') # 读取code数据
|
|
|
|
print(textblkcnt.shape)
|
|
print(codeblkcnt.shape)
|
|
aa = textblkcnt.iloc[:10000, 2:] # 39905357
|
|
print(aa.shape)
|
|
bb = codeblkcnt.iloc[:10000, 2:]
|
|
aa = np.array(aa)
|
|
bb = np.array(bb)
|
|
# cc = np.array([aa, bb])
|
|
|
|
aa_mean = np.mean(aa, axis=0) # axis=0,表示按列求均值
|
|
aa_std = np.std(aa, axis=0)
|
|
aa_zscore = (aa - aa_mean) / aa_std # 标准化
|
|
|
|
bb_mean = np.mean(bb, axis=0) # axis=0,表示按列求均值
|
|
bb_std = np.std(bb, axis=0)
|
|
bb_zscore = (bb - bb_mean) / bb_std # 标准化
|
|
|
|
cc_zscore_corr = np.corrcoef(aa_zscore.reshape(1, 10000), bb_zscore.reshape(1, 10000)) # 相关系数矩阵
|
|
print(cc_zscore_corr[0, 1])
|