data/text_code_relation.py

27 lines
1.0 KiB
Python

# 分析post中text block和code block数据的相关性
import pandas as pd
import numpy as np
textblkcnt = pd.read_csv('E:/学习相关资料/SOTorrent数据分析/posts_textblockcount.csv/posts_textblockcount.csv') # 读取text数据
codeblkcnt = pd.read_csv('E:/学习相关资料/SOTorrent数据分析/posts_codeblockcount.csv/posts_codeblockcount.csv') # 读取code数据
print(textblkcnt.shape)
print(codeblkcnt.shape)
aa = textblkcnt.iloc[:10000, 2:] # 39905357
print(aa.shape)
bb = codeblkcnt.iloc[:10000, 2:]
aa = np.array(aa)
bb = np.array(bb)
# cc = np.array([aa, bb])
aa_mean = np.mean(aa, axis=0) # axis=0,表示按列求均值
aa_std = np.std(aa, axis=0)
aa_zscore = (aa - aa_mean) / aa_std # 标准化
bb_mean = np.mean(bb, axis=0) # axis=0,表示按列求均值
bb_std = np.std(bb, axis=0)
bb_zscore = (bb - bb_mean) / bb_std # 标准化
cc_zscore_corr = np.corrcoef(aa_zscore.reshape(1, 10000), bb_zscore.reshape(1, 10000)) # 相关系数矩阵
print(cc_zscore_corr[0, 1])