CountVectorizer值在分类器中单独工作，在添加其他功能时无法正常工作

Question

我有一个推特个人资料的CSV数据，其中包含：姓名，描述，关注者数量，以下数量，机器人（我想要预测的类别）

当仅使用CountVectorizer值（xtrain）和Bot（ytrain）时，我已经成功执行了分类模型。但是无法将此功能添加到我的其他功能集中。

vectorizer = CountVectorizer()
CountVecTest = vectorizer.fit_transform(training_data.description.values.astype('U'))
CountVecTest = CountVecTest.toarray()
arr = sparse.coo_matrix(CountVecTest)
training_data["NewCol"] = arr.toarray().tolist()

rf = RandomForestClassifier(criterion='entropy', min_samples_leaf=10, min_samples_split=20)
rf = rf.fit(training_data[["followers_count","friends_count","NewCol","bot"]], training_data.bot)

错误：

---------------------------------------------------------------------------
ValueError                                Traceback (most recent call last)
<ipython-input-54-7d67a6586592> in <module>()
      1 rf = RandomForestClassifier(criterion='entropy', min_samples_leaf=10, min_samples_split=20)
----> 2 rf = rf.fit(training_data[["followers_count","friends_count","NewCol","bot"]], training_data.bot)

D:\0_MyFiles\0_Libraries\Documents\Anaconda3\lib\site-packages\sklearn\ensemble\forest.py in fit(self, X, y, sample_weight)
    245         """
    246         # Validate or convert input data
--> 247         X = check_array(X, accept_sparse="csc", dtype=DTYPE)
    248         y = check_array(y, accept_sparse='csc', ensure_2d=False, dtype=None)
    249         if sample_weight is not None:

D:\0_MyFiles\0_Libraries\Documents\Anaconda3\lib\site-packages\sklearn\utils\validation.py in check_array(array, accept_sparse, dtype, order, copy, force_all_finite, ensure_2d, allow_nd, ensure_min_samples, ensure_min_features, warn_on_dtype, estimator)
    431                                       force_all_finite)
    432     else:
--> 433         array = np.array(array, dtype=dtype, order=order, copy=copy)
    434 
    435         if ensure_2d:

ValueError: setting an array element with a sequence.

我做了一些调试：

print(type(training_data.NewCol))
print(type(training_data.NewCol[0]))
>>> <class 'pandas.core.series.Series'>
>>> <class 'numpy.ndarray'>

任何帮助，将不胜感激。

Answer 1

我会以相反的方式执行此操作并将您的功能添加到矢量化中。以下是玩具示例的含义：

from sklearn.feature_extraction.text import CountVectorizer
from sklearn.ensemble import RandomForestClassifier
import pandas as pd
import numpy as np
from scipy.sparse import hstack, csr_matrix

假设您现在拥有名为df的数据框中的功能以及y_train中的标签：

df = pd.DataFrame({"a":[1,2],"b":[2,3],"c":['we love cars', 'we love cakes']})
y_train = np.array([0,1])

您想在列c上执行文本向量化，并将功能a和b添加到矢量化中。

vectorizer = CountVectorizer()
CountVecTest = vectorizer.fit_transform(df.c)

CountVecTest.toarray()

这将返回：

array([[0, 1, 1, 1],
       [1, 0, 1, 1]], dtype=int64)

但CountVecTest现在是一个scipy稀疏矩阵。所以你需要做的是将你的功能添加到这个矩阵。像这样：

X_train = hstack([CountVecTest, csr_matrix(df[['a','b']])])

X_train.toarray()

这将按预期返回：

array([[0, 1, 1, 1, 1, 2],
       [1, 0, 1, 1, 2, 3]], dtype=int64)

然后你可以训练你的随机森林：

rf = RandomForestClassifier(criterion='entropy', min_samples_leaf=10, min_samples_split=20)
rf.fit(X_train, y_train)

注意：在您提供的代码段中，您将标签信息（“bot”列）传递给培训功能，您显然不应该这样做。

CountVectorizer值在分类器中单独工作，在添加其他功能时无法正常工作

问题描述投票：1回答：1

1个回答

最新问题

CountVectorizer值在分类器中单独工作，在添加其他功能时无法正常工作

问题描述 投票：1回答：1

1个回答

最新问题

问题描述投票：1回答：1