交易信号“准确率80%”可能毫无意义:如果市场本来八成时间都不跌,永远看多也能得到相同数字。评价多空模型要先定义标签、基准和经济结果,再区分命中率、精确率、召回率及实际盈亏。

用混淆矩阵拆开四种结果

把预测多头/非多头与实际上涨/非上涨交叉,得到真正例、假正例、真负例和假负例。准确率统计全部判断正确比例;精确率回答发出多头后多少兑现;召回率回答真实上涨中捕捉了多少。

类别不平衡需要基准

若“上涨”标签占样本70%,模型准确率72%只比恒定看多略好。应同时报告多数类基准、平衡准确率和不同阈值结果,并按时间顺序做样本外测试,避免随机拆分泄漏市场状态。

方向正确仍可能亏损

小幅上涨的正确信号,未必覆盖点差、佣金和滑点;一次方向错误的跳空,也可能超过多次小盈利。评估应加入实际成交、持仓时间、盈亏比、尾部损失和最大回撤,而不是把每次判断视为同等价值。

概率模型还要检验校准

将预测概率按区间分桶,比较实际发生频率;可使用Brier分数等指标衡量概率误差。校准良好也不保证可交易,仍需与无交易、简单规则和成本后收益基准比较。

报告中应披露样本数、标签阈值、观察窗口、未完成样本和所有版本。只挑某个品种或月份展示最高准确率,属于选择性汇报,无法支持稳定结论。

还要建立时间基准:同样的方向若晚十分钟才发出,读者可成交价格已经不同。评价应使用真实发布时间后的报价,而不是模型内部更早的计算价。

基础绩效见胜率、期望值与回撤,概率说明见信号校准,收益分布见偏度与肥尾。