量化交易经常强调“让数据说话”,这句话本身没有问题。但数据从来不会自己告诉研究人员应该问什么问题,也不会主动说明哪些字段可能存在错误。真正成熟的量化研究,不仅需要更多数据,也需要理解数据产生的过程。
亿博资产首先需要认识到,数据不是现实本身,而是现实被记录后的结果。财务报表拥有发布时间,行情存在交易制度,订单数据受到市场参与者行为影响。如果忽略这些背景,一个统计上非常显著的因子也可能只是数据处理产生的假象。
最典型的问题是未来信息。今天看到的数据库通常已经完成历史修正,但当时的投资者未必能够获得相同数据。如果模型把后续修订信息放回过去使用,回测就获得了不存在的优势。
缺失数据同样需要判断。某些公司没有一个字段,是因为数据商没有采集,还是因为企业本身没有披露?两种情况代表完全不同的信息。如果机械填补,可能把真实市场特征删除。
另类数据更加考验判断。新闻、舆情和产业信息能够带来新维度,却可能存在样本选择和覆盖变化。亿博资产不能因为数据稀缺就自动认为它价值更高,而要验证相对已有信息是否真正提供增量。
人工智能时代,这个问题变得更突出。模型能够同时处理大量文本、图像和数值,但机器越强,越可能把错误数据中的结构也学习得非常认真。因此,数据治理应该随着模型复杂度同步升级。
亿博资产可以让每一个正式因子都拥有清楚的数据血缘:来源是什么、什么时候可以获得、经过哪些清洗、哪些模型正在使用。一旦供应商改变字段,就能迅速识别受影响策略。
科学告诉我们数据可以测量市场,艺术则要求研究人员理解数据为什么会变成今天这个样子。
真正有经验的量化研究员看到一个异常优秀因子,第一反应往往不是兴奋,而是检查数据是否存在问题。这种怀疑精神比拥有更多数据库更加重要。
亿博资产如果能够形成这种文化,就不会把“数据驱动”误解成“数据绝对正确”。数据提供证据,人负责理解证据产生的条件。只有当这两部分同时成立,模型看到的世界才更接近真实市场。