TGViewer
星辰观察站 星辰观察站 @web2star · 8.4K subscribers
Post #21874 152
今天读到一篇 2025 年的论文《用订单簿数据预测加密货币短期价格走势》,作者还有 X 账号
作者的研究数据是 2025 年 1 月 30 日来自 Bybit 公开接口的原始订单簿L2数据。每 100ms 一个快照,每个快照最多 200 层买卖盘。主实验用了 10 万条(约 166 分钟),序列实验扩到 100 万条(约 28 小时)。数据免费可获取,所以论文的可复现性不错。
研究方法是将数据分为不过滤、SG 滤波、Kalman 滤波三组,然后分别输入 6 个模型,在二分类(涨/跌)和三分类(涨/平/跌)两种标签下,分别预测 100ms / 500ms / 1s 后的价格方向。总共是 3(数据预处理)×6(6 组模型)×2(预测结果为二分类还是三分类)×3(三个预测时间窗口) = 108 组实验。
模型按照复杂度分组如下:
- 简单模型(逻辑回归和 XGBoost): 手动设计特征(比如买卖量差、供需不平衡),作为模型输入。速度最快,而且我们能看懂模型如何依据特征做判断,知其然更知其所以然。
- 混合模型(CNN+CatBoost 和 CNN+XGBoost): 不再是手动设计特征,而是让神经网络自己学习数据的特征,然后将这些特征输入决策树。优点是可能发现人工想不到的特征组合,坏处是这些特征难以解释,知其然不尽知其所以然。
- 深度模型(DeepLOB及其简化版): 完全端到端的神经网络,从特征提取(和之前的区别是这次可以提取序列信息作为特征)到最终判断全部自动完成,知其然而不知其所以然。
评估指标是预测正确率(技术上叫 F1 分数,同时衡量"你说涨的时候有多少次真涨了"和"真正涨的时候你抓住了多少次",0 到 1,越高越好)。同时记录训练时间。训练集 80%、测试集 20%,没有做交叉验证,因为时序数据不适合随机打乱。
核心观点1: 数据质量比模型选型重要
以三分类 500ms 40层订单簿的预测为例:
- 同样的 XGBoost,输入原始数据时预测正确率 0.45,做了 SG 平滑后升到 0.54,提升约 21%。
- 把模型换成更复杂的 DeepLOB,在原始数据上反而更低(0.43)。即使 DeepLOB 也做了 SG 平滑(0.52),依然不如 XGBoost+SG(0.54)。
数据质量的提升效果远超模型复杂度的提升效果。
SG 滤波为什么效果这么好?
原始订单簿数据非常毛躁,价格和挂单量在毫秒级别剧
More from @web2star
  1. Sep 27, 2026、人工、风险一整套。两笔账摆在一起,答案写在纸上。 ​这里头藏着一个最基本的经济学常识,商品的价格从来不是按成本定的,越初级的农产品越明显。小麦比馒头便宜,自来水比瓶装水便宜,牛奶…
  2. Sep 27, 2026课本说资本家倒牛奶真正是罪恶的嘛?这个观念坑了太多人。多少人从小被灌输,资本家宁可把牛奶倒进河里也不送给穷人,课本里、短视频里、饭桌上,这个例子被翻来覆去讲了一百多年,一提这事就气…
  3. Sep 27, 2026对普通人来说,把大笔钱放进离岸币圈交易所,跟把钱丢进一家全年不打烊的网上赌场差不多,只不过外面写着“金融革命”。损失了真的只能怪自己认知和风险意识不够。 美股券商至少还有一套看得见…
  4. Sep 27, 2026分享一个最实用且最简单的判断震荡收敛情况的方法: 1. 在4h周期上打开BBW(布林带宽度)指标; 2. 观察“带宽”值曲线是否逼近“收缩”曲线下沿; 3. 图中蓝色线越靠近下方绿…
  5. Sep 27, 2026今天是典型的休整日。标普跌0.18%收7709,纳指100跌0.39%,成交清淡。 最该关注的是SpaceX。它昨天刚因为资本开支暴增六倍崩了13.6%、收在上市以来最低,今天又正…
  6. Sep 27, 2026烈跳动,业界通常认为这是做市商快速调整报价造成的"闪烁"。SG 滤波是拿一个小窗口在数据上滑动,每到一个位置就在窗口内拟合一条平滑曲线,取曲线中心点的值作为平滑结果。和简单移动平均…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →