访谈来源:Jane Street
主持人:Ron Minsky
嘉宾:Eric Mannes,Jane Street 另类数据团队负责人之一
原视频:https://youtu.be/a5eirWk7xic?si=W1CaPDu-H1enmUSZ
Eric Mannes 在 Jane Street 工作十余年,最初是大宗商品交易员,后来参与交易台工具开发,如今负责另类数据相关工作。他的经历连接了交易、软件与数据工程,也让他反复面对同一个问题:怎样把充满例外、修订和隐含假设的真实世界,变成交易系统可以放心使用的数据。
这场访谈讨论的核心,是另类数据如何真正进入一家顶级交易机构的研究流程:Jane Street 如何从投资问题出发寻找数据,理解数据背后的业务逻辑和生成机制,并进一步完成清洗、结构化、保存历史版本、构建时点一致性(Point-in-Time)数据?当机器学习和大语言模型开始处理越来越复杂的数据后,机构又该如何防止未来信息泄漏、识别数据偏差、验证模型结果,并确保最终进入研究系统的数据可解释、可复现、可信赖?
TL;DR:Eric Mannes 的核心观点
1. 交易市场会消灭已经被发现的规律。 有效模式一旦被参与者利用,就会逐渐衰减;而参与者还会对彼此的行为作出反应,因此交易研究必须持续更新判断、寻找新信息。 2. 风险往往藏在没有被明确写出的假设里。 元数据决定系统如何理解真实仓位,而极端行情往往会暴露那些平时看不见的错误前提。 3. 交易系统必须理解自己在交易什么。 风险计算只是结果,前提是先搞清楚合约怎么定义、如何交割、市场如何报价,以及这些持仓最终对应什么真实风险。 4. 另类数据要从投资问题出发。 研究的起点应该是先明确想回答什么投资问题,再寻找能够提供相关证据的数据来源,而不是先拿到数据再寻找用途。 5. 数据工程的核心是让数据正确对应现实。 同一家公司可能对应多个实体和证券标识,消费数据也可能因样本变化产生偏差。数据工程师必须理解数据如何生成、字段代表什么,以及哪些差异需要保留或合并。 6. 回测数据必须保持时点一致。研究只能使用当时真实可获得的信息。供应商事后的修订、重新分类或新模型带入的未来知识,都可能造成隐蔽的数据泄漏。 7. 模型越强,数据质量和验证越重要。 强模型不仅更容易发现真实信号,也更容易利用数据瑕疵和未来信息形成伪规律。AI 降低了生成代码和分析结果的成本,因此真正稀缺的能力正在转向验证、调查和判断。
访谈精编
市场会消灭已经被发现的规律
Ron: 你怎样来到 Jane Street?交易最吸引你的是什么?
Eric: 我大学学数学。本科有三个暑假,我分别尝试了学术研究、科技行业和金融。最后发现 Jane Street 最有意思,也最适合我。
实习期间最强烈的感受是学习速度很快。大多数新人此前没有真正交易过,所以公司会从市场机制、逆向选择和研究方法开始教。交易又是一个“反归纳环境”:物理效应不会因为被发现而消失,金融规律却会被竞争者利用并逐渐削弱。原来有效的知识可能不再成立,因此研究必须不断寻找新东西。
Ron: 整个市场都在提取信号,把已知信息纳入价格,剩余变化自然越来越像随机游走。你采取行动后,其他参与者还会回应并改变行为,而这些反应不存在于旧训练数据中。
交易因此是一套特殊的信息发现机制。它奖励人们了解世界,又迫使他们通过交易交出部分信息。竞争让市场价格成为更可靠的价值尺度,也让可利用规律越来越少。
Eric: 这种感觉在大宗商品和另类数据工作中尤其明显。我们观察现实世界的数据,理解它,再把信息纳入市场价格。
Ron: Jane Street 为什么在实习项目中投入那么多精力?模拟交易怎样帮助新人理解市场?
Eric: 抽象讨论良好决策不够。你必须明确承诺一项选择,并承担结果,才会收到有效反馈。
实习生会在模拟证券交易所里交易,也会参加一两个小时的简化情境。Figgie 是一个四人卡牌交易游戏:每个人掌握一部分私人信息,要公开报价、成交,并从其他人的行为推断他们可能知道什么。当两个人因为信息或估值理由不同而对同一张牌产生分歧时,你必须更新自己的判断。
低风险环境也让新人熟悉做市语言,敢于报出愿意买卖的价格,而不受真实资金压力干扰。它当然不能像《安德的游戏》那样,最后才告诉参与者模拟其实是真实交易;牌照、法律和监管都不允许这样做。
Ron: 市场整体可以创造正和价值,但具体到存在分歧的一笔交易,一方赚得多,另一方往往就会亏。两个同样聪明的人对事实看法相反时,至少一个人错了。
Eric: 所以你要认真回答:我为什么这样判断,犯错的为什么不是我?
Ron: 从实习生变成正式交易员后,你怎样开始对真实交易产生影响?
Eric: 我最初在大宗商品交易台学习石油、天然气及相关交易所交易基金。每天复盘实际成交:为什么做这笔交易?如果它很好,为什么没有多做;如果不好,为什么做了这么多?
资深交易员会让我先提出处理方案,再指出遗漏了哪些因素。通过大量具体案例和反馈,你会逐渐改善判断。大概几个月后,我就能提出一些小范围内有用的建议。
新人不需要一开始就比所有人强。只要愿意研究别人没时间处理的问题,就可以成为公司里最了解某只基金或某种交易机制的人。最初提出小改动,随后扩大独立决策范围;不确定时仍要主动征求意见。
风险始于错误假设
Ron: 股票风险可以先用价格乘数量来估算。为什么期货复杂得多?
Eric: 原油期货可能对应在俄克拉何马州库欣交割的一千桶油;活牛合约可能对应数万磅牛肉。屏幕价格按一桶或一磅显示,真实名义金额却要乘合约乘数。不同数据来源还可能使用不同乘数、币种或报价单位,一个按美元,另一个按美分。
期货价差又会拆成一多一空两条腿。比如在芝商所买入 CLU6-CLV6,意味着做多九月原油、做空十月原油;标普500期货价差的符号约定却可能相反。名称里虽然写着两条腿,不能只靠写法判断方向。
价格、乘数和单位只要配错一次,交易规模就可能少一百倍,或者更糟,多一百倍。风控系统要给策略设置外部风险边界,首先必须知道系统究竟交易了什么。这就是元数据问题:合约定义、报价方式和市场惯例看似琐碎,却直接决定真实仓位。
Eric: 交易和风控系统长期内置“价格必然为正”的假设。2020年4月20日,临近到期的芝商所原油期货却以负价格结算。
这份合约要求买方在特定时间到库欣接收原油。当时储油空间接近满负荷,全球供应很高,疫情又令需求骤降。多头面对的不再是抽象的油价,而是一批必须找到地方存放的实物。当天愿意付钱接货的人不够,价格因此跌到零以下。负价只维持了一天,这份合约最终交割结算仍为正。
Ron: 系统如果一直假设价格为正,那天就可能无法正常运转。
Eric: 一些本来会提供流动性的人,可能因为下单系统无法处理低于负100%的回报而发不出订单。基于油价估值油企或其他资产的模型也失去清晰答案:到底该不该把负数直接放进去?
Ron: 交易不只是数学、模型和高性能系统。交易员还必须理解交割规则、市场机制,以及库欣到底还有多少储油空间。大宗商品与现实生产、消费和物流直接相连,物理约束最终会进入价格。
系统必须理解交易
Ron: 你后来参与大宗商品交易台的技术建设。当时的风险系统是什么样?
Eric: Jane Street 早期的开发人员主要建设交易、行情和记账等通用基础设施。后来各交易台开始配备嵌入式开发人员,解决特定市场的问题。我做过技术实习,也学过 OCaml,因此参与了大宗商品团队。
风险系统既要显示整个能源敞口,也要下钻到石油、西得州中质原油,甚至某个月份的具体合约,并解释风险来自哪些持仓。此前这些工作由一张名为 uscommoditiesrisk.xlsm 的大型 Excel 表承担。按下按钮,它导入成交和仓位再计算风险。
表格由非常懂大宗商品和 Excel、但通常不是软件工程师的人逐年搭建。它有时很慢,偶尔失灵,也很难继续扩张。重建系统的价值不是换一种语言,而是从基本对象、输入和数据流开始,建立一套可以验证的结构。
Ron: Excel 本身其实很好。它把数据放在前台,方便观察、分析和调试。它的问题在哪里?
Eric: 我也喜欢 Excel。电子表格公式可能是世界上使用最广泛的函数式编程语言。Python 把代码放在前面、数据藏在后面;Excel 正好相反。当人们需要看着数据做决定时,这很有用。
问题出在规模。我们的系统用 Visual Basic 宏生成整张工作表,再由表格公式计算,相当于一个程序生成另一个程序。它缺少强类型检查、可靠测试和方便的版本控制。我甚至写过一个 Excel 搜索工具,才能跨大量文件查找公式和宏。
临时分析写在角落后往往永远留下。多年以后,没有任何一个人完全理解整张表,只剩几个人“大概知道而且相当有把握”。此时很难重建完整心智模型,也无法证明系统没有问题。
Ron: 旧表格包含大量领域知识,却没人掌握全部内容。你怎样帮助工程师替换它?
Eric: 我把交易员的领域理解转成工程师可以建设系统的问题模型:目标是描述哪些风险敞口,输入来自哪里,最基本的数据单位是什么,各部分怎样组成最终结果。整体模型和数据流先明确,工程师才能各自建设一部分,并确信它会正确接入系统。
翻译也要反向进行。领域专家可能忍受笨拙流程多年,已经意识不到软件能把事情改善到什么程度。好的交易台开发人员会指出某种做法不该继续,并提供新的研究工具,让过去太麻烦、根本没人愿意尝试的分析变得可行。
Ron: 交易员的忍痛能力有时太强。假如撞桌子三次再打自己一巴掌就能让机器吐钱,他们可能会一直照做。工程师要让他们理解,某些改进比想象中便宜,另一些则更昂贵。
Eric: 工作也不只是执行需求。拥有技术和领域知识的人应该主动思考,公司怎样才能做出更好的交易。
另类数据要从问题出发
Ron: 华尔街和 Jane Street 所说的另类数据是什么?
Eric: 华尔街通常把投资流程过去不常使用的数据称为另类数据。经典例子是用卫星照片数 Walmart 停车场里的汽车;交易所订单与成交、证券基础信息和财务报表则被视为传统数据。
但这个名称不稳定。一种数据足够普及后,还算不算另类?在 Jane Street,证券交易委员会文件也由另类数据团队处理,交易所实时行情和合约元数据反而属于传统基础设施。这来自公司的发展路径:Jane Street 从做市开始,再扩展到相邻业务。数据分类反映组织历史,不是数据的天然属性。
Ron: 为什么后来需要集中建设另类数据团队?
Eric: 我们并非没有外部数据,而是数据太难获取和使用。实时行情已有成熟的接入和历史研究系统,其他数据却散落在共享文件系统或不同数据库里。交易台临时找开发人员、交易员或运营工程师搭管道,各团队重复造轮子,也很少考虑全公司如何复用。结果可能只有理想状态的六成。
集中团队可以统一寻找特殊数据、建设通用管道工具,并维护被多个交易台使用的数据集。我们先从小项目开始,把一个基础但难用的数据集彻底弄清。数据变得易用、边界情况得到处理后,研究人员发现了过去找不到的效应,价值可以从损益里看到。
Jane Street 在2023年招聘第一位专职数据工程师,随后扩展到二十多人。高质量数据工程会产生诱导需求:研究人员看见可信数据集能做到什么,就开始提出以前不会尝试的问题。
Ron: 另类数据团队内部怎样分工?
Eric: 数据策略团队先理解各交易台要解决什么问题,再寻找外部数据。来源既包括 Neudata 这类供应商目录和行业会议,也包括从第一性原理出发追问:我要回答什么问题?什么数据能提供证据?谁在业务中自然产生这种数据,即使他们现在还没有出售?有时团队会联系潜在供应方,共同把数据做成产品。
供应商会议很像快速约会。买方先看资料,选择想谈的公司,然后连续进行十到十五分钟的会面。有人出售卫星数据,有人专门提供消费交易数据;Bloomberg、S&P、LSEG Refinitiv 等大型机构拥有跨行业数据,一些普通企业也会出售主营业务留下的副产品数据。
买方包括自营交易公司、对冲基金、资产管理机构、银行和私募股权机构。投资用途通常只关心汇总后的消费变化,例如 Lululemon 销售是否增加,而不需要知道消费者是谁;广告微定向则恰恰需要个人身份。
Ron: 数据策略之外,还有数据基础设施和数据工程。这两者有什么区别?
Eric: 数据基础设施团队建设接入、转换、管道监控和通用组件,产品是软件、系统和服务。数据工程师也写代码,但产品是一份可靠的数据集。他们必须理解数据怎样生成、字段代表什么、所属行业如何运作、研究人员怎样使用它,再决定公司应该如何整理。
机械解析可以尽量自动化,真正困难的问题是:“这个字段到底是什么意思?”
数据必须对应现实
Ron: 举一个必须先理解现实领域,才能把原始材料变成结构化数据的例子。
Eric: 公司财务数据完全不另类。美国上市公司每季度通过证券交易委员会文件发布报表,市场上也有供应商出售整理后的表格。但把文件转换成行和列只是开始。
首先要问什么是一家公司。双重上市结构里,A公司和B公司在法律上互不隶属,却可能共享管理层、董事会和经济权益。收到一条数据时,它对应其中一家还是两家合并?与证券连接时,它适用于全部股权类别,还是某个国际证券识别码或具体上市地点?
同一个经济对象存在多种标识和法律结构,研究时有些差异需要保留,有些则应合并。公司还会重报财务报表、改变会计方法或财年,使前后时期不能直接比较。数据工程师必须判断某个历史时点可以知道什么,以及交易真正需要什么特征。
Ron: 除了实体标识,还有没有数字本身难以解释的例子?经典的停车场照片真的好用吗?
Eric: 我不认为它很好用。你必须反复拍摄大量门店,数据稀疏而且噪声大。Walmart 约20%的购物在线上完成,其他企业线上比例更高;纽约消费者也不一定开车。停车场测量的是到店人数,与实际消费额还隔着一层。
从第一性原理看,Walmart 知道顾客花了多少钱,但季度结束前不会公布。消费者的银行、Visa、Mastercard,或者为信用社提供银行卡系统的公司也知道,并可能出售匿名汇总后的消费数据。
信用卡面板更直接,却不是美国消费者的随机样本。信用社会员与 Chase Sapphire Reserve 持卡人的人口结构可能不同,样本成员也会进入或退出。观察到 Walmart 消费增加,可能是每个人花得更多,也可能只是面板人数增加。研究人员必须理解抽样偏差、样本漂移,并与其他来源交叉验证。
Ron: 这些调整属于数据工程还是交易研究?
Eric: 两边都会做。模型可能由交易台完成,但前提是有人深入理解数据集怎样运作、什么时候提供了什么信息。数据工程师通常负责打下这层基础。
回测必须时点一致
Ron: 上游供应商的聚合和匿名化也可能做错,或者引入你看不见的偏差。
Eric: 供应商经常漏数据、算错字段,或者事后修改商户和品牌归属。他们可能告诉你:“此前这一列全错了,请改用新版本。”修正让今天的数据库更准确,却会破坏历史回测。
假如 Jane Street 想评估“当时订阅这套数据能否赚钱、是否值得购买”,却使用供应商后来修正的历史版本,模拟的就不是订阅者当时能够做出的交易,而是拥有时间机器后会做的交易。
Ron: 有些纯机械修正可能无害,但修订很容易把未来信息送回过去。最可靠的办法是保存当时真正收到的内容并记录时间,因为这至少证明那份数据在当时确实存在。
Eric: 我们保存每个版本及其本地接收时间。无论以后怎样转换,都可以重建“当时知道什么”。即使供应商提供自己的时间戳,我们也像处理交易所行情一样保留数据进入自己网络的时间。对方可能存在时钟同步问题,所以我们更信任自己的接收记录。
Ron: 机器学习、神经网络和大语言模型怎样改变另类数据工作?
Eric: 更强的预测模型提高了所有高质量数据的价值。大语言模型又能从非结构化文本提取字段,替代过去大量人工操作和复杂的正则表达式。
但如果用了解后来事实的最新模型处理旧文本,就会产生严重因果问题。模型知道 Enron 后来发生了什么,训练材料也可能包含未来财报。它可能把这些未来知识写进历史特征。
人工智能还能快速生成分析代码。优秀工程师清楚自己想得到什么,也能判断结果好坏,因此会从中受益;但生成错误代码也从未如此容易。一个人很容易做出东西便认为问题已经解决,实际却没有理解问题。
模型越强,清洗越重要
Ron: 随着模型扩大,一些人工特征工程可能不再必要。那数据清洗的重要性会下降吗?
Eric: 会提高。强模型更擅长发现模式,也更容易抓住未来信息泄漏和数据瑕疵形成的伪规律。模型可以自行学习更多特征,不代表输入可以不正确。数据里的异常区间也会影响训练,不同模型处理它们的能力不同。
大语言模型能否完全自动化数据工程,与它能否取代全部软件工程师是同一类问题。至少目前,人类仍要判断输出是否正确、字段是否有意义,以及什么值得建设。
Ron: 生产东西的成本下降后,验证就成为瓶颈。人的判断反而更重要。
数据工程首先是调查
Ron: 团队从2023年的一名数据工程师扩展到二十多人。你们怎样招聘?
Eric: 最重要的是好奇心和可靠的调查过程。工作会不断进入陌生行业、数据和交易类型。候选人必须喜欢钻进细节,清楚区分自己知道什么、不知道什么,并说明从一个判断走到另一个判断需要哪些证据。
做科学或社会科学研究、长期处理混乱现实数据的人往往很适合。中小型创业公司的数据负责人也可能合适,因为他们通常必须同时理解业务、数据和代码。工程能力仍然重要:数据管道也是软件,必须清楚、正确、可维护。这个岗位的系统复杂度可能低于纯软件工程,数据和业务复杂度却很高。
Jane Street 会在面试中给候选人一份陌生数据,让他调查、建立数据模型并完成任务。我们观察的不是他写了多少代码,而是他是否识别假设、设计检验、区分确定与不确定,还是写完后只说“希望能跑”。
我们寻找的是首先关心数据的人。更想训练复杂神经网络或建设可扩展系统的人同样有价值,但属于其他岗位。培养周期也很长:公司2025年开始规划,2026年面试,实习生2027年夏天加入,可能2028年毕业入职,到2029年才真正完全上手。
Ron: 最终还是要穿过表格,理解数据背后的真实世界,再判断现实是否要求你改变做法。