Finer 是我独立搭建的一条多 agent 投研流水线(F0–F8):把多模态 KOL 内容转成结构化的投资意图与交易动作,全链路证据绑定、可回测。它已经是一个可访问的线上系统与开源仓库;对齐部分我设计了 RLHF(DPO) + RLVR 方案——把"判断要可被验证"直接写进训练目标。
Finer 的设计原则是:agent 给出的每一条结论,都要能回溯到它所依据的原始证据,并接受回测检验——而不是让模型凭印象下判断。
对齐由两部分组成:用人类偏好做 DPO,同时设计一个确定性的"可验证奖励"(RLVR),只奖励忠实回溯证据的抽取,而不奖励对市场涨跌的预测。
支撑上述系统与作品集的,是大量真实的 agent 编排实操。下面是跨 Claude Code / Codex / Gemini 的累计用量,可视为"高强度真实 agent 编排经验"的一个客观侧写(非绑定单一项目)。