八月下旬,鹏城的天气进入了一年中最难熬的阶段。气温连续一周挂在三十五度以上,海风被闷热的水汽裹住,吹在身上没有凉意,只让人觉得黏糊糊的。t厂大楼的中央空调二十四小时不停转,会议室玻璃上凝了一层薄薄的水雾。
林晨坐在二十楼的小会议室里,面前是三个部门的负责人——金融事业部的孙总、产品部的刘姐、还有他们大模型应用部的陈铭。空调出风口正对着他的后颈,吹了一个小时,脖子有点僵。他把椅子往旁边挪了半米。
今天是FinGpt项目的月度评审会。大屏幕上投着上个月的数据——智能客服试点接入金融事业部的理财咨询业务线,跑了一个月,准确率从刚上线的百分之六十七提升到了百分之七十八。这个数字对于通用大模型来说不算什么,但在金融这个容错率极低的领域,七十八意味着已经达到了人工客服辅助工具的最低门槛。
用户留存呢?孙总翻着报告问。
陈铭把第二页投上去。试点期间接入的用户大概两千三百人,使用过至少一次智能客服的人里,复访率百分之四十一。对比行业平均水平——通用AI客服的复访率大概在百分之十五左右。
四十一很高。孙总放下报告,这说明用户不只是在尝鲜——他们真的在用。
因为回答是靠谱的。陈铭调出了一组对照数据,我们对比了同一个问题分别丢给通用大模型和FinGpt的结果。通用模型在解释理财产品的风险等级时,有百分之十二的回答包含了不准确或误导性的信息。FinGpt的错误率不到百分之三。差距在于我们做了垂直领域的指令微调——用了几万条金融监管文件和产品说明做训练数据。
孙总点了点头。产品部的刘姐接过话头:从产品角度看,七十八的准确率还不够直接面向c端用户独立提供服务。但如果定位是辅助人工客服——帮客服人员快速检索信息、自动生成回复草稿、实时校验合规性——这个准确率已经可以上线了。
你们的意思是先做内部工具?孙总问。
林晨把椅子往前拉了拉,第一步,FinGpt智能客服不直接面对用户,而是嵌入金融事业部的客服工作台——当客服人员看到用户提问时,系统自动给出推荐回复和合规提醒。人工做最终确认。这个模式的好处是零风险——每一条回复都是人工审核过的,FinGpt只是提效工具。
第二步呢?
第二步等准确率超过百分之九十,再做直接面向用户的自助客服。林晨翻开手里的笔记本,上面有几行他在昨晚写下的规划,时间线——今年q3做完内部工具上线,q4把准确率从七十八推到八十五以上。明年q1评估是否达到直接面向用户的标准。
刘姐在平板上记了几笔。这个节奏我可以推动。但需要金融事业部配合做两件事——第一,提供一线客服的使用反馈,帮我们迭代模型;第二,开放更多的业务场景数据,让FinGpt能覆盖理财产品之外的第二条业务线。
孙总看了看表。第一条没问题。第二条——你们想要什么业务线?
智能投研辅助。林晨把陈铭上周写的方案投到大屏幕上,用FinGpt的文本理解能力,帮个人投资者分析研报、解读财报、筛选市场信息。这不是替代人工分析,而是帮普通投资者看懂专业内容——研报动辄几十页,里面全是术语和表格,一个散户根本读不完也读不懂。
这个方向——孙总皱了下眉,合规风险有多大?
很大。所以我们不做投资建议。陈铭翻到了方案的合规说明部分,FinGpt在智能投研里的角色是信息整理者——帮用户把一篇五十页的研报压缩成五百字的要点摘要,用通俗语言解释专业术语,按用户指定的条件筛选信息。但我们不给或的建议。所有涉及投资决策的内容,全部标记为仅供参考,不构成投资建议
而且用户端的每一次输出都有完整的合规审查日志。林晨补充了一句,万一以后有监管问询,我们能追溯每一次对话的完整链路。
孙总沉默了大概半分钟,翻完了方案的最后一页,然后合上报告。方案我带回部门讨论。下周给你们反馈。
散会后,林晨和陈铭走回工位。走廊的空调比会议室还冷,过道两边的玻璃办公室里有人在大声开会——好像是云服务部门在争论某个架构方案。
你觉得孙总会批吗?陈铭边走边问。
林晨的回答很干脆,金融事业部的客服团队每天要处理几万条用户咨询,高峰期加班加到晚上十点。能帮他们提效的工具,没有理由不批。智能投研方向上——他会犹豫,但最终也会批。因为t厂的金融业务需要技术亮点,而FinGpt目前是全公司唯一的金融大模型。
陈铭点了点头,没有继续这个话题。走到工位前,他突然停了一下。对了,评测组上午发消息——FinGpt v3的第二次训练跑完了。金融问答准确率——
多少?
百分之八十一点三。比v2提升了三个多点。
林晨站在工位边,看着陈铭屏幕上的训练曲线。loss值在最后几百步趋于平稳,几乎是一条水平的直线——说明这次训练的收敛效果不错。但更关键的指标是右侧的评测矩阵:二十个金融领域的benchmark任务,v3在十四个上超过了v2,两个持平,四个略有下降。
下降的那四个任务是什么?
保险条款解释、期货合约说明、外汇政策问答、跨境支付流程。陈铭把评测详情拉了出来,这四个任务的数据量都不够,训练集规模只有其他任务的十分之一左右。
那就不是模型本身的问题——是数据瓶颈。林晨拉了张椅子坐下,v3先不发,把这四个任务的数据集补到跟其他任务同等规模,再重新微调一轮。
数据从哪来?
林晨想了一会儿。两个来源——金融事业部的内部文档,和公开的监管文件。前者我去跟孙总要,后者张雨已经在爬了。两周之内把数据集翻一倍。
陈铭打开了一个新的文档,开始列数据需求清单。林晨回到自己的工位,打开obsidian。
八月下旬了。从他在陈博士面试时提出AI的物理成本到现在,刚好过去了一年半。那个时候他连大模型的训练流程都只停留在论文里的概念,微调、RLhF、prompt Engineering——每个词都认识,但拼在一起不知道具体怎么做。
一年半之后,他已经带着二十几个人的团队,在做金融大模型的商业化落地。
不是天赋。是一年半以来每一天都在学。
窗外的海面被正午的阳光晒得发白。远处的货轮慢慢往港口方向挪——从高空看像一片漂在水上的树叶。
他低头继续写上周没写完的v3数据清洗脚本。
九月第一周,FinGpt智能客服辅助系统在金融事业部正式上线。不是c端产品——是内部工具,嵌入客服工作台,当客服人员接到用户咨询时,系统自动在侧边栏给出三条推荐回复和一条合规提醒。客服人员可以选择直接发送推荐回复,也可以自己修改后再发。
上线第一天的数据,陈铭当晚就发到了林晨的消息里:客服平均响应时间从四十七秒降到了三十二秒。减少了十五秒——看起来不多,但在每天上万条咨询的体量下,十五秒意味着整个团队每天多出了四百多个工时。
孙总在内部的即时通讯上给林晨发了两个字:好用。
林晨回了一个。
没有多余的客套。在大厂待了快两年,他已经学会了一个道理——内部的认可不需要长篇大论的感情抒发,说就是对技术人最高的评价。
晚上,他在笔记本上写了三行字:
FinGpt走出了从论文到产品的第一步。不是完美的产品——是能帮人省十五秒的工具。但十五秒积累起来,就是真实的价值。下一步——把准确率推上去,把业务线拓宽。金融大模型不是风口上的猪,是埋在土里的种子。慢慢长,扎实长。