那个第一个把大模型接进公司业务的工程师,后来怎么样了

我有个朋友,去年这个时候被老板拍着肩膀指派去做「公司的 AI 战略落地」。

那时候的 AI 战略,听起来像是一句口号。GPT 写代码、Claude 写文档、Gemini 看图、DeepSeek 帮算钱——朋友圈天天有人发截图,PPT 里 AI 两个字写得越来越大。老板的原话是:「先把这玩意儿接进公司,能跑就行。」

朋友点了点头,嘴上说「好的」,心里想,能跑?哪有那么简单。

一年后,他在我家阳台上喝了半瓶酒,跟我说,那时候他是真的不知道,「能跑」和「跑得稳」之间,隔着多少个失眠的凌晨。

第一个月:所有人都觉得 AI 是个魔法

那是去年春天。GPT-5 刚刚问世没多久,他像个新手家长一样去 OpenAI 官网注册账号,发现境外信用卡过不了 Stripe 风控;改用同事的香港信用卡,过了;调用 API,控制台显示 you have insufficient quota,又得回去充值;勉强跑通了,部署到公司国内云服务器,首字延迟 3.2 秒——产品经理在群里发了个微笑表情。

「我那时候就有不祥预感了。」他说。

国内服务器直连海外 API 这件事,从一开始就不像他想象的那样直接。api.openai.com 在国内不能稳定连接、Anthropic 9 月份直接公告收紧对中国地区的服务、跨境延迟在晚高峰能飘到 5 秒以上——这些东西,技术博客里写了很多年,但没有亲手踩过坑的工程师,都觉得「应该可以解决吧」。

第一个月,他用一台香港 VPS 自建了个 Nginx 转发,把延迟压到了 800 毫秒。产品经理终于愿意点头,老板拍板上线。

第二个月:账单来了

接入 GPT-5 之后第二个月,财务找到他。

财务说,这个月的 AI 调用费,比她见过的任何一项软件采购都贵。

朋友打开账单看了半天,发现一件让他啼笑皆非的事——他给 system prompt 写了一段大约 600 字的「公司角色设定」,每次请求都会带上。每天 80 万次调用,相当于每个月有差不多 145 亿个输入 token 是被这段公司介绍消耗的。

「我那一刻才意识到,token 不是免费的,prompt 是要钱的。」

后来的事就开始变得真实而琐碎。他给 system prompt 接了 prompt cache,砍了三分之一;给所有调用加了 max_tokens 上限,砍了五分之一;把简单的意图识别从 GPT-5 Pro 降到了 GPT-5-mini,账单又砍掉一半。

第三个月账单出来的时候,他在公司内网发了一条状态:「学会用模型,不如学会管模型。」

下面有人评论:「兄弟,你开始懂了。」

第三个月:用户开始抱怨

抱怨的内容五花八门。

「为什么 AI 说我去年的合同里有第十二条?我们合同根本没有那么多条。」
「为什么 AI 给我的法规引用,搜了半天找不到原文?」
「为什么对话到一半就卡住了,前面说的全没了?」

第一个问题,是幻觉。
第二个问题,还是幻觉。
第三个问题,是流式输出中断,然后会话状态丢了。

那段时间他几乎天天加班。最后请教了一个做了好几年 RAG 的前同事,对方甩给他一句话:「让模型查资料说话,而不是靠记忆说话。」

他花了两周把整个企业知识库重构了一遍:上传文档、分片、向量化、构建索引、加 rerank、设阈值、把召回片段强约束给模型,并且要求模型在找不到依据时直接说「不在文档范围内」。

幻觉率从大约 38% 降到 7% 左右。用户还是会偶尔抱怨,但抱怨的密度,从「天天找他」变成了「一周一两次」。

第六个月:模型换了,prompt 全废了

那是去年秋天的事。

GPT-5.4 上线,OpenAI 在 release notes 里说「prompt 行为整体保持兼容」,他相信了,把生产模型从 GPT-5 升到了 GPT-5.4。

第二天用户开始反馈:「AI 突然变得很啰嗦」「以前的输出格式不见了」「JSON 字段顺序变了」。

他打开监控,发现一票下游业务因为 JSON 字段顺序变化而解析失败。整个晚上他在回滚、对比、改 prompt、加 JSON Schema 强约束。

那一晚之后,他在工程文档里写了一句话:「永远不要相信『兼容』。」

后来他给所有线上调用都加了一份 evals 脚本,每次模型版本变化前都跑一遍金标集,确认输出分布没漂移再上量。

「我后来想明白一件事——」他说,「模型是流动的,prompt 是流动的,连官方都不能保证他们的下一个版本不打破你今天的代码。我们能做的,是把『接入层』搭得稳。」

第八个月:合规来了

2025 年初,公司法务和合规部门突然开会。

议题是:AI 调用的数据流向,要按照《生成式人工智能服务管理暂行办法》《数据出境安全评估办法》重新评估。

他被拎进去,被问了一连串问题:

「我们的用户隐私数据有没有出境?」
「我们用的模型是不是境内备案的?」
「我们能不能拿到服务商的数据处理协议?」
「服务商是不是国内主体?能不能开增值税发票?」
「API Key 现在是谁在管?泄露了怎么办?」

他答到一半就答不下去了。

后来他做了一件他一年前不会想做的事——把整个调用链改了。所有境外模型请求前先做 PII 脱敏;API Key 全部走后端代理;输出接内容审核;调用日志保留 90 天;和服务商签 DPA;把直连官方 API 的方案彻底放弃,改走国内合规聚合网关,OpenAI 协议兼容、人民币对公开票、专线优化。

他后来跟我说,那时候他在选服务商,选了好几家,最后定了 词元无忧(token5u)API。原因不复杂——OpenAI 协议兼容到老业务改个 base_url 就能跑、按量计费、起步即官方一半价格、人民币对公结算、主流大模型加多模态在同一个入口里——这几件事一次解决了。

「合规走通之后,老板那天请我吃了顿饭。」他笑了笑,「他说,我以为接入大模型,是把 API Key 填进去就完事了。」

一年之后

现在他依然在做这件事。

公司里 AI 已经成了基础设施,不再是 PPT 上的口号。客服、法务、运营、财务,每个部门都在用。模型从最早的 GPT-5 升到了 GPT-5.5,备用通道挂着 Claude Opus 4.7 和 DeepSeek V4,国产兜底是 Qwen3 Max 和 Kimi K2.5。RAG 是标配,监控是标配,灰度是标配,灰度过不了的版本绝对不上量。

我问他,这一年最大的收获是什么。

他喝完最后一口酒,说:「我一开始以为接入大模型是个技术活,后来才发现是个工程活,最后发现其实是个治理活。」

「模型是流动的。今天 GPT-5.5,明天 GPT-6;今天 Claude Opus 4.7,明天 Claude Sonnet 5。但接入层、成本治理、合规、灰度——这些东西不会变。」

「能跑」和「跑得稳」之间,那段距离,是他这一年的全部。

写在后面

如果你也在自己公司里做这件事——

也许你正在为延迟头疼,正在为账单焦虑,正在为合规流程跑断腿,正在为 prompt 漂移凌晨两点改代码。

我想告诉你,你不孤单。

这件事在 2026 年的所有公司、所有团队里都在发生。X 上、GitHub 上、各个开发者社区里,每天都在更新新的踩坑案例。GPT-5.5 上线第二周 OpenAI 自己的 Codex 都被远端 compaction 打穿——这不是你的问题,这是行业的问题。

慢慢来。把接入层搭好,把账单管住,把合规走通,把灰度做扎实。

模型还会一直更新,但那些「人」的事,慢慢来,会有答案的。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容