2025 年,我们在一家内容平台上,开始用大模型重新理解用户。

我之前在《从标签到记忆:重建互联网 App 对用户的理解》里写过这套系统的出发点。传统用户画像像一堆便利贴,记录用户是谁、点过什么、属于哪个人群。大模型可以读完一段时间内的行为序列,区分长期偏好、短期意图和偶发行为,把用户理解从离散标签变成带证据的语义记忆。

那篇文章更多在解释这套系统为什么成立。这一篇继续写它如何进入真实业务,以及线上实验之后,我们对它的价值有了哪些新判断。

我们在应用过程做了很多线上实验,覆盖新用户、召回用户、沉默用户和全量用户。其中大部分实验取得了可以推全的正向结果,改善的指标包括活跃、留存、内容消费转化和付费表现。出于脱敏考虑,这里不写具体增幅,只讲实验做了什么,以及我们从中改变了哪些判断。

为什么是 2025 年

这个想法以前就有。用户画像一直想回答「用户是谁」和「用户为什么这样做」。传统推荐系统已经很擅长根据行为序列预测下一次点击,但这些理解通常留在特征和某个任务模型里,很难被表达成带证据的场景和意图,也难以在推荐、搜索、营销和 Agent 之间复用。

到 2025 年,几个条件同时变了。

第一,DeepSeek、Qwen 等开源模型已经具备了较强的长文本理解和结构化输出能力。企业可以在自己的环境里部署模型,用户行为不需要发送到外部 API。对用户画像这类高隐私、大数据量的任务,私有化部署是开始做的前提。

第二,能力足够强的小模型快速出现。用最强的模型处理每一个用户,即使私有化也很难承受。但用强模型生成高质量样本,再对小模型做微调或知识蒸馏,就能把用户摘要、兴趣意图和结构化画像变成一个专用任务。模型不需要什么都会,只要稳定完成这几种输出。

第三,工程上有了把推理成本继续降下来的办法。画像可以离线批量生产,在线链路只读取结果;记忆可以增量更新,不需要每次重读全部历史;不同活跃度的用户也可以使用不同的更新频率。

开源模型解决了私有化和能力问题,微调与蒸馏让专用小模型可以大规模运行,离线与增量架构又把整体成本压到可接受的范围。这些条件凑在一起,我们才开始把大模型用户画像当成一个可以生产的系统,而不是一次概念验证。

大模型画像是怎么生产出来的

先把实现讲清楚。整条链路可以压缩成下面几步:

原始行为
  → 行为序列的清洗和文本化
  → 按用户生命周期分路推理
  → 用户摘要 + 长期记忆 + 短期记忆
  → 结构化画像 + 语义向量 + Agent Context
  → 推荐、搜索、营销和 Agent

第一步不是把原始日志直接丢给大模型。日志里有大量重复事件、技术字段和无效操作,模型读完也很难知道什么重要。我们先把搜索、浏览、消费、收藏、付费和负反馈等行为整理成时间序列,合并连续的重复行为,保留时间、对象、行为强度和上下文。

整理后的输入不再是一堆事件 ID,而是模型可以理解的行为叙事。例如,一个用户在多个工作日早上持续消费财经内容,晚上却集中浏览轻松内容。这里不只有两个内容标签,还有稳定兴趣、消费时段和场景切换。

第二步是按用户生命周期分路推理。画像不是算得越多越好。每次推理都要看现有数据已经能回答多少,传统模型已经做到什么,大模型还能补上什么,以及这次计算需要多少成本。这些条件决定了用什么 Prompt、读多长的上下文、什么时候触发,以及多久更新一次。

活跃用户的行为丰富且持续变化,需要频繁更新。但全量重读历史的成本最高,传统特征对短期行为的预测也已经很强。所以每次只读旧记忆和最近的增量行为,用大模型区分稳定偏好和短期探索。

召回用户平时不必持续计算。用户回流时,系统再读取历史记忆和最近信号,判断过去的兴趣是否还有效。推理更深,但只在有明确业务时机时触发。

新用户的证据少,输入更短,传统推荐可用的信号也最少。大模型在冷启动阶段的边际价值更高,但系统不会把推测当成事实,输出的是带置信度的概率判断。

第三步是生成三类产物。

用户摘要是一段紧凑的自然语言,回答「这个用户大致是谁」,用于检索、运营理解和 Agent 个性化。

长期记忆是一组可以独立更新和检索的记忆片段,记录相对稳定的用户理解。每条记忆都要带行为证据,只有跨日重复出现的信号,或收藏、付费、反复消费等强行为,才能进入长期记忆。一次偶然点击不能改写对一个人的长期判断。

短期记忆也以片段表达,记录最近正在发生的意图。它有更快的更新和衰减速度,用来表达「用户一直喜欢财经,但这周在密集关注某个新议题」这类动态变化。

下面的 demo 保留了实际画像结构,用户属性、内容名称和记忆片段均经过合成脱敏,不对应某个真实用户。

用户摘要:

用户位于一线城市,处于稳定职业阶段,有持续获取高信息密度内容的习惯。主要偏好包括:
1. 宏观经济与市场分析,工作日早上持续追踪,常完整消费日更内容;
2. AI 与科技产业,中午更倾向深度访谈与产业分析;
3. 音乐与轻松内容,晚上消费更集中,与白天的信息获取形成稳定的场景切换。
最近对人形机器人与市场波动的关注明显上升,属于长期兴趣下的短期集中探索。

长期记忆片段(节选):

- 用户是高信息密度内容的稳定消费者,长期关注财经与科技产业,也保留稳定的音乐消费。证据:三类内容均跨多个自然日重复出现,财经与科技深度内容的消费完整度较高。
- 长期追更「某市场晨报」与「某科技产业访谈」,前者作为早间信息来源,后者用于了解创业者和产业专家的长期判断。证据:两个系列都有跨周追更和反复消费行为。
- 工作日早上习惯追踪市场和宏观变化,中午集中消费科技产业深度内容,晚上转向音乐和轻松内容。用户希望通过持续的信息输入跟踪外部变化,并理解新技术的商业化路径。证据:这一时段分布和内容选择在多个工作日重复出现。

短期记忆片段(节选):

- 人形机器人的产业进展与商业化:近一周多次主动搜索人形机器人,并连续消费具身智能、产业链和商业化落地的深度内容,主要发生在工作日中午。
- 市场波动下的资产配置:最近三天集中查找市场变化、风险和配置策略,偏好结论明确且有逻辑依据的内容,主要发生在工作日早上。

这三种产物各有用途。用户摘要让人或 Agent 快速了解一个用户,长期记忆保存反复出现、相对稳定的判断,短期记忆只记录最近发生的变化。它们不是同一份画像的长、中、短版本。

初始化时,模型会读取一段较长的行为序列,建立第一版记忆。之后不再反复读取全部历史,只把旧记忆和新增行为交给模型,更新发生变化的片段。新行为与过去的判断冲突时,先记成阶段性变化,避免一次偶然点击改写长期偏好。

画像生成出来还不算完成。推荐和搜索系统需要结构化字段与语义向量,Agent 更适合直接读取用户摘要和记忆片段。我们把同一份用户理解做成不同形式,交给各自的业务链路使用。

上线前,我们会对画像做专门评测,检查结论有没有行为证据、是否过度推测,以及有没有把短期行为写成长期偏好,低分样本再由人复查。

新用户:缺的是可以使用的信号

新用户几乎没有站内行为,传统推荐最弱的地方就在这里。没有足够的点击、消费和付费记录,协同过滤很难找到可靠的相似人群。但新用户也不是完全没有信号,用户主动选择的兴趣、进站来源、外部兴趣信息和最初几次行为,都能提供一些线索。

在上面这条生产链里,新用户会进入稀疏画像分支。推理前先过滤覆盖面太广、区分度太低的通用信号,否则大模型很容易把噪声解释成泛化的兴趣。剩下的线索来自不同渠道,强度和时间属性也不同。大模型的作用是把它们放在一起推理,整理成一组带证据和置信度的兴趣判断,而不是直接决定给用户推什么。

这些判断仍然由现有推荐系统消费。它们是新的输入特征,和热门度、内容质量、实时行为一起参与召回和排序。线上实验里,新用户的活跃和付费指标都出现了正向变化。

大模型在这里提供的价值,是在行为还很少时,尽早得到一组可以被验证的用户理解。

召回用户:补上行为断层

召回用户的问题不是没有历史,而是历史和现在之间出现了断层。他可能已经几个月没有打开产品,过去的偏好还有多少有效,最近回来又是因为什么,单看最后几次点击很难判断。

这类用户进入召回画像分支。我们先把用户的长期行为压缩成一份语义摘要,再将它向量化,去找兴趣结构相似且仍然活跃的用户。活跃用户正在消费的内容,会成为召回推荐的候选集。

这个方法带来了留存的正向改善。它的作用很具体:当实时行为不够用时,用语义上更完整的长期理解,帮推荐系统找回可以重新启动的兴趣。

全量用户:语义记忆和行为特征要一起用

我们一度希望用大模型生成的向量替代传统特征,实践后发现这个方向不对。

实时点击、最近消费和频次统计,对下一步行为的预测仍然很强。大模型更擅长的是另一件事:从更长的时间和更多类型的行为里,提炼出稳定偏好、消费场景和潜在意图。

后来的架构保留了三个时间尺度的信号。实时行为回答「用户刚刚做了什么」,短期记忆回答「用户最近集中在探索什么」,长期记忆回答「哪些偏好已经稳定,用户长期是谁」。在全量用户的推荐实验里,基于长期记忆的语义召回,给内容消费转化和留存都带来了增量。

个性化 Push:决定给谁推、推什么和什么时候推

用户记忆在 Push 上的价值,不只是生成一句更像人写的文案。

传统 Push 往往依赖预设标签和固定人群包。系统可以知道用户对科技内容有兴趣,但不一定知道他最近正在密集关注人形机器人,也不知道他什么时候更愿意消费这类内容。一个粗粒度的「科技兴趣」标签,很难同时决定内容、时机和表达。

接入用户记忆后,长期记忆先判断这个主题是否符合用户的稳定兴趣,短期记忆判断最近是否存在明确意图,场景记忆再给出更合适的触达时段。只有几类信号能对上,系统才发出 Push。文案也不再只写一个宽泛的热点,而是围绕用户正在探索的具体问题组织。

就前面 demo 里的用户而言,长期记忆说明他持续关注科技产业,短期记忆表明他最近正在密集探索人形机器人,时段记录则显示中午更适合深度内容。这三个信号合在一起,才形成一次具体的触达。

这类策略在线上实验中明显提升了 Push 点击率,后续扩大了应用范围。用户对 Push 的点击和消费又会变成新的行为信号,回到短期记忆,影响下一次的人群、内容和时机判断。

我们也试过只根据用户记忆生成个性化付费文案,效果在不同生命周期上并不一致。对已经出现流失风险的用户有收入增量,换到其他人群就没有那么稳定。两类实验放在一起看,个性化的价值在于改变整个触达决策,只改文案还不够。

这些实验改变了哪些判断

第一,大模型用户画像的价值不在画像本身。一份写得很像人的用户摘要,如果只放在后台给运营查看,业务价值很有限。它要被转成推荐特征、检索向量或 Agent Context,进入真实的执行链路。

第二,大模型优先应该用在传统系统信号不足的地方。新用户、召回用户、长尾内容和复杂意图,都比高活用户的下一次点击预测更适合。后者已经有丰富的实时行为,大模型能带来的边际改善反而较小。

第三,在线实验才是最终的 Eval。我们可以检查一份用户摘要是否准确、是否有证据、是否把短期行为错当成长期偏好。这些评测只能证明画像质量过关。它能不能让用户留下来、更愿意消费或付费,还是要靠对照实验回答。

大模型用户画像能带来增长吗

我的答案是能。它相对于传统画像最突出的价值,是把分散在不同系统、不同时间尺度里的行为信号,组织成带有证据、场景和动机的语义资产。这份理解不再只留在某个任务的特征和模型里,可以被推荐、搜索、营销和 Agent 共同使用。

这种理解在传统信号不足时尤其有用。新用户还没有积累足够的点击,大模型可以从少量线索中给出带置信度的兴趣判断;召回用户的实时行为已经断开,长期记忆可以帮助系统重新找到仍然有效的兴趣;面对复杂意图,语义向量和记忆片段也比固定标签更容易匹配到合适的内容。

它没有替代传统画像。实时点击、消费频次和统计特征仍然擅长预测下一步行为,大模型补充的是这些特征难以显式表达和跨系统复用的语义。原始行为被转换成带证据的用户记忆,再以结构化数据、语义向量或 Context 的形式进入推荐、搜索和营销系统。我更愿意把大模型画像看作传统画像之上的一层语义能力,在传统信号不足或意图难以直接表达的地方,增加一组可以被业务使用、也可以用线上实验验证的判断。