
2026-08-14:X 算法更新与 DeepSeek Harness
From 行之的实践笔记
今天主要记录两个话题:X 新开源的推荐算法,以及 DeepSeek Harness 到底是面向技术人员,还是面向普通用户。
X 新开源的算法怎么判断是不是不真实行为?
早上起来,发现邮件收到好多 X 算法开源 GitHub 仓库的通知,抓紧爬起来看看,发现真的开源了不少东西:
- 推荐算法更新成生产环境使用的训练和推理代码;
- 推文可见性过滤:
visibility-filtering; - 不真实行为检测:
bdsm; - 权重衰减机制更新:用户从时间线刷到的推文是不是自己已关注的作者,如果不是,会乘一个小于 1 的系数,避免时间线都是陌生账户发的推文;已关注作者的转发和回复也会乘以这个系数,也就是说,转发和回复比发推的权重更低;
- 新作者冷启动:关注数小于 1000、单条曝光小于 1000 的作者,如果曝光低于阈值,会被提升曝光;
- 还有很多,就不一一列举了。
我最先关注的是 bdsm 模块,它被用来检测不真实行为。因为这两个月,我在时间线上刷到被冻结的账户实在太多了。
bdsm 还是一个 Transformer 模型。
它的输入是账号最近的操作,比如点赞、关注、回复和转发的频率与间隔,是否在短时间内进行大量操作,是否反复操作同一批账号,是否没有看内容就直接互动,以及操作来自正常客户端还是 API。
它的输出是判断这个账号更像哪一种类型:
- 自动关注;
- 自动点赞;
- 互动放大;
- 回复垃圾;
- 发帖垃圾;
- 自动转发;
- 混合自动化;
- 正常用户。
这次更新了很多内容,而且都是生产级的。但我觉得,对于普通 X 用户来说,其实不需要关注这些,只要关注自己的内容就好了。
如果想进一步了解推荐算法的底层原理,可以看看我之前写的文章,里面的底层原理还没有过时:
X 开源推荐算法后,我终于找到 100 万曝光背后真正的「流量密码」
新作者冷启动是怎么做的?
还有一点,新作者冷启动的源码也值得说一说。我自己认为,这也是大部分人真正想要关注的内容。
什么算新作者的推文?
需要同时满足两个条件:
- 作者的关注数小于或等于 1000;
- 当前推文的曝光小于 1000。
算法怎么扶持冷启动?
某个用户刷新时间线时,后台会执行面向这个用户的推荐算法。
其中有一个步骤,是通过模型计算候选推文的推荐分数并进行排序。这个过程可以参考我之前写的文章。
在排序后的候选池中,算法会寻找符合新作者条件的推文,同时还有两个要求:
- 推文内容通过了基础内容质量检查;
- 推文在候选池中的排名位于前 85%。
满足要求后,算法会把这条推文的分数调整到当前候选池第 16 名的位置,再推荐给用户。
不过,它最后不一定会出现在用户时间线的第 16 个位置,因为后面还会经过打乱等处理。
看着简单,其实在推文进入候选池之前,还有一层层的漏斗。
比如,你得先让自己的推文进入候选推文池。写当前热点或者大部分人关注的内容,更容易获得进入候选池的机会。
进入候选池以后,模型才会给推文打分;打完分还需要获得一定的排名,才能触发新作者冷启动。
总结一下,别管这些花里胡哨的机制。从源码层面可以看出来,只要你坚持输出内容,算法会为你保驾护航。
DeepSeek Harness 到底面向谁?
网上很多人都在说,DeepSeek Harness 更面向技术人员,而不是普通用户。
但之前 DeepSeek 内部会议录音里,梁文锋就说过:
我们没有在 C 端上花很多力气,甚至一度我们都不想维护那些用户了,但是用户赶都赶不走。
DeepSeek 的初衷是追求 AGI。
所以,我更愿意把 DeepSeek Harness 看成一种基建。先不讨论这个方向最后是不是对的,至少它是在探索一种新的 Agent 范式。
很多人拿 DSH 太极客、对普通用户不友好说事。但回头看,DeepSeek 官方 Chat 不一直也是这样吗?
至少从 DSH 身上,我看到的还是那套思路:先探索能力和范式,而不是先把 C 端体验磨到极致。
最终面向普通用户的体验,是基于 DSH 构建 agent 的开发者需要解决的问题。