算法模型方面,我们采用的协同过滤、矩阵分解和TF-IDF关键词提取,本质上还是基于统计学概率的粗颗粒度匹配,跟真正意义上的懂人心还是有很大的差距的。”
“在实际推送中,由于缺乏深度的语义理解能力,系统现在表现得很僵硬。”
“比如一个用户偶尔好奇点开了一篇讲怎么修车的文章,或者为了赚金币在里面多停了五秒钟。我们的离线模型晚上跑完数据,第二天就会判定他对修车感兴趣,一股脑地给他推七八篇这种类型的内容。”
“这种推送是缺乏准确度的,甚至经常引起用户在评论区里抱怨,说推荐的内容翻来覆去就那么几样,像个复读机。”
“而且因为大家为了赚金币乱点一气,很多原本不爱看这些内容的人也被算法打上了混乱的标签,导致冷启动阶段的模型收敛速度比我们预期的要慢得多。”
“按现在的开发进度,我们至少需要两三个月的时间去清洗掉这些为了金币而产生的垃圾滑动数据,短期内,算法只能作为一个辅助的分流工具,做不到多精准。”
听完两人的汇报,林辰点了点头。
“我们花钱给用户发红包,本来就是给技术团队争取试错的时间。”
“技术的发展有它客观的规律,所以不要害怕数据粗糙,也不要嫌弃离线计算慢。但尊重客观规律,不代表我们可以慢悠悠地混日子,我们买来的这个时间窗口并不长。”
林辰突然看向视频里的周博士,“京城那边现在有多少人了?”
“人一直在招,目前有两百多了。”周博士如实道。
“还不如够!”
林辰下令道:“你们接下来的工作重心,放在三件事上。”
“第一,反作弊与数据降噪。建立更严密的滑动轨迹识别规则,把那些纯粹为了薅羊毛的无效挂机行为从训练样本里剔除出去,保证算法吃进去的粮食尽量干净。”
“第二,耐下性子去打磨特征工程。把基础的协同过滤和用户长短期兴趣分类做好,哪怕每个月算法的匹配度只提升百分之五,一年累积下来,也是不可跨越的护城河。”
“第三,招人!两百多号人,就算个个长着三头六臂,面对每天数以亿计的日志,也是捉襟见肘,去外面抢人,去百度、去微软亚洲研究院、去各大高校的计算机国家重点实验室。”
“只要是真刀真枪做过分布式架构、搞过自然语言处理和数据挖掘的大牛,不管是博士还是架构师,薪
本章还未完,请点击下一页继续阅读>>>