阿里重排论文PRM 《Personalized Re-ranking for Recommendation》

和DLCM做法类似，都是使用序列模型对rank后的结构做rerank，不同点是PRM使用了transform encoder来建模，并且使用了用户预训练向量和位置向量最后一层使用了softmax来计算a56爆大奖在线娱乐item被点击的概率（论文提到使用click作为label，也就是所存在多个label为1的情