在模型层面,它和pi0结构非常像,但是使用的是cross-atten - self-atten - cross-atten - …的模式: 再从数据维度,它利用了human data和neural data (video generation model generated)。感觉这一点挺有趣的,但是已经有很多论文在向后拓展了。
← Home · All Readings