首先感谢您的工作。 我记得CNCLIP的text encoder是用的roberta-base,您的ZHCLIP是用的roberta-large,这样看来两个模型的参数量是不是不一致?
首先感谢您的工作。
我记得CNCLIP的text encoder是用的roberta-base,您的ZHCLIP是用的roberta-large,这样看来两个模型的参数量是不是不一致?