diff --git a/torchscale/component/multiway_network.py b/torchscale/component/multiway_network.py index a44a699e..63f3cffc 100644 --- a/torchscale/component/multiway_network.py +++ b/torchscale/component/multiway_network.py @@ -45,11 +45,14 @@ def forward(self, x, **kwargs): return torch.cat([y1, y2], dim=self.dim) -class MutliwayEmbedding(MultiwayNetwork): +class MultiwayEmbedding(MultiwayNetwork): def __init__(self, modules, dim=1): super(MultiwayNetwork, self).__init__() self.dim = dim assert len(modules) == 2 self.A = modules[0] self.B = modules[1] - self.split_position = -1 \ No newline at end of file + self.split_position = -1 + +# Backwards-compatible alias for the previous misspelling. +MutliwayEmbedding = MultiwayEmbedding diff --git a/torchscale/model/BEiT3.py b/torchscale/model/BEiT3.py index 92737a21..eaefb7ab 100644 --- a/torchscale/model/BEiT3.py +++ b/torchscale/model/BEiT3.py @@ -10,7 +10,7 @@ TextEmbedding, VisionEmbedding, ) -from torchscale.component.multiway_network import MutliwayEmbedding +from torchscale.component.multiway_network import MultiwayEmbedding class BEiT3(nn.Module): @@ -30,7 +30,7 @@ def __init__(self, args, **kwargs): prepend_cls_token=True, ) # being consistent with Fairseq, which starts from 2 for position embedding - embed_positions = MutliwayEmbedding( + embed_positions = MultiwayEmbedding( modules=[ PositionalEmbedding(self.vision_embed.num_position_embeddings() + 2, args.encoder_embed_dim), PositionalEmbedding(args.max_source_positions, args.encoder_embed_dim),