diff --git a/.github/workflows/Validate-GPU.yml b/.github/workflows/Validate-GPU.yml index 70d9e9e143..1450bfc1f3 100644 --- a/.github/workflows/Validate-GPU.yml +++ b/.github/workflows/Validate-GPU.yml @@ -61,7 +61,7 @@ jobs: -v "/home/data/cfs/.ccache:/root/.ccache" \ -v "/dev/shm:/dev/shm" \ -v ${{ github.workspace }}/../../..:${{ github.workspace }}/../../.. \ - -v ${{ github.workspace }}:/graphnet \ + -v ${{ github.workspace }}:${{ github.workspace }} \ -e python \ -e core_index \ -e BRANCH \ @@ -73,7 +73,7 @@ jobs: -e CACHE_DIR \ -e GITHUB_API_TOKEN \ -e CFS_DIR \ - -w /graphnet --network host ${docker_image} + -w ${{ github.workspace }} --network host ${docker_image} - name: Run check env: diff --git a/graph_net/paddle/check_redundant_incrementally.py b/graph_net/paddle/check_redundant_incrementally.py index e22acc8859..12a68cb78b 100644 --- a/graph_net/paddle/check_redundant_incrementally.py +++ b/graph_net/paddle/check_redundant_incrementally.py @@ -46,11 +46,26 @@ def main(args): assert os.path.isdir( args.graph_net_samples_path ), f"args.graph_net_samples_path ({args.graph_net_samples_path}) is not a directory!" + + current_model_graph_hash_pathes = set() + if args.model_path: + assert os.path.isdir( + args.model_path + ), f"args.model_path {args.model_path} is not a directory!" + current_model_graph_hash_pathes = set( + graph_hash_path + for model_path in get_recursively_model_pathes(args.model_path) + for graph_hash_path in [f"{model_path}/graph_hash.txt"] + ) + find_redundant = False graph_hash2graph_net_model_path = {} for model_path in get_recursively_model_pathes(args.graph_net_samples_path): graph_hash_path = f"{model_path}/graph_hash.txt" - if os.path.isfile(graph_hash_path): + if ( + os.path.isfile(graph_hash_path) + and graph_hash_path not in current_model_graph_hash_pathes + ): graph_hash = open(graph_hash_path).read() if graph_hash not in graph_hash2graph_net_model_path.keys(): graph_hash2graph_net_model_path[graph_hash] = [graph_hash_path] @@ -60,29 +75,24 @@ def main(args): print( f"Totally {len(graph_hash2graph_net_model_path)} unique samples under {args.graph_net_samples_path}." ) - for graph_hash, graph_paths in graph_hash2graph_net_model_path.items(): - if len(graph_paths) > 1: - print(f"Redundant models detected for grap_hash {graph_hash}:") - for model_path in graph_paths: - print(f" {model_path}") - assert ( - not find_redundant - ), f"Redundant models detected under {args.graph_net_samples_path}." if args.model_path: - assert os.path.isdir( - args.model_path - ), f"args.model_path {args.model_path} is not a directory!" - current_model_graph_hash_pathes = set( - graph_hash_path - for model_path in get_recursively_model_pathes(args.model_path) - for graph_hash_path in [f"{model_path}/graph_hash.txt"] - ) + # Check whether the specified model is redundant. for current_model_graph_hash_path in current_model_graph_hash_pathes: graph_hash = open(current_model_graph_hash_path).read() assert ( graph_hash not in graph_hash2graph_net_model_path - ), f"Redundant models detected. old-model-path:{current_model_graph_hash_path}, new-model-path:{graph_hash2graph_net_model_path[graph_hash]}." + ), f"Redundant models detected.\n\tgraph_hash:{graph_hash}, newly-added-model-path:{current_model_graph_hash_path}, existing-model-path:{graph_hash2graph_net_model_path[graph_hash]}." + else: + # Check whether there are redundant samples under samples directory. + for graph_hash, graph_paths in graph_hash2graph_net_model_path.items(): + if len(graph_paths) > 1: + print(f"Redundant models detected for grap_hash {graph_hash}:") + for model_path in graph_paths: + print(f" {model_path}") + assert ( + not find_redundant + ), f"Redundant models detected under {args.graph_net_samples_path}." if __name__ == "__main__": diff --git a/graph_net/paddle/samples_util.py b/graph_net/paddle/samples_util.py index fd3e7ae256..62803cd08a 100644 --- a/graph_net/paddle/samples_util.py +++ b/graph_net/paddle/samples_util.py @@ -3,4 +3,5 @@ def get_default_samples_directory(): - return f"{os.path.dirname(graph_net.__file__)}/../paddle_samples" + graph_net_root = os.path.dirname(os.path.dirname(graph_net.__file__)) + return f"{graph_net_root}/paddle_samples" diff --git a/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/graph_hash.txt b/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/graph_hash.txt new file mode 100644 index 0000000000..f23445326e --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/graph_hash.txt @@ -0,0 +1 @@ +62cc3d05adaf6e4219e2b653fec24cce7290406e2f80064a1e914ebc82570775 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/graph_net.json b/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/graph_net.json similarity index 59% rename from paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/graph_net.json rename to paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/graph_net.json index e2c505372a..6d114f8734 100644 --- a/paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/graph_net.json +++ b/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/graph_net.json @@ -1,6 +1,6 @@ { "framework": "paddle", - "model_name": "ernie-search-base-dual-encoder-marco-en", + "model_name": "rocketqa-base-cross-encoder", "num_devices_required": 1, "num_nodes_required": 1 } \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/input_meta.py b/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/model.py b/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/model.py new file mode 100644 index 0000000000..304b0f9f08 --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/model.py @@ -0,0 +1,2702 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + parameter_72, + parameter_73, + parameter_74, + parameter_75, + parameter_76, + parameter_77, + parameter_78, + parameter_79, + parameter_80, + parameter_81, + parameter_82, + parameter_83, + parameter_84, + parameter_85, + parameter_86, + parameter_87, + parameter_88, + parameter_89, + parameter_90, + parameter_91, + parameter_92, + parameter_93, + parameter_94, + parameter_95, + parameter_96, + parameter_97, + parameter_98, + parameter_99, + parameter_100, + parameter_101, + parameter_102, + parameter_103, + parameter_104, + parameter_105, + parameter_106, + parameter_107, + parameter_108, + parameter_109, + parameter_110, + parameter_111, + parameter_112, + parameter_113, + parameter_114, + parameter_115, + parameter_116, + parameter_117, + parameter_118, + parameter_119, + parameter_120, + parameter_121, + parameter_122, + parameter_123, + parameter_124, + parameter_125, + parameter_126, + parameter_127, + parameter_128, + parameter_129, + parameter_130, + parameter_131, + parameter_132, + parameter_133, + parameter_134, + parameter_135, + parameter_136, + parameter_137, + parameter_138, + parameter_139, + parameter_140, + parameter_141, + parameter_142, + parameter_143, + parameter_144, + parameter_145, + parameter_146, + parameter_147, + parameter_148, + parameter_149, + parameter_150, + parameter_151, + parameter_152, + parameter_153, + parameter_154, + parameter_155, + parameter_156, + parameter_157, + parameter_158, + parameter_159, + parameter_160, + parameter_161, + parameter_162, + parameter_163, + parameter_164, + parameter_165, + parameter_166, + parameter_167, + parameter_168, + parameter_169, + parameter_170, + parameter_171, + parameter_172, + parameter_173, + parameter_174, + parameter_175, + parameter_176, + parameter_177, + parameter_178, + parameter_179, + parameter_180, + parameter_181, + parameter_182, + parameter_183, + parameter_184, + parameter_185, + parameter_186, + parameter_187, + parameter_188, + parameter_189, + parameter_190, + parameter_191, + parameter_192, + parameter_193, + parameter_194, + parameter_195, + parameter_196, + parameter_197, + parameter_198, + parameter_199, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 40000x768xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_199, 0, False) + del data_0, parameter_199 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0 + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 2048x768xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_198, -1, False) + del parameter_198 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 4x768xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_197, -1, False) + del data_1, parameter_197 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xi64) <- (1x21xi64, 1xf32) + scale_1 = paddle._C_ops.scale(full_2, full_4, float("0"), True) + del full_2, full_4 + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 3x768xf32) + embedding_3 = paddle._C_ops.embedding(scale_1, parameter_196, -1, False) + del parameter_196 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_2 = paddle._C_ops.add(add_1, embedding_3) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_2, parameter_195, parameter_194, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_194, parameter_195 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_15 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_16 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_17 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_18 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_19 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_20 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_21 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_22 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_23 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_24 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_25 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_26 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_27 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_28 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_29 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_30 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_31 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_32 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_33 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_34 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_35 = full_5 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_193, False, False) + del parameter_193 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_3 = paddle._C_ops.add(matmul_0, parameter_192) + del parameter_192 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 64] + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_191, False, False) + del parameter_191 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_4 = paddle._C_ops.add(matmul_1, parameter_190) + del parameter_190 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_189, False, False) + del parameter_189 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_5 = paddle._C_ops.add(matmul_2, parameter_188) + del parameter_188 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_5, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_6 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_36 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_37 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_38 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_39 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_40 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_41 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_42 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_43 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_44 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_45 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_46 = full_6 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_0, full_6, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_2, transpose_1, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_6 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_6, -1) + del add_6 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 768] + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_187, False, False) + del parameter_187 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_7 = paddle._C_ops.add(matmul_5, parameter_186) + del parameter_186 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_7, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_7 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_8 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_8, parameter_181, parameter_180, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_180, parameter_181 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_185, False, False) + del parameter_185 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_9 = paddle._C_ops.add(matmul_6, parameter_184) + del parameter_184 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_0 = paddle._C_ops.gelu(add_9, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_183, False, False) + del parameter_183 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_10 = paddle._C_ops.add(matmul_7, parameter_182) + del parameter_182 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_10, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_10 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_11 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_11, parameter_179, parameter_178, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_178, parameter_179 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_177, False, False) + del parameter_177 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_12 = paddle._C_ops.add(matmul_8, parameter_176) + del parameter_176 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_175, False, False) + del parameter_175 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_13 = paddle._C_ops.add(matmul_9, parameter_174) + del parameter_174 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_173, False, False) + del parameter_173 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_14 = paddle._C_ops.add(matmul_10, parameter_172) + del parameter_172 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_14, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_4, full_6, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_3, transpose_5, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_15 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_15, -1) + del add_15 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_171, False, False) + del parameter_171 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_16 = paddle._C_ops.add(matmul_13, parameter_170) + del parameter_170 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_16, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_16 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_17 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_17, parameter_165, parameter_164, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_164, parameter_165 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_169, False, False) + del parameter_169 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_18 = paddle._C_ops.add(matmul_14, parameter_168) + del parameter_168 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_1 = paddle._C_ops.gelu(add_18, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_167, False, False) + del parameter_167 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_19 = paddle._C_ops.add(matmul_15, parameter_166) + del parameter_166 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_19, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_19 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_20 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_20, parameter_163, parameter_162, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_162, parameter_163 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_161, False, False) + del parameter_161 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_21 = paddle._C_ops.add(matmul_16, parameter_160) + del parameter_160 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_159, False, False) + del parameter_159 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_22 = paddle._C_ops.add(matmul_17, parameter_158) + del parameter_158 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_157, False, False) + del parameter_157 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_23 = paddle._C_ops.add(matmul_18, parameter_156) + del parameter_156 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_23, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_8, full_6, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_4, transpose_9, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_24 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_24, -1) + del add_24 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_155, False, False) + del parameter_155 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_25 = paddle._C_ops.add(matmul_21, parameter_154) + del parameter_154 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_25, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_25 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_26 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_26, parameter_149, parameter_148, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_148, parameter_149 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_153, False, False) + del parameter_153 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_27 = paddle._C_ops.add(matmul_22, parameter_152) + del parameter_152 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_2 = paddle._C_ops.gelu(add_27, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_151, False, False) + del parameter_151 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_28 = paddle._C_ops.add(matmul_23, parameter_150) + del parameter_150 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_28, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_28 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_29 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_29, parameter_147, parameter_146, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_146, parameter_147 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_145, False, False) + del parameter_145 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_30 = paddle._C_ops.add(matmul_24, parameter_144) + del parameter_144 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_143, False, False) + del parameter_143 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_31 = paddle._C_ops.add(matmul_25, parameter_142) + del parameter_142 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_141, False, False) + del parameter_141 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_32 = paddle._C_ops.add(matmul_26, parameter_140) + del parameter_140 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_32, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_12, full_6, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_27 = paddle._C_ops.matmul(scale_5, transpose_13, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_33 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_33, -1) + del add_33 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_139, False, False) + del parameter_139 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_34 = paddle._C_ops.add(matmul_29, parameter_138) + del parameter_138 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_34, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_34 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_35 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_35, parameter_133, parameter_132, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_132, parameter_133 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_137, False, False) + del parameter_137 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_36 = paddle._C_ops.add(matmul_30, parameter_136) + del parameter_136 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_3 = paddle._C_ops.gelu(add_36, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_135, False, False) + del parameter_135 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_37 = paddle._C_ops.add(matmul_31, parameter_134) + del parameter_134 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_37, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_37 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_38 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_38, parameter_131, parameter_130, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_130, parameter_131 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_32 = paddle._C_ops.matmul(layer_norm_24, parameter_129, False, False) + del parameter_129 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_39 = paddle._C_ops.add(matmul_32, parameter_128) + del parameter_128 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_16 = paddle._C_ops.reshape(add_39, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_16 = paddle._C_ops.transpose(reshape_16, [0, 2, 1, 3]) + del reshape_16 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_33 = paddle._C_ops.matmul(layer_norm_24, parameter_127, False, False) + del parameter_127 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_40 = paddle._C_ops.add(matmul_33, parameter_126) + del parameter_126 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_34 = paddle._C_ops.matmul(layer_norm_24, parameter_125, False, False) + del parameter_125 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_41 = paddle._C_ops.add(matmul_34, parameter_124) + del parameter_124 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_17 = paddle._C_ops.reshape(add_40, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_17 = paddle._C_ops.transpose(reshape_17, [0, 2, 1, 3]) + del reshape_17 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_18 = paddle._C_ops.reshape(add_41, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_18 = paddle._C_ops.transpose(reshape_18, [0, 2, 1, 3]) + del reshape_18 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_6 = paddle._C_ops.scale(transpose_16, full_6, float("0"), True) + del transpose_16 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_35 = paddle._C_ops.matmul(scale_6, transpose_17, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_42 = paddle._C_ops.add(matmul_35, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_4 = paddle._C_ops.softmax(add_42, -1) + del add_42 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_26, dropout_27 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_4, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_36 = paddle._C_ops.matmul(dropout_26, transpose_18, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_19 = paddle._C_ops.transpose(matmul_36, [0, 2, 1, 3]) + del matmul_36 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_19 = paddle._C_ops.reshape(transpose_19, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_37 = paddle._C_ops.matmul(reshape_19, parameter_123, False, False) + del parameter_123 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_43 = paddle._C_ops.add(matmul_37, parameter_122) + del parameter_122 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_28, dropout_29 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_43, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_43 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_44 = paddle._C_ops.add(layer_norm_24, dropout_28) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_27, layer_norm_28, layer_norm_29 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_44, parameter_117, parameter_116, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_116, parameter_117 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_38 = paddle._C_ops.matmul(layer_norm_27, parameter_121, False, False) + del parameter_121 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_45 = paddle._C_ops.add(matmul_38, parameter_120) + del parameter_120 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_4 = paddle._C_ops.gelu(add_45, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_39 = paddle._C_ops.matmul(gelu_4, parameter_119, False, False) + del parameter_119 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_46 = paddle._C_ops.add(matmul_39, parameter_118) + del parameter_118 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_30, dropout_31 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_46, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_46 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_47 = paddle._C_ops.add(layer_norm_27, dropout_30) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_30, layer_norm_31, layer_norm_32 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_47, parameter_115, parameter_114, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_114, parameter_115 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_40 = paddle._C_ops.matmul(layer_norm_30, parameter_113, False, False) + del parameter_113 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_48 = paddle._C_ops.add(matmul_40, parameter_112) + del parameter_112 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_20 = paddle._C_ops.reshape(add_48, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_20 = paddle._C_ops.transpose(reshape_20, [0, 2, 1, 3]) + del reshape_20 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_41 = paddle._C_ops.matmul(layer_norm_30, parameter_111, False, False) + del parameter_111 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_49 = paddle._C_ops.add(matmul_41, parameter_110) + del parameter_110 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_42 = paddle._C_ops.matmul(layer_norm_30, parameter_109, False, False) + del parameter_109 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_50 = paddle._C_ops.add(matmul_42, parameter_108) + del parameter_108 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_21 = paddle._C_ops.reshape(add_49, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_21 = paddle._C_ops.transpose(reshape_21, [0, 2, 1, 3]) + del reshape_21 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_22 = paddle._C_ops.reshape(add_50, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_22 = paddle._C_ops.transpose(reshape_22, [0, 2, 1, 3]) + del reshape_22 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_7 = paddle._C_ops.scale(transpose_20, full_6, float("0"), True) + del transpose_20 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_43 = paddle._C_ops.matmul(scale_7, transpose_21, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_51 = paddle._C_ops.add(matmul_43, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_5 = paddle._C_ops.softmax(add_51, -1) + del add_51 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_32, dropout_33 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_5, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_44 = paddle._C_ops.matmul(dropout_32, transpose_22, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_23 = paddle._C_ops.transpose(matmul_44, [0, 2, 1, 3]) + del matmul_44 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_23 = paddle._C_ops.reshape(transpose_23, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_45 = paddle._C_ops.matmul(reshape_23, parameter_107, False, False) + del parameter_107 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_52 = paddle._C_ops.add(matmul_45, parameter_106) + del parameter_106 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_34, dropout_35 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_52, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_52 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_53 = paddle._C_ops.add(layer_norm_30, dropout_34) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_33, layer_norm_34, layer_norm_35 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_53, parameter_101, parameter_100, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_100, parameter_101 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_46 = paddle._C_ops.matmul(layer_norm_33, parameter_105, False, False) + del parameter_105 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_54 = paddle._C_ops.add(matmul_46, parameter_104) + del parameter_104 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_5 = paddle._C_ops.gelu(add_54, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_47 = paddle._C_ops.matmul(gelu_5, parameter_103, False, False) + del parameter_103 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_55 = paddle._C_ops.add(matmul_47, parameter_102) + del parameter_102 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_36, dropout_37 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_55, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_55 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_56 = paddle._C_ops.add(layer_norm_33, dropout_36) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_36, layer_norm_37, layer_norm_38 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_56, parameter_99, parameter_98, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_98, parameter_99 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_48 = paddle._C_ops.matmul(layer_norm_36, parameter_97, False, False) + del parameter_97 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_57 = paddle._C_ops.add(matmul_48, parameter_96) + del parameter_96 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_24 = paddle._C_ops.reshape(add_57, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_24 = paddle._C_ops.transpose(reshape_24, [0, 2, 1, 3]) + del reshape_24 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_49 = paddle._C_ops.matmul(layer_norm_36, parameter_95, False, False) + del parameter_95 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_58 = paddle._C_ops.add(matmul_49, parameter_94) + del parameter_94 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_50 = paddle._C_ops.matmul(layer_norm_36, parameter_93, False, False) + del parameter_93 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_59 = paddle._C_ops.add(matmul_50, parameter_92) + del parameter_92 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_25 = paddle._C_ops.reshape(add_58, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_25 = paddle._C_ops.transpose(reshape_25, [0, 2, 1, 3]) + del reshape_25 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_26 = paddle._C_ops.reshape(add_59, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_26 = paddle._C_ops.transpose(reshape_26, [0, 2, 1, 3]) + del reshape_26 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_8 = paddle._C_ops.scale(transpose_24, full_6, float("0"), True) + del transpose_24 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_51 = paddle._C_ops.matmul(scale_8, transpose_25, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_60 = paddle._C_ops.add(matmul_51, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_6 = paddle._C_ops.softmax(add_60, -1) + del add_60 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_38, dropout_39 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_6, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_52 = paddle._C_ops.matmul(dropout_38, transpose_26, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_27 = paddle._C_ops.transpose(matmul_52, [0, 2, 1, 3]) + del matmul_52 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_27 = paddle._C_ops.reshape(transpose_27, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_53 = paddle._C_ops.matmul(reshape_27, parameter_91, False, False) + del parameter_91 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_61 = paddle._C_ops.add(matmul_53, parameter_90) + del parameter_90 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_40, dropout_41 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_61, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_61 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_62 = paddle._C_ops.add(layer_norm_36, dropout_40) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_39, layer_norm_40, layer_norm_41 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_62, parameter_85, parameter_84, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_84, parameter_85 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_54 = paddle._C_ops.matmul(layer_norm_39, parameter_89, False, False) + del parameter_89 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_63 = paddle._C_ops.add(matmul_54, parameter_88) + del parameter_88 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_6 = paddle._C_ops.gelu(add_63, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_55 = paddle._C_ops.matmul(gelu_6, parameter_87, False, False) + del parameter_87 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_64 = paddle._C_ops.add(matmul_55, parameter_86) + del parameter_86 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_42, dropout_43 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_64, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_64 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_65 = paddle._C_ops.add(layer_norm_39, dropout_42) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_42, layer_norm_43, layer_norm_44 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_65, parameter_83, parameter_82, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_82, parameter_83 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_56 = paddle._C_ops.matmul(layer_norm_42, parameter_81, False, False) + del parameter_81 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_66 = paddle._C_ops.add(matmul_56, parameter_80) + del parameter_80 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_28 = paddle._C_ops.reshape(add_66, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_28 = paddle._C_ops.transpose(reshape_28, [0, 2, 1, 3]) + del reshape_28 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_57 = paddle._C_ops.matmul(layer_norm_42, parameter_79, False, False) + del parameter_79 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_67 = paddle._C_ops.add(matmul_57, parameter_78) + del parameter_78 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_58 = paddle._C_ops.matmul(layer_norm_42, parameter_77, False, False) + del parameter_77 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_68 = paddle._C_ops.add(matmul_58, parameter_76) + del parameter_76 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_29 = paddle._C_ops.reshape(add_67, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_29 = paddle._C_ops.transpose(reshape_29, [0, 2, 1, 3]) + del reshape_29 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_30 = paddle._C_ops.reshape(add_68, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_30 = paddle._C_ops.transpose(reshape_30, [0, 2, 1, 3]) + del reshape_30 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_9 = paddle._C_ops.scale(transpose_28, full_6, float("0"), True) + del transpose_28 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_59 = paddle._C_ops.matmul(scale_9, transpose_29, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_69 = paddle._C_ops.add(matmul_59, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_7 = paddle._C_ops.softmax(add_69, -1) + del add_69 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_44, dropout_45 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_7, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_60 = paddle._C_ops.matmul(dropout_44, transpose_30, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_31 = paddle._C_ops.transpose(matmul_60, [0, 2, 1, 3]) + del matmul_60 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_31 = paddle._C_ops.reshape(transpose_31, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_61 = paddle._C_ops.matmul(reshape_31, parameter_75, False, False) + del parameter_75 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_70 = paddle._C_ops.add(matmul_61, parameter_74) + del parameter_74 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_46, dropout_47 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_70, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_70 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_71 = paddle._C_ops.add(layer_norm_42, dropout_46) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_45, layer_norm_46, layer_norm_47 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_71, parameter_69, parameter_68, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_68, parameter_69 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_62 = paddle._C_ops.matmul(layer_norm_45, parameter_73, False, False) + del parameter_73 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_72 = paddle._C_ops.add(matmul_62, parameter_72) + del parameter_72 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_7 = paddle._C_ops.gelu(add_72, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_63 = paddle._C_ops.matmul(gelu_7, parameter_71, False, False) + del parameter_71 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_73 = paddle._C_ops.add(matmul_63, parameter_70) + del parameter_70 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_48, dropout_49 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_73, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_73 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_74 = paddle._C_ops.add(layer_norm_45, dropout_48) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_48, layer_norm_49, layer_norm_50 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_74, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_64 = paddle._C_ops.matmul(layer_norm_48, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_75 = paddle._C_ops.add(matmul_64, parameter_64) + del parameter_64 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_32 = paddle._C_ops.reshape(add_75, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_32 = paddle._C_ops.transpose(reshape_32, [0, 2, 1, 3]) + del reshape_32 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_65 = paddle._C_ops.matmul(layer_norm_48, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_76 = paddle._C_ops.add(matmul_65, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_66 = paddle._C_ops.matmul(layer_norm_48, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_77 = paddle._C_ops.add(matmul_66, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_33 = paddle._C_ops.reshape(add_76, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_33 = paddle._C_ops.transpose(reshape_33, [0, 2, 1, 3]) + del reshape_33 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_34 = paddle._C_ops.reshape(add_77, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_34 = paddle._C_ops.transpose(reshape_34, [0, 2, 1, 3]) + del reshape_34 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_10 = paddle._C_ops.scale(transpose_32, full_6, float("0"), True) + del transpose_32 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_67 = paddle._C_ops.matmul(scale_10, transpose_33, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_78 = paddle._C_ops.add(matmul_67, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_8 = paddle._C_ops.softmax(add_78, -1) + del add_78 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_50, dropout_51 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_8, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_68 = paddle._C_ops.matmul(dropout_50, transpose_34, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_35 = paddle._C_ops.transpose(matmul_68, [0, 2, 1, 3]) + del matmul_68 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_35 = paddle._C_ops.reshape(transpose_35, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_69 = paddle._C_ops.matmul(reshape_35, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_79 = paddle._C_ops.add(matmul_69, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_52, dropout_53 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_79, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_79 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_80 = paddle._C_ops.add(layer_norm_48, dropout_52) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_51, layer_norm_52, layer_norm_53 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_80, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_70 = paddle._C_ops.matmul(layer_norm_51, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_81 = paddle._C_ops.add(matmul_70, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_8 = paddle._C_ops.gelu(add_81, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_71 = paddle._C_ops.matmul(gelu_8, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_82 = paddle._C_ops.add(matmul_71, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_54, dropout_55 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_82, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_82 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_83 = paddle._C_ops.add(layer_norm_51, dropout_54) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_54, layer_norm_55, layer_norm_56 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_83, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_72 = paddle._C_ops.matmul(layer_norm_54, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_84 = paddle._C_ops.add(matmul_72, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_36 = paddle._C_ops.reshape(add_84, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_36 = paddle._C_ops.transpose(reshape_36, [0, 2, 1, 3]) + del reshape_36 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_73 = paddle._C_ops.matmul(layer_norm_54, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_85 = paddle._C_ops.add(matmul_73, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_74 = paddle._C_ops.matmul(layer_norm_54, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_86 = paddle._C_ops.add(matmul_74, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_37 = paddle._C_ops.reshape(add_85, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_37 = paddle._C_ops.transpose(reshape_37, [0, 2, 1, 3]) + del reshape_37 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_38 = paddle._C_ops.reshape(add_86, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_38 = paddle._C_ops.transpose(reshape_38, [0, 2, 1, 3]) + del reshape_38 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_11 = paddle._C_ops.scale(transpose_36, full_6, float("0"), True) + del transpose_36 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_75 = paddle._C_ops.matmul(scale_11, transpose_37, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_87 = paddle._C_ops.add(matmul_75, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_9 = paddle._C_ops.softmax(add_87, -1) + del add_87 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_56, dropout_57 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_9, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_76 = paddle._C_ops.matmul(dropout_56, transpose_38, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_39 = paddle._C_ops.transpose(matmul_76, [0, 2, 1, 3]) + del matmul_76 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_39 = paddle._C_ops.reshape(transpose_39, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_77 = paddle._C_ops.matmul(reshape_39, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_88 = paddle._C_ops.add(matmul_77, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_58, dropout_59 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_88, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_88 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_89 = paddle._C_ops.add(layer_norm_54, dropout_58) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_57, layer_norm_58, layer_norm_59 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_89, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_78 = paddle._C_ops.matmul(layer_norm_57, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_90 = paddle._C_ops.add(matmul_78, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_9 = paddle._C_ops.gelu(add_90, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_79 = paddle._C_ops.matmul(gelu_9, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_91 = paddle._C_ops.add(matmul_79, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_60, dropout_61 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_91, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_91 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_92 = paddle._C_ops.add(layer_norm_57, dropout_60) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_60, layer_norm_61, layer_norm_62 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_92, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_80 = paddle._C_ops.matmul(layer_norm_60, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_93 = paddle._C_ops.add(matmul_80, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_40 = paddle._C_ops.reshape(add_93, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_40 = paddle._C_ops.transpose(reshape_40, [0, 2, 1, 3]) + del reshape_40 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_81 = paddle._C_ops.matmul(layer_norm_60, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_94 = paddle._C_ops.add(matmul_81, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_82 = paddle._C_ops.matmul(layer_norm_60, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_95 = paddle._C_ops.add(matmul_82, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_41 = paddle._C_ops.reshape(add_94, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_41 = paddle._C_ops.transpose(reshape_41, [0, 2, 1, 3]) + del reshape_41 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_42 = paddle._C_ops.reshape(add_95, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_42 = paddle._C_ops.transpose(reshape_42, [0, 2, 1, 3]) + del reshape_42 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_12 = paddle._C_ops.scale(transpose_40, full_6, float("0"), True) + del transpose_40 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_83 = paddle._C_ops.matmul(scale_12, transpose_41, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_96 = paddle._C_ops.add(matmul_83, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_10 = paddle._C_ops.softmax(add_96, -1) + del add_96 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_62, dropout_63 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_10, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_84 = paddle._C_ops.matmul(dropout_62, transpose_42, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_43 = paddle._C_ops.transpose(matmul_84, [0, 2, 1, 3]) + del matmul_84 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_43 = paddle._C_ops.reshape(transpose_43, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_85 = paddle._C_ops.matmul(reshape_43, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_97 = paddle._C_ops.add(matmul_85, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_64, dropout_65 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_97, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_97 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_98 = paddle._C_ops.add(layer_norm_60, dropout_64) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_63, layer_norm_64, layer_norm_65 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_98, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_86 = paddle._C_ops.matmul(layer_norm_63, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_99 = paddle._C_ops.add(matmul_86, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_10 = paddle._C_ops.gelu(add_99, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_87 = paddle._C_ops.matmul(gelu_10, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_100 = paddle._C_ops.add(matmul_87, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_66, dropout_67 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_100, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_100 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_101 = paddle._C_ops.add(layer_norm_63, dropout_66) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_66, layer_norm_67, layer_norm_68 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_101, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_88 = paddle._C_ops.matmul(layer_norm_66, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_102 = paddle._C_ops.add(matmul_88, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_44 = paddle._C_ops.reshape(add_102, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_44 = paddle._C_ops.transpose(reshape_44, [0, 2, 1, 3]) + del reshape_44 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_89 = paddle._C_ops.matmul(layer_norm_66, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_103 = paddle._C_ops.add(matmul_89, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_90 = paddle._C_ops.matmul(layer_norm_66, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_104 = paddle._C_ops.add(matmul_90, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_45 = paddle._C_ops.reshape(add_103, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_45 = paddle._C_ops.transpose(reshape_45, [0, 2, 1, 3]) + del reshape_45 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_46 = paddle._C_ops.reshape(add_104, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_46 = paddle._C_ops.transpose(reshape_46, [0, 2, 1, 3]) + del reshape_46 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_13 = paddle._C_ops.scale(transpose_44, full_6, float("0"), True) + del transpose_44 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_91 = paddle._C_ops.matmul(scale_13, transpose_45, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_105 = paddle._C_ops.add(matmul_91, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_11 = paddle._C_ops.softmax(add_105, -1) + del add_105 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_68, dropout_69 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_11, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_92 = paddle._C_ops.matmul(dropout_68, transpose_46, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_47 = paddle._C_ops.transpose(matmul_92, [0, 2, 1, 3]) + del matmul_92 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_47 = paddle._C_ops.reshape(transpose_47, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_93 = paddle._C_ops.matmul(reshape_47, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_106 = paddle._C_ops.add(matmul_93, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_70, dropout_71 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_106, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_106 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_107 = paddle._C_ops.add(layer_norm_66, dropout_70) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_69, layer_norm_70, layer_norm_71 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_107, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_94 = paddle._C_ops.matmul(layer_norm_69, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_108 = paddle._C_ops.add(matmul_94, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_11 = paddle._C_ops.gelu(add_108, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_95 = paddle._C_ops.matmul(gelu_11, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_109 = paddle._C_ops.add(matmul_95, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_72, dropout_73 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_109, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_109 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_110 = paddle._C_ops.add(layer_norm_69, dropout_72) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_72, layer_norm_73, layer_norm_74 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_110, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x768xf32) <- (1x21x768xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_72, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x768xf32) <- (1x768xf32, 768x768xf32) + matmul_96 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x768xf32) <- (1x768xf32, 768xf32) + add_111 = paddle._C_ops.add(matmul_96, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x768xf32) <- (1x768xf32) + tanh_0 = paddle._C_ops.tanh(add_111) + del ( + add_0, + add_1, + add_101, + add_102, + add_103, + add_104, + add_107, + add_108, + add_11, + add_110, + add_111, + add_12, + add_13, + add_14, + add_17, + add_18, + add_2, + add_20, + add_21, + add_22, + add_23, + add_26, + add_27, + add_29, + add_3, + add_30, + add_31, + add_32, + add_35, + add_36, + add_38, + add_39, + add_4, + add_40, + add_41, + add_44, + add_45, + add_47, + add_48, + add_49, + add_5, + add_50, + add_53, + add_54, + add_56, + add_57, + add_58, + add_59, + add_62, + add_63, + add_65, + add_66, + add_67, + add_68, + add_71, + add_72, + add_74, + add_75, + add_76, + add_77, + add_8, + add_80, + add_81, + add_83, + add_84, + add_85, + add_86, + add_89, + add_9, + add_90, + add_92, + add_93, + add_94, + add_95, + add_98, + add_99, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_15, + assign_16, + assign_17, + assign_18, + assign_19, + assign_2, + assign_20, + assign_21, + assign_22, + assign_23, + assign_24, + assign_25, + assign_26, + assign_27, + assign_28, + assign_29, + assign_3, + assign_30, + assign_31, + assign_32, + assign_33, + assign_34, + assign_35, + assign_36, + assign_37, + assign_38, + assign_39, + assign_4, + assign_40, + assign_41, + assign_42, + assign_43, + assign_44, + assign_45, + assign_46, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_26, + dropout_27, + dropout_28, + dropout_29, + dropout_3, + dropout_30, + dropout_31, + dropout_32, + dropout_33, + dropout_34, + dropout_35, + dropout_36, + dropout_37, + dropout_38, + dropout_39, + dropout_4, + dropout_40, + dropout_41, + dropout_42, + dropout_43, + dropout_44, + dropout_45, + dropout_46, + dropout_47, + dropout_48, + dropout_49, + dropout_5, + dropout_50, + dropout_51, + dropout_52, + dropout_53, + dropout_54, + dropout_55, + dropout_56, + dropout_57, + dropout_58, + dropout_59, + dropout_6, + dropout_60, + dropout_61, + dropout_62, + dropout_63, + dropout_64, + dropout_65, + dropout_66, + dropout_67, + dropout_68, + dropout_69, + dropout_7, + dropout_70, + dropout_71, + dropout_72, + dropout_73, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + embedding_3, + full_5, + full_6, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_10, + gelu_11, + gelu_2, + gelu_3, + gelu_4, + gelu_5, + gelu_6, + gelu_7, + gelu_8, + gelu_9, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_27, + layer_norm_28, + layer_norm_29, + layer_norm_3, + layer_norm_30, + layer_norm_31, + layer_norm_32, + layer_norm_33, + layer_norm_34, + layer_norm_35, + layer_norm_36, + layer_norm_37, + layer_norm_38, + layer_norm_39, + layer_norm_4, + layer_norm_40, + layer_norm_41, + layer_norm_42, + layer_norm_43, + layer_norm_44, + layer_norm_45, + layer_norm_46, + layer_norm_47, + layer_norm_48, + layer_norm_49, + layer_norm_5, + layer_norm_50, + layer_norm_51, + layer_norm_52, + layer_norm_53, + layer_norm_54, + layer_norm_55, + layer_norm_56, + layer_norm_57, + layer_norm_58, + layer_norm_59, + layer_norm_6, + layer_norm_60, + layer_norm_61, + layer_norm_62, + layer_norm_63, + layer_norm_64, + layer_norm_65, + layer_norm_66, + layer_norm_67, + layer_norm_68, + layer_norm_69, + layer_norm_7, + layer_norm_70, + layer_norm_71, + layer_norm_72, + layer_norm_73, + layer_norm_74, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_33, + matmul_34, + matmul_35, + matmul_37, + matmul_38, + matmul_39, + matmul_40, + matmul_41, + matmul_42, + matmul_43, + matmul_45, + matmul_46, + matmul_47, + matmul_48, + matmul_49, + matmul_5, + matmul_50, + matmul_51, + matmul_53, + matmul_54, + matmul_55, + matmul_56, + matmul_57, + matmul_58, + matmul_59, + matmul_6, + matmul_61, + matmul_62, + matmul_63, + matmul_64, + matmul_65, + matmul_66, + matmul_67, + matmul_69, + matmul_7, + matmul_70, + matmul_71, + matmul_72, + matmul_73, + matmul_74, + matmul_75, + matmul_77, + matmul_78, + matmul_79, + matmul_8, + matmul_80, + matmul_81, + matmul_82, + matmul_83, + matmul_85, + matmul_86, + matmul_87, + matmul_88, + matmul_89, + matmul_9, + matmul_90, + matmul_91, + matmul_93, + matmul_94, + matmul_95, + matmul_96, + reshape_11, + reshape_15, + reshape_19, + reshape_23, + reshape_27, + reshape_3, + reshape_31, + reshape_35, + reshape_39, + reshape_43, + reshape_47, + reshape_7, + scale_1, + scale_10, + scale_11, + scale_12, + scale_13, + scale_2, + scale_3, + scale_4, + scale_5, + scale_6, + scale_7, + scale_8, + scale_9, + slice_0, + softmax_0, + softmax_1, + softmax_10, + softmax_11, + softmax_2, + softmax_3, + softmax_4, + softmax_5, + softmax_6, + softmax_7, + softmax_8, + softmax_9, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_17, + transpose_18, + transpose_19, + transpose_2, + transpose_21, + transpose_22, + transpose_23, + transpose_25, + transpose_26, + transpose_27, + transpose_29, + transpose_3, + transpose_30, + transpose_31, + transpose_33, + transpose_34, + transpose_35, + transpose_37, + transpose_38, + transpose_39, + transpose_41, + transpose_42, + transpose_43, + transpose_45, + transpose_46, + transpose_47, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/weight_meta.py b/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/weight_meta.py new file mode 100644 index 0000000000..cde86f006b --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-base-cross-encoder/weight_meta.py @@ -0,0 +1,2198 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [768] + dtype = "float32" + min_val = float("-0.498809") + max_val = float("0.529989") + mean = float("-0.00133518") + std = float("0.160761") + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.326919") + max_val = float("0.294234") + mean = float("5.05647e-05") + std = float("0.0448247") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [768] + dtype = "float32" + min_val = float("-0.864449") + max_val = float("0.640366") + mean = float("-0.0373506") + std = float("0.10686") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [768] + dtype = "float32" + min_val = float("0.0875785") + max_val = float("1.93862") + mean = float("0.604221") + std = float("0.063694") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [768] + dtype = "float32" + min_val = float("-2.51454") + max_val = float("1.81759") + mean = float("-0.11534") + std = float("0.251059") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [768] + dtype = "float32" + min_val = float("0.124387") + max_val = float("2.59652") + mean = float("0.777907") + std = float("0.0892859") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [768] + dtype = "float32" + min_val = float("-1.63076") + max_val = float("0.757834") + mean = float("-0.000158779") + std = float("0.0790098") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.39947") + max_val = float("1.424") + mean = float("-1.61249e-05") + std = float("0.0472384") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [3072] + dtype = "float32" + min_val = float("-2.39579") + max_val = float("2.59828") + mean = float("-0.417782") + std = float("0.152046") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.607481") + max_val = float("0.649162") + mean = float("0.00833299") + std = float("0.0451148") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [768] + dtype = "float32" + min_val = float("-0.814027") + max_val = float("0.984812") + mean = float("0.000239863") + std = float("0.0917169") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.648169") + max_val = float("0.599307") + mean = float("3.29292e-06") + std = float("0.0499954") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [768] + dtype = "float32" + min_val = float("-0.811642") + max_val = float("0.964016") + mean = float("-0.00387168") + std = float("0.0792629") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.309619") + max_val = float("0.286244") + mean = float("-0.000120837") + std = float("0.0516874") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [768] + dtype = "float32" + min_val = float("-16.6109") + max_val = float("18.0677") + mean = float("-0.0514037") + std = float("6.25742") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.653577") + max_val = float("0.628385") + mean = float("9.53645e-05") + std = float("0.0516992") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [768] + dtype = "float32" + min_val = float("-3.43004") + max_val = float("3.39487") + mean = float("-0.0286048") + std = float("0.663792") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.697174") + max_val = float("0.64535") + mean = float("-0.000238352") + std = float("0.0748584") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [768] + dtype = "float32" + min_val = float("-3.47037") + max_val = float("1.92448") + mean = float("0.0246899") + std = float("0.155811") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [768] + dtype = "float32" + min_val = float("0.181489") + max_val = float("1.13791") + mean = float("0.812679") + std = float("0.0560999") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [768] + dtype = "float32" + min_val = float("-5.16923") + max_val = float("4.3171") + mean = float("0.100522") + std = float("0.309091") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [768] + dtype = "float32" + min_val = float("0.504545") + max_val = float("4.88464") + mean = float("0.68447") + std = float("0.18186") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [768] + dtype = "float32" + min_val = float("-0.34357") + max_val = float("0.996831") + mean = float("-0.00102928") + std = float("0.11082") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [3072, 768] + dtype = "float32" + min_val = float("-0.961195") + max_val = float("18.8272") + mean = float("-2.34729e-05") + std = float("0.0597172") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [3072] + dtype = "float32" + min_val = float("-2.17209") + max_val = float("1.93559") + mean = float("-0.442169") + std = float("0.202348") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.599701") + max_val = float("0.879743") + mean = float("-0.00767005") + std = float("0.0558911") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [768] + dtype = "float32" + min_val = float("-0.245636") + max_val = float("0.667785") + mean = float("0.00237097") + std = float("0.0942634") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.891349") + max_val = float("0.414894") + mean = float("-2.65329e-05") + std = float("0.0479576") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [768] + dtype = "float32" + min_val = float("-0.52809") + max_val = float("0.648319") + mean = float("0.00266666") + std = float("0.0648004") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.357214") + max_val = float("0.417937") + mean = float("0.000160848") + std = float("0.0501684") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [768] + dtype = "float32" + min_val = float("-18.3291") + max_val = float("18.5567") + mean = float("0.086043") + std = float("6.10373") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.467078") + max_val = float("0.507912") + mean = float("4.73335e-05") + std = float("0.0493422") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [768] + dtype = "float32" + min_val = float("-3.22234") + max_val = float("3.56838") + mean = float("-0.013958") + std = float("0.717052") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.516459") + max_val = float("0.508948") + mean = float("-2.84788e-06") + std = float("0.0631866") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [768] + dtype = "float32" + min_val = float("-0.530428") + max_val = float("0.990381") + mean = float("0.0183905") + std = float("0.0720872") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [768] + dtype = "float32" + min_val = float("0.2322") + max_val = float("1.23525") + mean = float("0.789588") + std = float("0.0541433") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [768] + dtype = "float32" + min_val = float("-5.74524") + max_val = float("5.07603") + mean = float("-0.077632") + std = float("0.339038") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [768] + dtype = "float32" + min_val = float("0.476349") + max_val = float("5.53248") + mean = float("0.722309") + std = float("0.242756") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [768] + dtype = "float32" + min_val = float("-1.21435") + max_val = float("0.320804") + mean = float("0.000767181") + std = float("0.103605") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.2004") + max_val = float("11.7211") + mean = float("1.22341e-05") + std = float("0.0600477") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [3072] + dtype = "float32" + min_val = float("-1.41819") + max_val = float("0.913595") + mean = float("-0.467244") + std = float("0.210919") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.601805") + max_val = float("0.64437") + mean = float("0.00414202") + std = float("0.0630807") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [768] + dtype = "float32" + min_val = float("-0.24089") + max_val = float("0.654056") + mean = float("0.00266373") + std = float("0.0702406") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.810296") + max_val = float("0.369714") + mean = float("-4.57024e-06") + std = float("0.0480712") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [768] + dtype = "float32" + min_val = float("-0.80608") + max_val = float("0.844065") + mean = float("-0.00218272") + std = float("0.0852728") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.459053") + max_val = float("0.352588") + mean = float("-0.000109924") + std = float("0.050118") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [768] + dtype = "float32" + min_val = float("-16.4834") + max_val = float("19.435") + mean = float("0.0962191") + std = float("3.37836") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.457381") + max_val = float("0.480128") + mean = float("3.02755e-05") + std = float("0.0515477") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [768] + dtype = "float32" + min_val = float("-3.06178") + max_val = float("3.16688") + mean = float("0.00018534") + std = float("0.49707") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.415615") + max_val = float("0.425923") + mean = float("-4.09162e-05") + std = float("0.0527752") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [768] + dtype = "float32" + min_val = float("-0.694078") + max_val = float("1.01469") + mean = float("0.00713213") + std = float("0.0737661") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [768] + dtype = "float32" + min_val = float("0.117814") + max_val = float("1.18562") + mean = float("0.708566") + std = float("0.0608382") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [768] + dtype = "float32" + min_val = float("-8.1952") + max_val = float("2.3684") + mean = float("-0.1104") + std = float("0.386289") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [768] + dtype = "float32" + min_val = float("0.477142") + max_val = float("3.19566") + mean = float("0.722422") + std = float("0.18882") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [768] + dtype = "float32" + min_val = float("-0.707219") + max_val = float("1.25115") + mean = float("-0.00134272") + std = float("0.146371") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.91938") + max_val = float("6.13889") + mean = float("5.72174e-05") + std = float("0.0530655") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [3072] + dtype = "float32" + min_val = float("-1.41629") + max_val = float("0.966655") + mean = float("-0.394593") + std = float("0.210233") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.553806") + max_val = float("0.619816") + mean = float("0.00512627") + std = float("0.0550589") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [768] + dtype = "float32" + min_val = float("-0.158281") + max_val = float("0.20909") + mean = float("0.00119181") + std = float("0.05601") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.368402") + max_val = float("0.27789") + mean = float("3.97575e-06") + std = float("0.0472445") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [768] + dtype = "float32" + min_val = float("-0.523903") + max_val = float("0.63604") + mean = float("-0.000329432") + std = float("0.078657") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.314065") + max_val = float("0.432187") + mean = float("2.61098e-05") + std = float("0.0494714") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [768] + dtype = "float32" + min_val = float("-13.719") + max_val = float("11.6738") + mean = float("-0.0317891") + std = float("2.64589") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.5027") + max_val = float("0.515733") + mean = float("2.59349e-05") + std = float("0.0505375") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [768] + dtype = "float32" + min_val = float("-3.2073") + max_val = float("3.03859") + mean = float("-0.0102019") + std = float("0.538319") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.395813") + max_val = float("0.38353") + mean = float("-4.97498e-05") + std = float("0.0508043") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [768] + dtype = "float32" + min_val = float("-0.612544") + max_val = float("0.826748") + mean = float("0.0070068") + std = float("0.0696863") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [768] + dtype = "float32" + min_val = float("0.146122") + max_val = float("1.08587") + mean = float("0.687742") + std = float("0.05804") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [768] + dtype = "float32" + min_val = float("-7.49924") + max_val = float("1.16731") + mean = float("-0.118272") + std = float("0.410583") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [768] + dtype = "float32" + min_val = float("0.330849") + max_val = float("3.3336") + mean = float("0.74461") + std = float("0.183783") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [768] + dtype = "float32" + min_val = float("-0.67516") + max_val = float("1.97728") + mean = float("0.000833066") + std = float("0.14642") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.5706") + max_val = float("7.21425") + mean = float("3.91738e-05") + std = float("0.0530372") + data = None + + +class Program_weight_tensor_parameter_72: + name = "parameter_72" + shape = [3072] + dtype = "float32" + min_val = float("-1.52043") + max_val = float("0.734595") + mean = float("-0.390749") + std = float("0.220634") + data = None + + +class Program_weight_tensor_parameter_73: + name = "parameter_73" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.757403") + max_val = float("0.571811") + mean = float("0.00492373") + std = float("0.0551985") + data = None + + +class Program_weight_tensor_parameter_74: + name = "parameter_74" + shape = [768] + dtype = "float32" + min_val = float("-0.249734") + max_val = float("0.464575") + mean = float("0.0017768") + std = float("0.0647525") + data = None + + +class Program_weight_tensor_parameter_75: + name = "parameter_75" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.382012") + max_val = float("0.372439") + mean = float("-3.27277e-06") + std = float("0.0435873") + data = None + + +class Program_weight_tensor_parameter_76: + name = "parameter_76" + shape = [768] + dtype = "float32" + min_val = float("-0.666095") + max_val = float("0.639865") + mean = float("-0.00389303") + std = float("0.0798479") + data = None + + +class Program_weight_tensor_parameter_77: + name = "parameter_77" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.285693") + max_val = float("0.291348") + mean = float("-2.03281e-05") + std = float("0.0450996") + data = None + + +class Program_weight_tensor_parameter_78: + name = "parameter_78" + shape = [768] + dtype = "float32" + min_val = float("-8.67944") + max_val = float("9.52889") + mean = float("0.0123821") + std = float("1.7692") + data = None + + +class Program_weight_tensor_parameter_79: + name = "parameter_79" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.551004") + max_val = float("0.423689") + mean = float("-8.86332e-05") + std = float("0.0501593") + data = None + + +class Program_weight_tensor_parameter_80: + name = "parameter_80" + shape = [768] + dtype = "float32" + min_val = float("-2.53412") + max_val = float("3.48124") + mean = float("0.0260333") + std = float("0.536193") + data = None + + +class Program_weight_tensor_parameter_81: + name = "parameter_81" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.491208") + max_val = float("0.3544") + mean = float("0.000148719") + std = float("0.0505432") + data = None + + +class Program_weight_tensor_parameter_82: + name = "parameter_82" + shape = [768] + dtype = "float32" + min_val = float("-0.892455") + max_val = float("0.83075") + mean = float("0.000363566") + std = float("0.0818757") + data = None + + +class Program_weight_tensor_parameter_83: + name = "parameter_83" + shape = [768] + dtype = "float32" + min_val = float("0.11622") + max_val = float("0.993178") + mean = float("0.700329") + std = float("0.0595129") + data = None + + +class Program_weight_tensor_parameter_84: + name = "parameter_84" + shape = [768] + dtype = "float32" + min_val = float("-8.49308") + max_val = float("1.56932") + mean = float("-0.0751521") + std = float("0.493517") + data = None + + +class Program_weight_tensor_parameter_85: + name = "parameter_85" + shape = [768] + dtype = "float32" + min_val = float("0.325524") + max_val = float("3.67288") + mean = float("0.768776") + std = float("0.211564") + data = None + + +class Program_weight_tensor_parameter_86: + name = "parameter_86" + shape = [768] + dtype = "float32" + min_val = float("-0.497673") + max_val = float("2.28643") + mean = float("0.00242733") + std = float("0.163701") + data = None + + +class Program_weight_tensor_parameter_87: + name = "parameter_87" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.64564") + max_val = float("5.17097") + mean = float("4.12554e-05") + std = float("0.0561769") + data = None + + +class Program_weight_tensor_parameter_88: + name = "parameter_88" + shape = [3072] + dtype = "float32" + min_val = float("-1.22099") + max_val = float("0.693906") + mean = float("-0.389527") + std = float("0.208623") + data = None + + +class Program_weight_tensor_parameter_89: + name = "parameter_89" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.601596") + max_val = float("0.681287") + mean = float("0.00252792") + std = float("0.0590208") + data = None + + +class Program_weight_tensor_parameter_90: + name = "parameter_90" + shape = [768] + dtype = "float32" + min_val = float("-0.364153") + max_val = float("0.200234") + mean = float("0.00161359") + std = float("0.0553652") + data = None + + +class Program_weight_tensor_parameter_91: + name = "parameter_91" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.481266") + max_val = float("0.377629") + mean = float("-1.27678e-05") + std = float("0.0474548") + data = None + + +class Program_weight_tensor_parameter_92: + name = "parameter_92" + shape = [768] + dtype = "float32" + min_val = float("-0.456344") + max_val = float("0.313834") + mean = float("-0.00177746") + std = float("0.0588804") + data = None + + +class Program_weight_tensor_parameter_93: + name = "parameter_93" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.334676") + max_val = float("0.312024") + mean = float("-4.57859e-05") + std = float("0.0476924") + data = None + + +class Program_weight_tensor_parameter_94: + name = "parameter_94" + shape = [768] + dtype = "float32" + min_val = float("-5.33118") + max_val = float("5.0332") + mean = float("0.0297678") + std = float("1.00193") + data = None + + +class Program_weight_tensor_parameter_95: + name = "parameter_95" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.561344") + max_val = float("0.487565") + mean = float("-9.04451e-06") + std = float("0.050344") + data = None + + +class Program_weight_tensor_parameter_96: + name = "parameter_96" + shape = [768] + dtype = "float32" + min_val = float("-3.20684") + max_val = float("3.14062") + mean = float("0.00191771") + std = float("0.526424") + data = None + + +class Program_weight_tensor_parameter_97: + name = "parameter_97" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.617535") + max_val = float("0.641722") + mean = float("-1.40465e-05") + std = float("0.0505174") + data = None + + +class Program_weight_tensor_parameter_98: + name = "parameter_98" + shape = [768] + dtype = "float32" + min_val = float("-1.16303") + max_val = float("1.12786") + mean = float("-0.000496969") + std = float("0.0988284") + data = None + + +class Program_weight_tensor_parameter_99: + name = "parameter_99" + shape = [768] + dtype = "float32" + min_val = float("0.106") + max_val = float("0.993191") + mean = float("0.676127") + std = float("0.0553305") + data = None + + +class Program_weight_tensor_parameter_100: + name = "parameter_100" + shape = [768] + dtype = "float32" + min_val = float("-9.2892") + max_val = float("2.57065") + mean = float("-0.0363852") + std = float("0.491841") + data = None + + +class Program_weight_tensor_parameter_101: + name = "parameter_101" + shape = [768] + dtype = "float32" + min_val = float("0.0319994") + max_val = float("3.73824") + mean = float("0.824484") + std = float("0.185662") + data = None + + +class Program_weight_tensor_parameter_102: + name = "parameter_102" + shape = [768] + dtype = "float32" + min_val = float("-0.409938") + max_val = float("2.19987") + mean = float("0.00499118") + std = float("0.175293") + data = None + + +class Program_weight_tensor_parameter_103: + name = "parameter_103" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.45995") + max_val = float("3.99378") + mean = float("2.6637e-05") + std = float("0.0578139") + data = None + + +class Program_weight_tensor_parameter_104: + name = "parameter_104" + shape = [3072] + dtype = "float32" + min_val = float("-1.21247") + max_val = float("0.633941") + mean = float("-0.374279") + std = float("0.190494") + data = None + + +class Program_weight_tensor_parameter_105: + name = "parameter_105" + shape = [768, 3072] + dtype = "float32" + min_val = float("-1.13567") + max_val = float("1.36581") + mean = float("0.000741297") + std = float("0.0616246") + data = None + + +class Program_weight_tensor_parameter_106: + name = "parameter_106" + shape = [768] + dtype = "float32" + min_val = float("-0.224812") + max_val = float("0.530409") + mean = float("0.00299014") + std = float("0.051805") + data = None + + +class Program_weight_tensor_parameter_107: + name = "parameter_107" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.79954") + max_val = float("0.686796") + mean = float("-1.58384e-05") + std = float("0.0454382") + data = None + + +class Program_weight_tensor_parameter_108: + name = "parameter_108" + shape = [768] + dtype = "float32" + min_val = float("-0.504901") + max_val = float("0.335607") + mean = float("-0.00201196") + std = float("0.0590745") + data = None + + +class Program_weight_tensor_parameter_109: + name = "parameter_109" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.576404") + max_val = float("0.458567") + mean = float("2.47829e-05") + std = float("0.0458827") + data = None + + +class Program_weight_tensor_parameter_110: + name = "parameter_110" + shape = [768] + dtype = "float32" + min_val = float("-3.32848") + max_val = float("2.76932") + mean = float("-0.0124846") + std = float("0.78058") + data = None + + +class Program_weight_tensor_parameter_111: + name = "parameter_111" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.476796") + max_val = float("0.472615") + mean = float("-3.5089e-05") + std = float("0.0514629") + data = None + + +class Program_weight_tensor_parameter_112: + name = "parameter_112" + shape = [768] + dtype = "float32" + min_val = float("-2.60835") + max_val = float("2.83011") + mean = float("0.0287238") + std = float("0.525061") + data = None + + +class Program_weight_tensor_parameter_113: + name = "parameter_113" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.497061") + max_val = float("0.427563") + mean = float("-5.77334e-05") + std = float("0.0520005") + data = None + + +class Program_weight_tensor_parameter_114: + name = "parameter_114" + shape = [768] + dtype = "float32" + min_val = float("-1.30966") + max_val = float("1.10585") + mean = float("-0.00493392") + std = float("0.116173") + data = None + + +class Program_weight_tensor_parameter_115: + name = "parameter_115" + shape = [768] + dtype = "float32" + min_val = float("0.097049") + max_val = float("0.959174") + mean = float("0.666555") + std = float("0.056335") + data = None + + +class Program_weight_tensor_parameter_116: + name = "parameter_116" + shape = [768] + dtype = "float32" + min_val = float("-8.08497") + max_val = float("3.14603") + mean = float("-0.0853507") + std = float("0.480216") + data = None + + +class Program_weight_tensor_parameter_117: + name = "parameter_117" + shape = [768] + dtype = "float32" + min_val = float("0.446064") + max_val = float("4.24006") + mean = float("0.819117") + std = float("0.192814") + data = None + + +class Program_weight_tensor_parameter_118: + name = "parameter_118" + shape = [768] + dtype = "float32" + min_val = float("-0.648548") + max_val = float("1.70332") + mean = float("0.00673166") + std = float("0.175539") + data = None + + +class Program_weight_tensor_parameter_119: + name = "parameter_119" + shape = [3072, 768] + dtype = "float32" + min_val = float("-2.18128") + max_val = float("4.29764") + mean = float("1.88176e-05") + std = float("0.0623037") + data = None + + +class Program_weight_tensor_parameter_120: + name = "parameter_120" + shape = [3072] + dtype = "float32" + min_val = float("-1.04575") + max_val = float("0.634505") + mean = float("-0.333959") + std = float("0.177609") + data = None + + +class Program_weight_tensor_parameter_121: + name = "parameter_121" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.866082") + max_val = float("0.903594") + mean = float("0.00269747") + std = float("0.0617606") + data = None + + +class Program_weight_tensor_parameter_122: + name = "parameter_122" + shape = [768] + dtype = "float32" + min_val = float("-0.40419") + max_val = float("0.316366") + mean = float("0.00123949") + std = float("0.0794726") + data = None + + +class Program_weight_tensor_parameter_123: + name = "parameter_123" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.324451") + max_val = float("0.441335") + mean = float("-1.96054e-06") + std = float("0.0430411") + data = None + + +class Program_weight_tensor_parameter_124: + name = "parameter_124" + shape = [768] + dtype = "float32" + min_val = float("-0.473353") + max_val = float("0.775694") + mean = float("-0.00199399") + std = float("0.0742642") + data = None + + +class Program_weight_tensor_parameter_125: + name = "parameter_125" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.606651") + max_val = float("0.839163") + mean = float("2.85115e-05") + std = float("0.0439422") + data = None + + +class Program_weight_tensor_parameter_126: + name = "parameter_126" + shape = [768] + dtype = "float32" + min_val = float("-2.9598") + max_val = float("3.49108") + mean = float("-0.0170901") + std = float("0.803949") + data = None + + +class Program_weight_tensor_parameter_127: + name = "parameter_127" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.476815") + max_val = float("0.575912") + mean = float("3.08996e-05") + std = float("0.0525393") + data = None + + +class Program_weight_tensor_parameter_128: + name = "parameter_128" + shape = [768] + dtype = "float32" + min_val = float("-3.56495") + max_val = float("3.18953") + mean = float("0.00285413") + std = float("0.574851") + data = None + + +class Program_weight_tensor_parameter_129: + name = "parameter_129" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.434912") + max_val = float("0.433026") + mean = float("1.25493e-05") + std = float("0.0526881") + data = None + + +class Program_weight_tensor_parameter_130: + name = "parameter_130" + shape = [768] + dtype = "float32" + min_val = float("-1.0069") + max_val = float("1.02164") + mean = float("-0.0227313") + std = float("0.105869") + data = None + + +class Program_weight_tensor_parameter_131: + name = "parameter_131" + shape = [768] + dtype = "float32" + min_val = float("0.234443") + max_val = float("0.910902") + mean = float("0.717475") + std = float("0.0651158") + data = None + + +class Program_weight_tensor_parameter_132: + name = "parameter_132" + shape = [768] + dtype = "float32" + min_val = float("-7.10172") + max_val = float("2.36201") + mean = float("-0.0562428") + std = float("0.394928") + data = None + + +class Program_weight_tensor_parameter_133: + name = "parameter_133" + shape = [768] + dtype = "float32" + min_val = float("0.537385") + max_val = float("7.86868") + mean = float("0.843089") + std = float("0.288372") + data = None + + +class Program_weight_tensor_parameter_134: + name = "parameter_134" + shape = [768] + dtype = "float32" + min_val = float("-0.539993") + max_val = float("2.77904") + mean = float("0.00643199") + std = float("0.178923") + data = None + + +class Program_weight_tensor_parameter_135: + name = "parameter_135" + shape = [3072, 768] + dtype = "float32" + min_val = float("-4.44542") + max_val = float("1.46107") + mean = float("-1.56042e-05") + std = float("0.0563048") + data = None + + +class Program_weight_tensor_parameter_136: + name = "parameter_136" + shape = [3072] + dtype = "float32" + min_val = float("-1.30935") + max_val = float("0.656263") + mean = float("-0.290161") + std = float("0.166382") + data = None + + +class Program_weight_tensor_parameter_137: + name = "parameter_137" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.640649") + max_val = float("0.566277") + mean = float("0.00161489") + std = float("0.0563885") + data = None + + +class Program_weight_tensor_parameter_138: + name = "parameter_138" + shape = [768] + dtype = "float32" + min_val = float("-0.304537") + max_val = float("0.300313") + mean = float("0.0006139") + std = float("0.057058") + data = None + + +class Program_weight_tensor_parameter_139: + name = "parameter_139" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.69361") + max_val = float("0.33127") + mean = float("-7.22626e-06") + std = float("0.0427257") + data = None + + +class Program_weight_tensor_parameter_140: + name = "parameter_140" + shape = [768] + dtype = "float32" + min_val = float("-0.480467") + max_val = float("0.332698") + mean = float("0.00194964") + std = float("0.04043") + data = None + + +class Program_weight_tensor_parameter_141: + name = "parameter_141" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.479873") + max_val = float("0.418352") + mean = float("6.52652e-06") + std = float("0.0437045") + data = None + + +class Program_weight_tensor_parameter_142: + name = "parameter_142" + shape = [768] + dtype = "float32" + min_val = float("-1.91661") + max_val = float("2.70529") + mean = float("0.0090314") + std = float("0.537852") + data = None + + +class Program_weight_tensor_parameter_143: + name = "parameter_143" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.517174") + max_val = float("0.515081") + mean = float("1.8314e-05") + std = float("0.0518583") + data = None + + +class Program_weight_tensor_parameter_144: + name = "parameter_144" + shape = [768] + dtype = "float32" + min_val = float("-2.94715") + max_val = float("3.23087") + mean = float("0.000422489") + std = float("0.514605") + data = None + + +class Program_weight_tensor_parameter_145: + name = "parameter_145" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.58856") + max_val = float("0.712474") + mean = float("2.64153e-05") + std = float("0.0512159") + data = None + + +class Program_weight_tensor_parameter_146: + name = "parameter_146" + shape = [768] + dtype = "float32" + min_val = float("-1.44132") + max_val = float("1.1998") + mean = float("-0.00193087") + std = float("0.106406") + data = None + + +class Program_weight_tensor_parameter_147: + name = "parameter_147" + shape = [768] + dtype = "float32" + min_val = float("0.161303") + max_val = float("0.828709") + mean = float("0.709799") + std = float("0.0654611") + data = None + + +class Program_weight_tensor_parameter_148: + name = "parameter_148" + shape = [768] + dtype = "float32" + min_val = float("-6.1715") + max_val = float("1.82464") + mean = float("-0.0748922") + std = float("0.36384") + data = None + + +class Program_weight_tensor_parameter_149: + name = "parameter_149" + shape = [768] + dtype = "float32" + min_val = float("0.670692") + max_val = float("5.31204") + mean = float("0.875878") + std = float("0.19033") + data = None + + +class Program_weight_tensor_parameter_150: + name = "parameter_150" + shape = [768] + dtype = "float32" + min_val = float("-0.621517") + max_val = float("0.955898") + mean = float("0.00472748") + std = float("0.156607") + data = None + + +class Program_weight_tensor_parameter_151: + name = "parameter_151" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.61474") + max_val = float("3.45698") + mean = float("-1.79864e-05") + std = float("0.0518143") + data = None + + +class Program_weight_tensor_parameter_152: + name = "parameter_152" + shape = [3072] + dtype = "float32" + min_val = float("-0.704806") + max_val = float("0.547008") + mean = float("-0.265224") + std = float("0.177522") + data = None + + +class Program_weight_tensor_parameter_153: + name = "parameter_153" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.626374") + max_val = float("0.598922") + mean = float("0.00222036") + std = float("0.0531951") + data = None + + +class Program_weight_tensor_parameter_154: + name = "parameter_154" + shape = [768] + dtype = "float32" + min_val = float("-0.263621") + max_val = float("0.324378") + mean = float("0.00158352") + std = float("0.0716049") + data = None + + +class Program_weight_tensor_parameter_155: + name = "parameter_155" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.601757") + max_val = float("0.346544") + mean = float("2.38111e-05") + std = float("0.0438275") + data = None + + +class Program_weight_tensor_parameter_156: + name = "parameter_156" + shape = [768] + dtype = "float32" + min_val = float("-0.311646") + max_val = float("0.24209") + mean = float("-0.00160709") + std = float("0.0357519") + data = None + + +class Program_weight_tensor_parameter_157: + name = "parameter_157" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.37793") + max_val = float("1.09614") + mean = float("-1.95895e-05") + std = float("0.0448886") + data = None + + +class Program_weight_tensor_parameter_158: + name = "parameter_158" + shape = [768] + dtype = "float32" + min_val = float("-2.67565") + max_val = float("2.43918") + mean = float("-0.0122396") + std = float("0.557971") + data = None + + +class Program_weight_tensor_parameter_159: + name = "parameter_159" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.484645") + max_val = float("0.464148") + mean = float("4.21125e-05") + std = float("0.0530939") + data = None + + +class Program_weight_tensor_parameter_160: + name = "parameter_160" + shape = [768] + dtype = "float32" + min_val = float("-3.28419") + max_val = float("3.30539") + mean = float("0.00717985") + std = float("0.484791") + data = None + + +class Program_weight_tensor_parameter_161: + name = "parameter_161" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.441279") + max_val = float("0.461162") + mean = float("-1.50057e-05") + std = float("0.0526174") + data = None + + +class Program_weight_tensor_parameter_162: + name = "parameter_162" + shape = [768] + dtype = "float32" + min_val = float("-0.926914") + max_val = float("1.0462") + mean = float("-0.0187134") + std = float("0.0865968") + data = None + + +class Program_weight_tensor_parameter_163: + name = "parameter_163" + shape = [768] + dtype = "float32" + min_val = float("0.136294") + max_val = float("0.845185") + mean = float("0.73458") + std = float("0.0711137") + data = None + + +class Program_weight_tensor_parameter_164: + name = "parameter_164" + shape = [768] + dtype = "float32" + min_val = float("-5.39258") + max_val = float("2.17283") + mean = float("-0.0729359") + std = float("0.330099") + data = None + + +class Program_weight_tensor_parameter_165: + name = "parameter_165" + shape = [768] + dtype = "float32" + min_val = float("0.593965") + max_val = float("5.39236") + mean = float("0.860634") + std = float("0.190225") + data = None + + +class Program_weight_tensor_parameter_166: + name = "parameter_166" + shape = [768] + dtype = "float32" + min_val = float("-0.738263") + max_val = float("2.09953") + mean = float("0.00357493") + std = float("0.151505") + data = None + + +class Program_weight_tensor_parameter_167: + name = "parameter_167" + shape = [3072, 768] + dtype = "float32" + min_val = float("-3.80926") + max_val = float("1.50276") + mean = float("-4.81307e-06") + std = float("0.042994") + data = None + + +class Program_weight_tensor_parameter_168: + name = "parameter_168" + shape = [3072] + dtype = "float32" + min_val = float("-0.989553") + max_val = float("0.522297") + mean = float("-0.218662") + std = float("0.188499") + data = None + + +class Program_weight_tensor_parameter_169: + name = "parameter_169" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.586842") + max_val = float("0.669318") + mean = float("0.00167673") + std = float("0.0442619") + data = None + + +class Program_weight_tensor_parameter_170: + name = "parameter_170" + shape = [768] + dtype = "float32" + min_val = float("-0.245289") + max_val = float("0.281812") + mean = float("0.000613428") + std = float("0.0708205") + data = None + + +class Program_weight_tensor_parameter_171: + name = "parameter_171" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.36488") + max_val = float("0.488037") + mean = float("-1.65521e-06") + std = float("0.0427574") + data = None + + +class Program_weight_tensor_parameter_172: + name = "parameter_172" + shape = [768] + dtype = "float32" + min_val = float("-0.369347") + max_val = float("0.581072") + mean = float("0.00108605") + std = float("0.0422374") + data = None + + +class Program_weight_tensor_parameter_173: + name = "parameter_173" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.423042") + max_val = float("0.431299") + mean = float("3.72779e-06") + std = float("0.0434819") + data = None + + +class Program_weight_tensor_parameter_174: + name = "parameter_174" + shape = [768] + dtype = "float32" + min_val = float("-3.24227") + max_val = float("2.76503") + mean = float("-0.0132868") + std = float("0.616821") + data = None + + +class Program_weight_tensor_parameter_175: + name = "parameter_175" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.612718") + max_val = float("0.439115") + mean = float("3.21345e-05") + std = float("0.0548456") + data = None + + +class Program_weight_tensor_parameter_176: + name = "parameter_176" + shape = [768] + dtype = "float32" + min_val = float("-2.76648") + max_val = float("2.74377") + mean = float("-0.00568049") + std = float("0.433674") + data = None + + +class Program_weight_tensor_parameter_177: + name = "parameter_177" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.398133") + max_val = float("0.44053") + mean = float("2.66032e-05") + std = float("0.0543503") + data = None + + +class Program_weight_tensor_parameter_178: + name = "parameter_178" + shape = [768] + dtype = "float32" + min_val = float("-0.623046") + max_val = float("1.11656") + mean = float("-0.0200837") + std = float("0.0847607") + data = None + + +class Program_weight_tensor_parameter_179: + name = "parameter_179" + shape = [768] + dtype = "float32" + min_val = float("0.100446") + max_val = float("0.899087") + mean = float("0.743105") + std = float("0.0943897") + data = None + + +class Program_weight_tensor_parameter_180: + name = "parameter_180" + shape = [768] + dtype = "float32" + min_val = float("-7.9432") + max_val = float("3.16383") + mean = float("0.000862317") + std = float("0.504192") + data = None + + +class Program_weight_tensor_parameter_181: + name = "parameter_181" + shape = [768] + dtype = "float32" + min_val = float("0.348659") + max_val = float("5.38394") + mean = float("0.830888") + std = float("0.191894") + data = None + + +class Program_weight_tensor_parameter_182: + name = "parameter_182" + shape = [768] + dtype = "float32" + min_val = float("-0.613216") + max_val = float("2.30108") + mean = float("0.00367494") + std = float("0.158241") + data = None + + +class Program_weight_tensor_parameter_183: + name = "parameter_183" + shape = [3072, 768] + dtype = "float32" + min_val = float("-3.54399") + max_val = float("2.94009") + mean = float("-4.47269e-06") + std = float("0.0394033") + data = None + + +class Program_weight_tensor_parameter_184: + name = "parameter_184" + shape = [3072] + dtype = "float32" + min_val = float("-1.50515") + max_val = float("1.57995") + mean = float("-0.230329") + std = float("0.176509") + data = None + + +class Program_weight_tensor_parameter_185: + name = "parameter_185" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.602425") + max_val = float("1.07598") + mean = float("-0.000176019") + std = float("0.0394372") + data = None + + +class Program_weight_tensor_parameter_186: + name = "parameter_186" + shape = [768] + dtype = "float32" + min_val = float("-0.595094") + max_val = float("0.65741") + mean = float("-0.000241538") + std = float("0.135315") + data = None + + +class Program_weight_tensor_parameter_187: + name = "parameter_187" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.384004") + max_val = float("0.334764") + mean = float("1.72279e-07") + std = float("0.0361678") + data = None + + +class Program_weight_tensor_parameter_188: + name = "parameter_188" + shape = [768] + dtype = "float32" + min_val = float("-1.11316") + max_val = float("0.760956") + mean = float("-0.00148671") + std = float("0.0864796") + data = None + + +class Program_weight_tensor_parameter_189: + name = "parameter_189" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.511461") + max_val = float("0.573039") + mean = float("3.53839e-05") + std = float("0.0352523") + data = None + + +class Program_weight_tensor_parameter_190: + name = "parameter_190" + shape = [768] + dtype = "float32" + min_val = float("-1.6471") + max_val = float("1.64087") + mean = float("-0.025361") + std = float("0.448822") + data = None + + +class Program_weight_tensor_parameter_191: + name = "parameter_191" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.450814") + max_val = float("0.517358") + mean = float("2.44001e-05") + std = float("0.0525305") + data = None + + +class Program_weight_tensor_parameter_192: + name = "parameter_192" + shape = [768] + dtype = "float32" + min_val = float("-3.02949") + max_val = float("3.2163") + mean = float("0.0278471") + std = float("0.645217") + data = None + + +class Program_weight_tensor_parameter_193: + name = "parameter_193" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.336782") + max_val = float("0.349156") + mean = float("4.05707e-05") + std = float("0.0521116") + data = None + + +class Program_weight_tensor_parameter_194: + name = "parameter_194" + shape = [768] + dtype = "float32" + min_val = float("-0.556785") + max_val = float("0.73451") + mean = float("-0.0043756") + std = float("0.119851") + data = None + + +class Program_weight_tensor_parameter_195: + name = "parameter_195" + shape = [768] + dtype = "float32" + min_val = float("0.135306") + max_val = float("1.03706") + mean = float("0.684706") + std = float("0.173273") + data = None + + +class Program_weight_tensor_parameter_196: + name = "parameter_196" + shape = [3, 768] + dtype = "float32" + min_val = float("-0.194673") + max_val = float("0.1306") + mean = float("-0.000156307") + std = float("0.0162313") + data = None + + +class Program_weight_tensor_parameter_197: + name = "parameter_197" + shape = [4, 768] + dtype = "float32" + min_val = float("-0.339255") + max_val = float("0.500512") + mean = float("-0.000274311") + std = float("0.0231484") + data = None + + +class Program_weight_tensor_parameter_198: + name = "parameter_198" + shape = [2048, 768] + dtype = "float32" + min_val = float("-0.205464") + max_val = float("1.01608") + mean = float("7.58072e-05") + std = float("0.0301715") + data = None + + +class Program_weight_tensor_parameter_199: + name = "parameter_199" + shape = [40000, 768] + dtype = "float32" + min_val = float("-0.866318") + max_val = float("1.96368") + mean = float("0.00416631") + std = float("0.039008") + data = None diff --git a/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/graph_hash.txt b/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/graph_hash.txt new file mode 100644 index 0000000000..d38f31dacd --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/graph_hash.txt @@ -0,0 +1 @@ +9c08a3bb0bd05b2164df44d5548a5c5776eeaa49bd03e9e376c7ee59fdae46d0 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/graph_net.json b/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/graph_net.json new file mode 100644 index 0000000000..4bcc1d0266 --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "rocketqa-medium-cross-encoder", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/input_meta.py b/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/model.py b/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/model.py new file mode 100644 index 0000000000..1f9f7b0d1c --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/model.py @@ -0,0 +1,1442 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + parameter_72, + parameter_73, + parameter_74, + parameter_75, + parameter_76, + parameter_77, + parameter_78, + parameter_79, + parameter_80, + parameter_81, + parameter_82, + parameter_83, + parameter_84, + parameter_85, + parameter_86, + parameter_87, + parameter_88, + parameter_89, + parameter_90, + parameter_91, + parameter_92, + parameter_93, + parameter_94, + parameter_95, + parameter_96, + parameter_97, + parameter_98, + parameter_99, + parameter_100, + parameter_101, + parameter_102, + parameter_103, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 40000x768xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_103, 0, False) + del data_0, parameter_103 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0 + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 2048x768xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_102, -1, False) + del parameter_102 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 4x768xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_101, -1, False) + del data_1, parameter_101 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xi64) <- (1x21xi64, 1xf32) + scale_1 = paddle._C_ops.scale(full_2, full_4, float("0"), True) + del full_2, full_4 + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 16x768xf32) + embedding_3 = paddle._C_ops.embedding(scale_1, parameter_100, -1, False) + del parameter_100 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_2 = paddle._C_ops.add(add_1, embedding_3) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_2, parameter_99, parameter_98, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_98, parameter_99 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_15 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_16 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_17 = full_5 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_97, False, False) + del parameter_97 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_3 = paddle._C_ops.add(matmul_0, parameter_96) + del parameter_96 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 64] + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_95, False, False) + del parameter_95 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_4 = paddle._C_ops.add(matmul_1, parameter_94) + del parameter_94 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_93, False, False) + del parameter_93 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_5 = paddle._C_ops.add(matmul_2, parameter_92) + del parameter_92 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_5, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_6 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_18 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_19 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_20 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_21 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_22 = full_6 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_0, full_6, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_2, transpose_1, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_6 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_6, -1) + del add_6 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 768] + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_91, False, False) + del parameter_91 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_7 = paddle._C_ops.add(matmul_5, parameter_90) + del parameter_90 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_7, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_7 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_8 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_8, parameter_85, parameter_84, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_84, parameter_85 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_89, False, False) + del parameter_89 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_9 = paddle._C_ops.add(matmul_6, parameter_88) + del parameter_88 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_0 = paddle._C_ops.gelu(add_9, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_87, False, False) + del parameter_87 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_10 = paddle._C_ops.add(matmul_7, parameter_86) + del parameter_86 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_10, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_10 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_11 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_11, parameter_83, parameter_82, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_82, parameter_83 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_81, False, False) + del parameter_81 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_12 = paddle._C_ops.add(matmul_8, parameter_80) + del parameter_80 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_79, False, False) + del parameter_79 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_13 = paddle._C_ops.add(matmul_9, parameter_78) + del parameter_78 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_77, False, False) + del parameter_77 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_14 = paddle._C_ops.add(matmul_10, parameter_76) + del parameter_76 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_14, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_4, full_6, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_3, transpose_5, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_15 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_15, -1) + del add_15 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_75, False, False) + del parameter_75 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_16 = paddle._C_ops.add(matmul_13, parameter_74) + del parameter_74 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_16, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_16 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_17 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_17, parameter_69, parameter_68, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_68, parameter_69 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_73, False, False) + del parameter_73 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_18 = paddle._C_ops.add(matmul_14, parameter_72) + del parameter_72 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_1 = paddle._C_ops.gelu(add_18, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_71, False, False) + del parameter_71 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_19 = paddle._C_ops.add(matmul_15, parameter_70) + del parameter_70 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_19, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_19 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_20 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_20, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_21 = paddle._C_ops.add(matmul_16, parameter_64) + del parameter_64 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_22 = paddle._C_ops.add(matmul_17, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_23 = paddle._C_ops.add(matmul_18, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_23, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_8, full_6, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_4, transpose_9, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_24 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_24, -1) + del add_24 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_25 = paddle._C_ops.add(matmul_21, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_25, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_25 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_26 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_26, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_27 = paddle._C_ops.add(matmul_22, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_2 = paddle._C_ops.gelu(add_27, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_28 = paddle._C_ops.add(matmul_23, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_28, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_28 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_29 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_29, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_30 = paddle._C_ops.add(matmul_24, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_31 = paddle._C_ops.add(matmul_25, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_32 = paddle._C_ops.add(matmul_26, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_32, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_12, full_6, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_27 = paddle._C_ops.matmul(scale_5, transpose_13, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_33 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_33, -1) + del add_33 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_34 = paddle._C_ops.add(matmul_29, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_34, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_34 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_35 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_35, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_36 = paddle._C_ops.add(matmul_30, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_3 = paddle._C_ops.gelu(add_36, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_37 = paddle._C_ops.add(matmul_31, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_37, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_37 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_38 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_38, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_32 = paddle._C_ops.matmul(layer_norm_24, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_39 = paddle._C_ops.add(matmul_32, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_16 = paddle._C_ops.reshape(add_39, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_16 = paddle._C_ops.transpose(reshape_16, [0, 2, 1, 3]) + del reshape_16 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_33 = paddle._C_ops.matmul(layer_norm_24, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_40 = paddle._C_ops.add(matmul_33, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_34 = paddle._C_ops.matmul(layer_norm_24, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_41 = paddle._C_ops.add(matmul_34, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_17 = paddle._C_ops.reshape(add_40, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_17 = paddle._C_ops.transpose(reshape_17, [0, 2, 1, 3]) + del reshape_17 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_18 = paddle._C_ops.reshape(add_41, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_18 = paddle._C_ops.transpose(reshape_18, [0, 2, 1, 3]) + del reshape_18 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_6 = paddle._C_ops.scale(transpose_16, full_6, float("0"), True) + del transpose_16 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_35 = paddle._C_ops.matmul(scale_6, transpose_17, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_42 = paddle._C_ops.add(matmul_35, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_4 = paddle._C_ops.softmax(add_42, -1) + del add_42 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_26, dropout_27 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_4, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_36 = paddle._C_ops.matmul(dropout_26, transpose_18, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_19 = paddle._C_ops.transpose(matmul_36, [0, 2, 1, 3]) + del matmul_36 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_19 = paddle._C_ops.reshape(transpose_19, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_37 = paddle._C_ops.matmul(reshape_19, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_43 = paddle._C_ops.add(matmul_37, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_28, dropout_29 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_43, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_43 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_44 = paddle._C_ops.add(layer_norm_24, dropout_28) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_27, layer_norm_28, layer_norm_29 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_44, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_38 = paddle._C_ops.matmul(layer_norm_27, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_45 = paddle._C_ops.add(matmul_38, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_4 = paddle._C_ops.gelu(add_45, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_39 = paddle._C_ops.matmul(gelu_4, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_46 = paddle._C_ops.add(matmul_39, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_30, dropout_31 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_46, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_46 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_47 = paddle._C_ops.add(layer_norm_27, dropout_30) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_30, layer_norm_31, layer_norm_32 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_47, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_40 = paddle._C_ops.matmul(layer_norm_30, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_48 = paddle._C_ops.add(matmul_40, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_20 = paddle._C_ops.reshape(add_48, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_20 = paddle._C_ops.transpose(reshape_20, [0, 2, 1, 3]) + del reshape_20 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_41 = paddle._C_ops.matmul(layer_norm_30, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_49 = paddle._C_ops.add(matmul_41, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_42 = paddle._C_ops.matmul(layer_norm_30, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_50 = paddle._C_ops.add(matmul_42, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_21 = paddle._C_ops.reshape(add_49, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_21 = paddle._C_ops.transpose(reshape_21, [0, 2, 1, 3]) + del reshape_21 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_22 = paddle._C_ops.reshape(add_50, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_22 = paddle._C_ops.transpose(reshape_22, [0, 2, 1, 3]) + del reshape_22 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_7 = paddle._C_ops.scale(transpose_20, full_6, float("0"), True) + del transpose_20 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_43 = paddle._C_ops.matmul(scale_7, transpose_21, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_51 = paddle._C_ops.add(matmul_43, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_5 = paddle._C_ops.softmax(add_51, -1) + del add_51 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_32, dropout_33 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_5, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_44 = paddle._C_ops.matmul(dropout_32, transpose_22, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_23 = paddle._C_ops.transpose(matmul_44, [0, 2, 1, 3]) + del matmul_44 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_23 = paddle._C_ops.reshape(transpose_23, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_45 = paddle._C_ops.matmul(reshape_23, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_52 = paddle._C_ops.add(matmul_45, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_34, dropout_35 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_52, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_52 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_53 = paddle._C_ops.add(layer_norm_30, dropout_34) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_33, layer_norm_34, layer_norm_35 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_53, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_46 = paddle._C_ops.matmul(layer_norm_33, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_54 = paddle._C_ops.add(matmul_46, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_5 = paddle._C_ops.gelu(add_54, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_47 = paddle._C_ops.matmul(gelu_5, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_55 = paddle._C_ops.add(matmul_47, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_36, dropout_37 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_55, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_55 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_56 = paddle._C_ops.add(layer_norm_33, dropout_36) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_36, layer_norm_37, layer_norm_38 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_56, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x768xf32) <- (1x21x768xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_36, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x768xf32) <- (1x768xf32, 768x768xf32) + matmul_48 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x768xf32) <- (1x768xf32, 768xf32) + add_57 = paddle._C_ops.add(matmul_48, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x768xf32) <- (1x768xf32) + tanh_0 = paddle._C_ops.tanh(add_57) + del ( + add_0, + add_1, + add_11, + add_12, + add_13, + add_14, + add_17, + add_18, + add_2, + add_20, + add_21, + add_22, + add_23, + add_26, + add_27, + add_29, + add_3, + add_30, + add_31, + add_32, + add_35, + add_36, + add_38, + add_39, + add_4, + add_40, + add_41, + add_44, + add_45, + add_47, + add_48, + add_49, + add_5, + add_50, + add_53, + add_54, + add_56, + add_57, + add_8, + add_9, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_15, + assign_16, + assign_17, + assign_18, + assign_19, + assign_2, + assign_20, + assign_21, + assign_22, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_26, + dropout_27, + dropout_28, + dropout_29, + dropout_3, + dropout_30, + dropout_31, + dropout_32, + dropout_33, + dropout_34, + dropout_35, + dropout_36, + dropout_37, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + embedding_3, + full_5, + full_6, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + gelu_4, + gelu_5, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_27, + layer_norm_28, + layer_norm_29, + layer_norm_3, + layer_norm_30, + layer_norm_31, + layer_norm_32, + layer_norm_33, + layer_norm_34, + layer_norm_35, + layer_norm_36, + layer_norm_37, + layer_norm_38, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_33, + matmul_34, + matmul_35, + matmul_37, + matmul_38, + matmul_39, + matmul_40, + matmul_41, + matmul_42, + matmul_43, + matmul_45, + matmul_46, + matmul_47, + matmul_48, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_19, + reshape_23, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + scale_5, + scale_6, + scale_7, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + softmax_4, + softmax_5, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_17, + transpose_18, + transpose_19, + transpose_2, + transpose_21, + transpose_22, + transpose_23, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/weight_meta.py b/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/weight_meta.py new file mode 100644 index 0000000000..50c224e56c --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-medium-cross-encoder/weight_meta.py @@ -0,0 +1,1142 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [768] + dtype = "float32" + min_val = float("-0.00423639") + max_val = float("0.00563413") + mean = float("2.77521e-05") + std = float("0.00116302") + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.0925458") + max_val = float("0.0912212") + mean = float("-4.45491e-05") + std = float("0.0199503") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [768] + dtype = "float32" + min_val = float("-0.615221") + max_val = float("0.127493") + mean = float("-0.0614522") + std = float("0.0504206") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [768] + dtype = "float32" + min_val = float("0.444052") + max_val = float("1.16448") + mean = float("0.896627") + std = float("0.098965") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [768] + dtype = "float32" + min_val = float("-0.789388") + max_val = float("0.397897") + mean = float("0.0276426") + std = float("0.0649779") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [768] + dtype = "float32" + min_val = float("0.219723") + max_val = float("1.05428") + mean = float("0.548305") + std = float("0.100385") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [768] + dtype = "float32" + min_val = float("-0.21841") + max_val = float("0.186687") + mean = float("-0.00129441") + std = float("0.0508074") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.78168") + max_val = float("0.798334") + mean = float("-3.07342e-05") + std = float("0.0312628") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [3072] + dtype = "float32" + min_val = float("-0.383817") + max_val = float("0.27551") + mean = float("-0.0132374") + std = float("0.0628606") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.424876") + max_val = float("0.429974") + mean = float("-0.000166351") + std = float("0.0375368") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [768] + dtype = "float32" + min_val = float("-0.931707") + max_val = float("0.229527") + mean = float("-0.00302929") + std = float("0.0890456") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.558119") + max_val = float("0.705727") + mean = float("1.27099e-05") + std = float("0.0344261") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [768] + dtype = "float32" + min_val = float("-0.156714") + max_val = float("0.0967049") + mean = float("0.00091887") + std = float("0.0183481") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.271784") + max_val = float("0.224492") + mean = float("9.39796e-05") + std = float("0.0397925") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [768] + dtype = "float32" + min_val = float("-0.0212594") + max_val = float("0.0307224") + mean = float("-9.30081e-05") + std = float("0.00363985") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.373461") + max_val = float("0.29513") + mean = float("-1.20216e-05") + std = float("0.0420881") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [768] + dtype = "float32" + min_val = float("-0.384231") + max_val = float("0.37386") + mean = float("-0.000515499") + std = float("0.130939") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.260382") + max_val = float("0.286047") + mean = float("-1.31154e-05") + std = float("0.0438694") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [768] + dtype = "float32" + min_val = float("-0.71405") + max_val = float("0.825725") + mean = float("0.0198648") + std = float("0.0695436") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [768] + dtype = "float32" + min_val = float("0.652963") + max_val = float("1.29543") + mean = float("1.10308") + std = float("0.0446252") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [768] + dtype = "float32" + min_val = float("-0.603316") + max_val = float("1.10594") + mean = float("0.0314372") + std = float("0.0654722") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [768] + dtype = "float32" + min_val = float("0.40396") + max_val = float("2.13773") + mean = float("0.643605") + std = float("0.116628") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [768] + dtype = "float32" + min_val = float("-0.233186") + max_val = float("0.23283") + mean = float("-7.03545e-05") + std = float("0.0463314") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [3072, 768] + dtype = "float32" + min_val = float("-0.575921") + max_val = float("0.858217") + mean = float("6.17637e-05") + std = float("0.0326905") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [3072] + dtype = "float32" + min_val = float("-0.434667") + max_val = float("0.313786") + mean = float("-0.0196935") + std = float("0.0614686") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.458984") + max_val = float("0.423554") + mean = float("-0.000332257") + std = float("0.0381474") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [768] + dtype = "float32" + min_val = float("-0.775907") + max_val = float("0.290977") + mean = float("-0.00161298") + std = float("0.0834169") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.586457") + max_val = float("0.5126") + mean = float("-6.27421e-07") + std = float("0.037447") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [768] + dtype = "float32" + min_val = float("-0.12162") + max_val = float("0.14158") + mean = float("0.000321462") + std = float("0.0232745") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.354975") + max_val = float("0.513217") + mean = float("-8.36124e-06") + std = float("0.0438358") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [768] + dtype = "float32" + min_val = float("-0.00324309") + max_val = float("0.00442417") + mean = float("1.19958e-06") + std = float("0.000789413") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.319656") + max_val = float("0.314527") + mean = float("5.79919e-06") + std = float("0.0444199") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [768] + dtype = "float32" + min_val = float("-0.517274") + max_val = float("0.472728") + mean = float("0.00563393") + std = float("0.161624") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.249151") + max_val = float("0.247353") + mean = float("4.14922e-05") + std = float("0.0460375") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [768] + dtype = "float32" + min_val = float("-0.505574") + max_val = float("1.10419") + mean = float("0.0137173") + std = float("0.0670151") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [768] + dtype = "float32" + min_val = float("0.694022") + max_val = float("1.20188") + mean = float("1.07723") + std = float("0.0494408") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [768] + dtype = "float32" + min_val = float("-0.746436") + max_val = float("1.28252") + mean = float("0.0384969") + std = float("0.078916") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [768] + dtype = "float32" + min_val = float("0.472442") + max_val = float("2.34385") + mean = float("0.695943") + std = float("0.109062") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [768] + dtype = "float32" + min_val = float("-0.210529") + max_val = float("0.26924") + mean = float("-0.000581179") + std = float("0.0533214") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.39826") + max_val = float("1.08697") + mean = float("9.88902e-05") + std = float("0.0345182") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [3072] + dtype = "float32" + min_val = float("-0.47789") + max_val = float("0.181935") + mean = float("-0.0310457") + std = float("0.07869") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.452012") + max_val = float("0.559256") + mean = float("-0.000488346") + std = float("0.0401166") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [768] + dtype = "float32" + min_val = float("-0.562414") + max_val = float("0.436658") + mean = float("-0.00185962") + std = float("0.0905758") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.359355") + max_val = float("0.369218") + mean = float("-1.49114e-05") + std = float("0.0397092") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [768] + dtype = "float32" + min_val = float("-0.157931") + max_val = float("0.112131") + mean = float("-0.00156912") + std = float("0.0277349") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.580239") + max_val = float("0.438432") + mean = float("-5.94096e-05") + std = float("0.0460008") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [768] + dtype = "float32" + min_val = float("-0.00289326") + max_val = float("0.00436564") + mean = float("1.13966e-05") + std = float("0.00053477") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.498632") + max_val = float("0.352171") + mean = float("-2.4204e-05") + std = float("0.046215") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [768] + dtype = "float32" + min_val = float("-0.40305") + max_val = float("0.334121") + mean = float("-0.0102017") + std = float("0.116426") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.304816") + max_val = float("0.330322") + mean = float("-0.00017061") + std = float("0.048249") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [768] + dtype = "float32" + min_val = float("-0.625105") + max_val = float("1.46748") + mean = float("0.0174015") + std = float("0.0757057") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [768] + dtype = "float32" + min_val = float("0.802812") + max_val = float("1.19738") + mean = float("1.04636") + std = float("0.0619733") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [768] + dtype = "float32" + min_val = float("-0.776603") + max_val = float("1.57212") + mean = float("0.0338408") + std = float("0.0936471") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [768] + dtype = "float32" + min_val = float("0.47484") + max_val = float("2.43478") + mean = float("0.736293") + std = float("0.114102") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [768] + dtype = "float32" + min_val = float("-0.211722") + max_val = float("0.347896") + mean = float("0.000146438") + std = float("0.0547679") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.78128") + max_val = float("1.5535") + mean = float("9.24681e-05") + std = float("0.0347805") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [3072] + dtype = "float32" + min_val = float("-0.541752") + max_val = float("0.287031") + mean = float("-0.035827") + std = float("0.0803581") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.552873") + max_val = float("0.582399") + mean = float("-0.000344168") + std = float("0.0410068") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [768] + dtype = "float32" + min_val = float("-0.419921") + max_val = float("0.352163") + mean = float("-0.00112476") + std = float("0.0818295") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.366951") + max_val = float("0.404242") + mean = float("9.55202e-06") + std = float("0.0367496") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [768] + dtype = "float32" + min_val = float("-0.15052") + max_val = float("0.178818") + mean = float("0.00197067") + std = float("0.0305514") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.324908") + max_val = float("0.297627") + mean = float("0.000104746") + std = float("0.0426596") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [768] + dtype = "float32" + min_val = float("-0.00116023") + max_val = float("0.00287133") + mean = float("9.63166e-06") + std = float("0.000242401") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.587954") + max_val = float("0.600099") + mean = float("-5.37292e-05") + std = float("0.0464494") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [768] + dtype = "float32" + min_val = float("-0.560503") + max_val = float("0.522442") + mean = float("-0.0047216") + std = float("0.154322") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.572374") + max_val = float("0.40355") + mean = float("-2.52867e-05") + std = float("0.0484587") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [768] + dtype = "float32" + min_val = float("-0.814712") + max_val = float("1.29478") + mean = float("0.0178185") + std = float("0.0720674") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [768] + dtype = "float32" + min_val = float("0.820371") + max_val = float("1.1531") + mean = float("0.998088") + std = float("0.0601915") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [768] + dtype = "float32" + min_val = float("-1.09345") + max_val = float("1.75565") + mean = float("0.0299655") + std = float("0.103182") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [768] + dtype = "float32" + min_val = float("0.528376") + max_val = float("2.53747") + mean = float("0.771466") + std = float("0.116859") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [768] + dtype = "float32" + min_val = float("-0.246254") + max_val = float("0.227257") + mean = float("-8.21012e-05") + std = float("0.0602166") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [3072, 768] + dtype = "float32" + min_val = float("-2.90791") + max_val = float("0.750525") + mean = float("7.6055e-05") + std = float("0.0346412") + data = None + + +class Program_weight_tensor_parameter_72: + name = "parameter_72" + shape = [3072] + dtype = "float32" + min_val = float("-0.417306") + max_val = float("0.247566") + mean = float("-0.0347332") + std = float("0.0758473") + data = None + + +class Program_weight_tensor_parameter_73: + name = "parameter_73" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.421348") + max_val = float("0.513024") + mean = float("-0.000268306") + std = float("0.0412698") + data = None + + +class Program_weight_tensor_parameter_74: + name = "parameter_74" + shape = [768] + dtype = "float32" + min_val = float("-0.310579") + max_val = float("0.29866") + mean = float("-0.00101773") + std = float("0.0858256") + data = None + + +class Program_weight_tensor_parameter_75: + name = "parameter_75" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.355029") + max_val = float("0.44084") + mean = float("1.28663e-05") + std = float("0.0333807") + data = None + + +class Program_weight_tensor_parameter_76: + name = "parameter_76" + shape = [768] + dtype = "float32" + min_val = float("-0.104342") + max_val = float("0.151219") + mean = float("-0.000545438") + std = float("0.0295211") + data = None + + +class Program_weight_tensor_parameter_77: + name = "parameter_77" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.235806") + max_val = float("0.223986") + mean = float("1.66562e-06") + std = float("0.036013") + data = None + + +class Program_weight_tensor_parameter_78: + name = "parameter_78" + shape = [768] + dtype = "float32" + min_val = float("-0.00224996") + max_val = float("0.00231742") + mean = float("-1.22133e-05") + std = float("0.000298635") + data = None + + +class Program_weight_tensor_parameter_79: + name = "parameter_79" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.551146") + max_val = float("0.640031") + mean = float("2.22104e-05") + std = float("0.0472638") + data = None + + +class Program_weight_tensor_parameter_80: + name = "parameter_80" + shape = [768] + dtype = "float32" + min_val = float("-0.70474") + max_val = float("0.810034") + mean = float("0.0101648") + std = float("0.203926") + data = None + + +class Program_weight_tensor_parameter_81: + name = "parameter_81" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.336716") + max_val = float("0.435717") + mean = float("3.36054e-05") + std = float("0.0470569") + data = None + + +class Program_weight_tensor_parameter_82: + name = "parameter_82" + shape = [768] + dtype = "float32" + min_val = float("-1.19066") + max_val = float("1.84705") + mean = float("0.0135916") + std = float("0.105457") + data = None + + +class Program_weight_tensor_parameter_83: + name = "parameter_83" + shape = [768] + dtype = "float32" + min_val = float("0.753388") + max_val = float("1.1201") + mean = float("0.956936") + std = float("0.0622383") + data = None + + +class Program_weight_tensor_parameter_84: + name = "parameter_84" + shape = [768] + dtype = "float32" + min_val = float("-2.66016") + max_val = float("6.67272") + mean = float("0.0399899") + std = float("0.308091") + data = None + + +class Program_weight_tensor_parameter_85: + name = "parameter_85" + shape = [768] + dtype = "float32" + min_val = float("0.128009") + max_val = float("3.04735") + mean = float("0.646585") + std = float("0.114773") + data = None + + +class Program_weight_tensor_parameter_86: + name = "parameter_86" + shape = [768] + dtype = "float32" + min_val = float("-0.249888") + max_val = float("0.345266") + mean = float("-0.000544181") + std = float("0.0768753") + data = None + + +class Program_weight_tensor_parameter_87: + name = "parameter_87" + shape = [3072, 768] + dtype = "float32" + min_val = float("-6.3499") + max_val = float("0.92561") + mean = float("3.52882e-05") + std = float("0.0333918") + data = None + + +class Program_weight_tensor_parameter_88: + name = "parameter_88" + shape = [3072] + dtype = "float32" + min_val = float("-0.472484") + max_val = float("0.270016") + mean = float("-0.0464896") + std = float("0.0887211") + data = None + + +class Program_weight_tensor_parameter_89: + name = "parameter_89" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.955099") + max_val = float("1.09717") + mean = float("-0.000654667") + std = float("0.0378957") + data = None + + +class Program_weight_tensor_parameter_90: + name = "parameter_90" + shape = [768] + dtype = "float32" + min_val = float("-0.24265") + max_val = float("0.270523") + mean = float("0.000656748") + std = float("0.0878375") + data = None + + +class Program_weight_tensor_parameter_91: + name = "parameter_91" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.715098") + max_val = float("0.534022") + mean = float("-4.94976e-05") + std = float("0.0329963") + data = None + + +class Program_weight_tensor_parameter_92: + name = "parameter_92" + shape = [768] + dtype = "float32" + min_val = float("-0.421609") + max_val = float("0.516977") + mean = float("-0.0044894") + std = float("0.105332") + data = None + + +class Program_weight_tensor_parameter_93: + name = "parameter_93" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.285378") + max_val = float("0.256814") + mean = float("-3.16411e-05") + std = float("0.032503") + data = None + + +class Program_weight_tensor_parameter_94: + name = "parameter_94" + shape = [768] + dtype = "float32" + min_val = float("-0.000507141") + max_val = float("0.000625053") + mean = float("-9.34898e-07") + std = float("0.000131279") + data = None + + +class Program_weight_tensor_parameter_95: + name = "parameter_95" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.324055") + max_val = float("0.399268") + mean = float("-1.71916e-05") + std = float("0.0480487") + data = None + + +class Program_weight_tensor_parameter_96: + name = "parameter_96" + shape = [768] + dtype = "float32" + min_val = float("-1.03834") + max_val = float("1.0378") + mean = float("0.0117731") + std = float("0.399894") + data = None + + +class Program_weight_tensor_parameter_97: + name = "parameter_97" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.421575") + max_val = float("0.282674") + mean = float("1.37222e-05") + std = float("0.0459753") + data = None + + +class Program_weight_tensor_parameter_98: + name = "parameter_98" + shape = [768] + dtype = "float32" + min_val = float("-3.10681") + max_val = float("0.245217") + mean = float("0.0219211") + std = float("0.131947") + data = None + + +class Program_weight_tensor_parameter_99: + name = "parameter_99" + shape = [768] + dtype = "float32" + min_val = float("0.0784423") + max_val = float("1.41264") + mean = float("0.967891") + std = float("0.0651077") + data = None + + +class Program_weight_tensor_parameter_100: + name = "parameter_100" + shape = [16, 768] + dtype = "float32" + min_val = float("-0.0337877") + max_val = float("0.679649") + mean = float("9.33447e-05") + std = float("0.0155279") + data = None + + +class Program_weight_tensor_parameter_101: + name = "parameter_101" + shape = [4, 768] + dtype = "float32" + min_val = float("-0.0737263") + max_val = float("0.545338") + mean = float("4.38985e-05") + std = float("0.0237673") + data = None + + +class Program_weight_tensor_parameter_102: + name = "parameter_102" + shape = [2048, 768] + dtype = "float32" + min_val = float("-0.853686") + max_val = float("0.32625") + mean = float("-2.51726e-05") + std = float("0.0204176") + data = None + + +class Program_weight_tensor_parameter_103: + name = "parameter_103" + shape = [40000, 768] + dtype = "float32" + min_val = float("-1.13693") + max_val = float("0.826272") + mean = float("-1.38669e-05") + std = float("0.0307948") + data = None diff --git a/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/graph_hash.txt b/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/graph_hash.txt new file mode 100644 index 0000000000..f7916b3b5c --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/graph_hash.txt @@ -0,0 +1 @@ +bced5e643225a92c10192e7115db15a90598c668a04537760cf5238a14b450c8 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/graph_net.json b/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/graph_net.json new file mode 100644 index 0000000000..9d93c0b56e --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "rocketqa-micro-cross-encoder", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/input_meta.py b/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/model.py b/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/model.py new file mode 100644 index 0000000000..e85e2df661 --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/model.py @@ -0,0 +1,1022 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 40000x384xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_71, 0, False) + del data_0, parameter_71 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0 + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 2048x384xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_70, -1, False) + del parameter_70 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 4x384xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_69, -1, False) + del data_1, parameter_69 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xi64) <- (1x21xi64, 1xf32) + scale_1 = paddle._C_ops.scale(full_2, full_4, float("0"), True) + del full_2, full_4 + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 16x384xf32) + embedding_3 = paddle._C_ops.embedding(scale_1, parameter_68, -1, False) + del parameter_68 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_2 = paddle._C_ops.add(add_1, embedding_3) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_2, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_5 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_3 = paddle._C_ops.add(matmul_0, parameter_64) + del parameter_64 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 32] + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_4 = paddle._C_ops.add(matmul_1, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_5 = paddle._C_ops.add(matmul_2, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_5, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_6 = paddle._C_ops.full( + [1], float("0.176777"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_6 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_0, full_6, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_3 = paddle._C_ops.matmul(scale_2, transpose_1, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_6 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_6, -1) + del add_6 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 384] + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_7 = paddle._C_ops.add(matmul_5, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_7, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_7 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_8 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_8, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_9 = paddle._C_ops.add(matmul_6, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_0 = paddle._C_ops.gelu(add_9, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_10 = paddle._C_ops.add(matmul_7, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_10, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_10 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_11 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_11, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_12 = paddle._C_ops.add(matmul_8, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_13 = paddle._C_ops.add(matmul_9, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_14 = paddle._C_ops.add(matmul_10, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_14, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_4, full_6, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_11 = paddle._C_ops.matmul(scale_3, transpose_5, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_15 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_15, -1) + del add_15 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_16 = paddle._C_ops.add(matmul_13, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_16, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_16 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_17 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_17, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_18 = paddle._C_ops.add(matmul_14, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_1 = paddle._C_ops.gelu(add_18, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_19 = paddle._C_ops.add(matmul_15, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_19, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_19 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_20 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_20, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_21 = paddle._C_ops.add(matmul_16, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_22 = paddle._C_ops.add(matmul_17, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_23 = paddle._C_ops.add(matmul_18, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_23, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_8, full_6, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_19 = paddle._C_ops.matmul(scale_4, transpose_9, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_24 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_24, -1) + del add_24 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_25 = paddle._C_ops.add(matmul_21, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_25, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_25 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_26 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_26, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_27 = paddle._C_ops.add(matmul_22, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_2 = paddle._C_ops.gelu(add_27, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_28 = paddle._C_ops.add(matmul_23, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_28, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_28 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_29 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_29, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_30 = paddle._C_ops.add(matmul_24, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_31 = paddle._C_ops.add(matmul_25, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_32 = paddle._C_ops.add(matmul_26, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_32, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_12, full_6, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_27 = paddle._C_ops.matmul(scale_5, transpose_13, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_33 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_33, -1) + del add_33 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_34 = paddle._C_ops.add(matmul_29, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_34, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_34 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_35 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_35, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_36 = paddle._C_ops.add(matmul_30, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_3 = paddle._C_ops.gelu(add_36, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_37 = paddle._C_ops.add(matmul_31, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_37, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_37 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_38 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_38, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x384xf32) <- (1x21x384xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_24, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x384xf32) <- (1x384xf32, 384x384xf32) + matmul_32 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x384xf32) <- (1x384xf32, 384xf32) + add_39 = paddle._C_ops.add(matmul_32, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x384xf32) <- (1x384xf32) + tanh_0 = paddle._C_ops.tanh(add_39) + del ( + add_0, + add_1, + add_11, + add_12, + add_13, + add_14, + add_17, + add_18, + add_2, + add_20, + add_21, + add_22, + add_23, + add_26, + add_27, + add_29, + add_3, + add_30, + add_31, + add_32, + add_35, + add_36, + add_38, + add_39, + add_4, + add_5, + add_8, + add_9, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_2, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_3, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + embedding_3, + full_5, + full_6, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_3, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + scale_5, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_2, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/weight_meta.py b/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/weight_meta.py new file mode 100644 index 0000000000..a145bd1660 --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-micro-cross-encoder/weight_meta.py @@ -0,0 +1,790 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [384] + dtype = "float32" + min_val = float("-0.00495153") + max_val = float("0.00412898") + mean = float("-1.80117e-05") + std = float("0.00172348") + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.0879108") + max_val = float("0.0833564") + mean = float("5.50393e-05") + std = float("0.019991") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [384] + dtype = "float32" + min_val = float("-0.529247") + max_val = float("0.528775") + mean = float("0.00451017") + std = float("0.153285") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [384] + dtype = "float32" + min_val = float("0.686971") + max_val = float("1.25069") + mean = float("1.05864") + std = float("0.0819858") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [384] + dtype = "float32" + min_val = float("-1.04492") + max_val = float("0.941022") + mean = float("-0.000958116") + std = float("0.137596") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [384] + dtype = "float32" + min_val = float("0.348526") + max_val = float("1.33221") + mean = float("0.638718") + std = float("0.0996195") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [384] + dtype = "float32" + min_val = float("-0.252094") + max_val = float("0.317511") + mean = float("0.00116859") + std = float("0.0777673") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [1536, 384] + dtype = "float32" + min_val = float("-1.21692") + max_val = float("1.28248") + mean = float("1.24216e-05") + std = float("0.0507108") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [1536] + dtype = "float32" + min_val = float("-0.836914") + max_val = float("0.415797") + mean = float("-0.0147129") + std = float("0.102587") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.498724") + max_val = float("0.5156") + mean = float("0.000424104") + std = float("0.0482354") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [384] + dtype = "float32" + min_val = float("-0.450739") + max_val = float("0.356569") + mean = float("0.000387408") + std = float("0.123942") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.569875") + max_val = float("0.660609") + mean = float("-4.6003e-05") + std = float("0.0598741") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [384] + dtype = "float32" + min_val = float("-0.16776") + max_val = float("0.370036") + mean = float("0.000677232") + std = float("0.0428469") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.355444") + max_val = float("0.405913") + mean = float("7.0621e-05") + std = float("0.0570697") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [384] + dtype = "float32" + min_val = float("-0.0239288") + max_val = float("0.0272835") + mean = float("4.50019e-05") + std = float("0.0050665") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.411633") + max_val = float("0.407749") + mean = float("-9.52913e-05") + std = float("0.0560101") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [384] + dtype = "float32" + min_val = float("-0.847801") + max_val = float("0.812387") + mean = float("-0.00889578") + std = float("0.274064") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.34086") + max_val = float("0.359829") + mean = float("0.000113847") + std = float("0.0563898") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [384] + dtype = "float32" + min_val = float("-0.795439") + max_val = float("1.12897") + mean = float("0.00386713") + std = float("0.11407") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [384] + dtype = "float32" + min_val = float("0.582068") + max_val = float("1.67978") + mean = float("1.20934") + std = float("0.0904023") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [384] + dtype = "float32" + min_val = float("-1.32757") + max_val = float("1.11494") + mean = float("0.0091184") + std = float("0.113618") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [384] + dtype = "float32" + min_val = float("0.584028") + max_val = float("1.70506") + mean = float("0.848647") + std = float("0.107073") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [384] + dtype = "float32" + min_val = float("-0.22361") + max_val = float("0.280559") + mean = float("0.000684048") + std = float("0.0626394") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [1536, 384] + dtype = "float32" + min_val = float("-3.02523") + max_val = float("0.599285") + mean = float("-6.98004e-05") + std = float("0.0483814") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [1536] + dtype = "float32" + min_val = float("-0.793969") + max_val = float("0.364475") + mean = float("-0.0295658") + std = float("0.114449") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.711105") + max_val = float("0.659818") + mean = float("0.000227794") + std = float("0.0524687") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [384] + dtype = "float32" + min_val = float("-0.43518") + max_val = float("0.339659") + mean = float("-0.000417923") + std = float("0.0974295") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.39915") + max_val = float("0.486161") + mean = float("6.53093e-06") + std = float("0.0551465") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [384] + dtype = "float32" + min_val = float("-0.225272") + max_val = float("0.318251") + mean = float("0.00181069") + std = float("0.0538162") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.33819") + max_val = float("0.361241") + mean = float("0.000114867") + std = float("0.0562129") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [384] + dtype = "float32" + min_val = float("-0.00673987") + max_val = float("0.00852018") + mean = float("9.64502e-05") + std = float("0.00135424") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.485186") + max_val = float("0.461784") + mean = float("-6.27303e-05") + std = float("0.0599817") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [384] + dtype = "float32" + min_val = float("-0.704677") + max_val = float("0.700127") + mean = float("0.00868911") + std = float("0.258412") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.658428") + max_val = float("0.647811") + mean = float("1.06216e-05") + std = float("0.0641299") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [384] + dtype = "float32" + min_val = float("-1.02638") + max_val = float("0.759924") + mean = float("-0.00392773") + std = float("0.103379") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [384] + dtype = "float32" + min_val = float("0.946502") + max_val = float("1.4928") + mean = float("1.26678") + std = float("0.0785995") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [384] + dtype = "float32" + min_val = float("-1.21194") + max_val = float("1.46167") + mean = float("0.022831") + std = float("0.125769") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [384] + dtype = "float32" + min_val = float("0.67355") + max_val = float("2.08754") + mean = float("0.928917") + std = float("0.11916") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [384] + dtype = "float32" + min_val = float("-0.241358") + max_val = float("0.341181") + mean = float("-0.00109237") + std = float("0.0733635") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [1536, 384] + dtype = "float32" + min_val = float("-4.22591") + max_val = float("0.678055") + mean = float("-5.27259e-05") + std = float("0.0471075") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [1536] + dtype = "float32" + min_val = float("-0.791206") + max_val = float("0.284671") + mean = float("-0.0245545") + std = float("0.127944") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [384, 1536] + dtype = "float32" + min_val = float("-1.12179") + max_val = float("1.32166") + mean = float("6.76071e-05") + std = float("0.0526271") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [384] + dtype = "float32" + min_val = float("-0.404056") + max_val = float("0.385082") + mean = float("-0.000395394") + std = float("0.114186") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.578316") + max_val = float("0.987685") + mean = float("9.3482e-06") + std = float("0.050326") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [384] + dtype = "float32" + min_val = float("-0.200584") + max_val = float("0.223961") + mean = float("-0.00418771") + std = float("0.041517") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.30582") + max_val = float("0.433102") + mean = float("8.23484e-05") + std = float("0.052494") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [384] + dtype = "float32" + min_val = float("-0.00252133") + max_val = float("0.00351739") + mean = float("3.5736e-05") + std = float("0.000487392") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.516241") + max_val = float("0.528052") + mean = float("-6.62051e-05") + std = float("0.0592784") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [384] + dtype = "float32" + min_val = float("-0.560466") + max_val = float("0.579185") + mean = float("-0.0101416") + std = float("0.20976") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.449991") + max_val = float("0.320599") + mean = float("-4.38001e-05") + std = float("0.0593558") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [384] + dtype = "float32" + min_val = float("-0.964637") + max_val = float("0.851601") + mean = float("0.00469383") + std = float("0.108575") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [384] + dtype = "float32" + min_val = float("0.831302") + max_val = float("1.46474") + mean = float("1.14582") + std = float("0.0838327") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [384] + dtype = "float32" + min_val = float("-2.82573") + max_val = float("3.19178") + mean = float("0.0289145") + std = float("0.354369") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [384] + dtype = "float32" + min_val = float("0.566306") + max_val = float("3.91434") + mean = float("0.85923") + std = float("0.257629") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [384] + dtype = "float32" + min_val = float("-0.234625") + max_val = float("0.218048") + mean = float("-0.000790728") + std = float("0.0644877") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [1536, 384] + dtype = "float32" + min_val = float("-1.31357") + max_val = float("1.3208") + mean = float("4.78848e-06") + std = float("0.0422179") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [1536] + dtype = "float32" + min_val = float("-0.648104") + max_val = float("0.292053") + mean = float("-0.0238511") + std = float("0.120579") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.526389") + max_val = float("0.467057") + mean = float("-6.99381e-06") + std = float("0.0514053") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [384] + dtype = "float32" + min_val = float("-0.317975") + max_val = float("0.349142") + mean = float("0.000961401") + std = float("0.122729") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.297905") + max_val = float("0.320778") + mean = float("-1.93533e-05") + std = float("0.0464932") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [384] + dtype = "float32" + min_val = float("-0.372997") + max_val = float("0.401878") + mean = float("0.00381564") + std = float("0.148943") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.271481") + max_val = float("0.291931") + mean = float("7.27679e-05") + std = float("0.0469856") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [384] + dtype = "float32" + min_val = float("-0.000779149") + max_val = float("0.00100219") + mean = float("-2.05218e-05") + std = float("0.000219109") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.546884") + max_val = float("0.508657") + mean = float("-4.55447e-05") + std = float("0.0607546") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [384] + dtype = "float32" + min_val = float("-1.10038") + max_val = float("0.907792") + mean = float("0.0125006") + std = float("0.365105") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.559437") + max_val = float("0.466903") + mean = float("-1.23636e-05") + std = float("0.0552398") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [384] + dtype = "float32" + min_val = float("-2.06412") + max_val = float("1.63785") + mean = float("-0.003065") + std = float("0.178039") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [384] + dtype = "float32" + min_val = float("0.300762") + max_val = float("1.4113") + mean = float("1.04408") + std = float("0.0866608") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [16, 384] + dtype = "float32" + min_val = float("-0.276913") + max_val = float("0.27013") + mean = float("-2.68109e-05") + std = float("0.0136594") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [4, 384] + dtype = "float32" + min_val = float("-0.182285") + max_val = float("0.176489") + mean = float("0.000147226") + std = float("0.0180237") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [2048, 384] + dtype = "float32" + min_val = float("-0.477181") + max_val = float("0.369155") + mean = float("6.12992e-06") + std = float("0.0288156") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [40000, 384] + dtype = "float32" + min_val = float("-0.787046") + max_val = float("0.49149") + mean = float("-2.06727e-05") + std = float("0.0376675") + data = None diff --git a/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/graph_hash.txt b/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/graph_hash.txt new file mode 100644 index 0000000000..19056c06be --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/graph_hash.txt @@ -0,0 +1 @@ +6cdbba0eeaa64240e6ac13d0ab9517defda396e0b3a28912d7e0de857f2ce360 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/graph_net.json b/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/graph_net.json new file mode 100644 index 0000000000..200566ea9a --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "rocketqa-mini-cross-encoder", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/input_meta.py b/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/model.py b/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/model.py new file mode 100644 index 0000000000..d9f88a642d --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/model.py @@ -0,0 +1,1442 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + parameter_72, + parameter_73, + parameter_74, + parameter_75, + parameter_76, + parameter_77, + parameter_78, + parameter_79, + parameter_80, + parameter_81, + parameter_82, + parameter_83, + parameter_84, + parameter_85, + parameter_86, + parameter_87, + parameter_88, + parameter_89, + parameter_90, + parameter_91, + parameter_92, + parameter_93, + parameter_94, + parameter_95, + parameter_96, + parameter_97, + parameter_98, + parameter_99, + parameter_100, + parameter_101, + parameter_102, + parameter_103, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 40000x384xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_103, 0, False) + del data_0, parameter_103 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0 + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 2048x384xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_102, -1, False) + del parameter_102 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 4x384xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_101, -1, False) + del data_1, parameter_101 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xi64) <- (1x21xi64, 1xf32) + scale_1 = paddle._C_ops.scale(full_2, full_4, float("0"), True) + del full_2, full_4 + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 16x384xf32) + embedding_3 = paddle._C_ops.embedding(scale_1, parameter_100, -1, False) + del parameter_100 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_2 = paddle._C_ops.add(add_1, embedding_3) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_2, parameter_99, parameter_98, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_98, parameter_99 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_15 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_16 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_17 = full_5 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_97, False, False) + del parameter_97 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_3 = paddle._C_ops.add(matmul_0, parameter_96) + del parameter_96 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 32] + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_95, False, False) + del parameter_95 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_4 = paddle._C_ops.add(matmul_1, parameter_94) + del parameter_94 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_93, False, False) + del parameter_93 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_5 = paddle._C_ops.add(matmul_2, parameter_92) + del parameter_92 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_5, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_6 = paddle._C_ops.full( + [1], float("0.176777"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_18 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_19 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_20 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_21 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_22 = full_6 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_0, full_6, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_3 = paddle._C_ops.matmul(scale_2, transpose_1, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_6 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_6, -1) + del add_6 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 384] + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_91, False, False) + del parameter_91 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_7 = paddle._C_ops.add(matmul_5, parameter_90) + del parameter_90 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_7, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_7 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_8 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_8, parameter_85, parameter_84, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_84, parameter_85 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_89, False, False) + del parameter_89 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_9 = paddle._C_ops.add(matmul_6, parameter_88) + del parameter_88 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_0 = paddle._C_ops.gelu(add_9, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_87, False, False) + del parameter_87 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_10 = paddle._C_ops.add(matmul_7, parameter_86) + del parameter_86 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_10, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_10 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_11 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_11, parameter_83, parameter_82, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_82, parameter_83 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_81, False, False) + del parameter_81 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_12 = paddle._C_ops.add(matmul_8, parameter_80) + del parameter_80 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_79, False, False) + del parameter_79 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_13 = paddle._C_ops.add(matmul_9, parameter_78) + del parameter_78 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_77, False, False) + del parameter_77 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_14 = paddle._C_ops.add(matmul_10, parameter_76) + del parameter_76 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_14, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_4, full_6, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_11 = paddle._C_ops.matmul(scale_3, transpose_5, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_15 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_15, -1) + del add_15 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_75, False, False) + del parameter_75 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_16 = paddle._C_ops.add(matmul_13, parameter_74) + del parameter_74 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_16, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_16 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_17 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_17, parameter_69, parameter_68, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_68, parameter_69 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_73, False, False) + del parameter_73 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_18 = paddle._C_ops.add(matmul_14, parameter_72) + del parameter_72 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_1 = paddle._C_ops.gelu(add_18, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_71, False, False) + del parameter_71 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_19 = paddle._C_ops.add(matmul_15, parameter_70) + del parameter_70 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_19, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_19 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_20 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_20, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_21 = paddle._C_ops.add(matmul_16, parameter_64) + del parameter_64 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_22 = paddle._C_ops.add(matmul_17, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_23 = paddle._C_ops.add(matmul_18, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_23, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_8, full_6, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_19 = paddle._C_ops.matmul(scale_4, transpose_9, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_24 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_24, -1) + del add_24 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_25 = paddle._C_ops.add(matmul_21, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_25, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_25 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_26 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_26, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_27 = paddle._C_ops.add(matmul_22, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_2 = paddle._C_ops.gelu(add_27, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_28 = paddle._C_ops.add(matmul_23, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_28, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_28 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_29 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_29, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_30 = paddle._C_ops.add(matmul_24, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_31 = paddle._C_ops.add(matmul_25, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_32 = paddle._C_ops.add(matmul_26, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_32, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_12, full_6, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_27 = paddle._C_ops.matmul(scale_5, transpose_13, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_33 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_33, -1) + del add_33 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_34 = paddle._C_ops.add(matmul_29, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_34, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_34 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_35 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_35, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_36 = paddle._C_ops.add(matmul_30, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_3 = paddle._C_ops.gelu(add_36, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_37 = paddle._C_ops.add(matmul_31, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_37, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_37 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_38 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_38, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_32 = paddle._C_ops.matmul(layer_norm_24, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_39 = paddle._C_ops.add(matmul_32, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_16 = paddle._C_ops.reshape(add_39, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_16 = paddle._C_ops.transpose(reshape_16, [0, 2, 1, 3]) + del reshape_16 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_33 = paddle._C_ops.matmul(layer_norm_24, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_40 = paddle._C_ops.add(matmul_33, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_34 = paddle._C_ops.matmul(layer_norm_24, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_41 = paddle._C_ops.add(matmul_34, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_17 = paddle._C_ops.reshape(add_40, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_17 = paddle._C_ops.transpose(reshape_17, [0, 2, 1, 3]) + del reshape_17 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_18 = paddle._C_ops.reshape(add_41, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_18 = paddle._C_ops.transpose(reshape_18, [0, 2, 1, 3]) + del reshape_18 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_6 = paddle._C_ops.scale(transpose_16, full_6, float("0"), True) + del transpose_16 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_35 = paddle._C_ops.matmul(scale_6, transpose_17, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_42 = paddle._C_ops.add(matmul_35, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_4 = paddle._C_ops.softmax(add_42, -1) + del add_42 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_26, dropout_27 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_4, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_36 = paddle._C_ops.matmul(dropout_26, transpose_18, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_19 = paddle._C_ops.transpose(matmul_36, [0, 2, 1, 3]) + del matmul_36 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_19 = paddle._C_ops.reshape(transpose_19, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_37 = paddle._C_ops.matmul(reshape_19, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_43 = paddle._C_ops.add(matmul_37, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_28, dropout_29 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_43, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_43 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_44 = paddle._C_ops.add(layer_norm_24, dropout_28) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_27, layer_norm_28, layer_norm_29 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_44, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_38 = paddle._C_ops.matmul(layer_norm_27, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_45 = paddle._C_ops.add(matmul_38, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_4 = paddle._C_ops.gelu(add_45, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_39 = paddle._C_ops.matmul(gelu_4, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_46 = paddle._C_ops.add(matmul_39, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_30, dropout_31 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_46, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_46 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_47 = paddle._C_ops.add(layer_norm_27, dropout_30) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_30, layer_norm_31, layer_norm_32 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_47, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_40 = paddle._C_ops.matmul(layer_norm_30, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_48 = paddle._C_ops.add(matmul_40, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_20 = paddle._C_ops.reshape(add_48, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_20 = paddle._C_ops.transpose(reshape_20, [0, 2, 1, 3]) + del reshape_20 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_41 = paddle._C_ops.matmul(layer_norm_30, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_49 = paddle._C_ops.add(matmul_41, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_42 = paddle._C_ops.matmul(layer_norm_30, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_50 = paddle._C_ops.add(matmul_42, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_21 = paddle._C_ops.reshape(add_49, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_21 = paddle._C_ops.transpose(reshape_21, [0, 2, 1, 3]) + del reshape_21 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_22 = paddle._C_ops.reshape(add_50, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_22 = paddle._C_ops.transpose(reshape_22, [0, 2, 1, 3]) + del reshape_22 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_7 = paddle._C_ops.scale(transpose_20, full_6, float("0"), True) + del transpose_20 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_43 = paddle._C_ops.matmul(scale_7, transpose_21, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_51 = paddle._C_ops.add(matmul_43, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_5 = paddle._C_ops.softmax(add_51, -1) + del add_51 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_32, dropout_33 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_5, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_44 = paddle._C_ops.matmul(dropout_32, transpose_22, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_23 = paddle._C_ops.transpose(matmul_44, [0, 2, 1, 3]) + del matmul_44 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_23 = paddle._C_ops.reshape(transpose_23, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_45 = paddle._C_ops.matmul(reshape_23, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_52 = paddle._C_ops.add(matmul_45, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_34, dropout_35 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_52, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_52 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_53 = paddle._C_ops.add(layer_norm_30, dropout_34) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_33, layer_norm_34, layer_norm_35 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_53, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_46 = paddle._C_ops.matmul(layer_norm_33, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_54 = paddle._C_ops.add(matmul_46, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_5 = paddle._C_ops.gelu(add_54, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_47 = paddle._C_ops.matmul(gelu_5, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_55 = paddle._C_ops.add(matmul_47, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_36, dropout_37 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_55, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_55 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_56 = paddle._C_ops.add(layer_norm_33, dropout_36) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_36, layer_norm_37, layer_norm_38 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_56, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x384xf32) <- (1x21x384xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_36, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x384xf32) <- (1x384xf32, 384x384xf32) + matmul_48 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x384xf32) <- (1x384xf32, 384xf32) + add_57 = paddle._C_ops.add(matmul_48, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x384xf32) <- (1x384xf32) + tanh_0 = paddle._C_ops.tanh(add_57) + del ( + add_0, + add_1, + add_11, + add_12, + add_13, + add_14, + add_17, + add_18, + add_2, + add_20, + add_21, + add_22, + add_23, + add_26, + add_27, + add_29, + add_3, + add_30, + add_31, + add_32, + add_35, + add_36, + add_38, + add_39, + add_4, + add_40, + add_41, + add_44, + add_45, + add_47, + add_48, + add_49, + add_5, + add_50, + add_53, + add_54, + add_56, + add_57, + add_8, + add_9, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_15, + assign_16, + assign_17, + assign_18, + assign_19, + assign_2, + assign_20, + assign_21, + assign_22, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_26, + dropout_27, + dropout_28, + dropout_29, + dropout_3, + dropout_30, + dropout_31, + dropout_32, + dropout_33, + dropout_34, + dropout_35, + dropout_36, + dropout_37, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + embedding_3, + full_5, + full_6, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + gelu_4, + gelu_5, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_27, + layer_norm_28, + layer_norm_29, + layer_norm_3, + layer_norm_30, + layer_norm_31, + layer_norm_32, + layer_norm_33, + layer_norm_34, + layer_norm_35, + layer_norm_36, + layer_norm_37, + layer_norm_38, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_33, + matmul_34, + matmul_35, + matmul_37, + matmul_38, + matmul_39, + matmul_40, + matmul_41, + matmul_42, + matmul_43, + matmul_45, + matmul_46, + matmul_47, + matmul_48, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_19, + reshape_23, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + scale_5, + scale_6, + scale_7, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + softmax_4, + softmax_5, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_17, + transpose_18, + transpose_19, + transpose_2, + transpose_21, + transpose_22, + transpose_23, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/weight_meta.py b/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/weight_meta.py new file mode 100644 index 0000000000..3b5464181e --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-mini-cross-encoder/weight_meta.py @@ -0,0 +1,1142 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [384] + dtype = "float32" + min_val = float("-0.00256439") + max_val = float("0.00263782") + mean = float("0.000161412") + std = float("0.00140631") + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.081164") + max_val = float("0.0781925") + mean = float("-3.58072e-05") + std = float("0.0200165") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [384] + dtype = "float32" + min_val = float("-0.265784") + max_val = float("0.355627") + mean = float("0.0770207") + std = float("0.106916") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [384] + dtype = "float32" + min_val = float("0.759393") + max_val = float("1.32877") + mean = float("1.09442") + std = float("0.0813856") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [384] + dtype = "float32" + min_val = float("-1.178") + max_val = float("0.891232") + mean = float("0.00156692") + std = float("0.116779") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [384] + dtype = "float32" + min_val = float("0.389675") + max_val = float("1.48523") + mean = float("0.659328") + std = float("0.104027") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [384] + dtype = "float32" + min_val = float("-0.199491") + max_val = float("0.237164") + mean = float("0.000403475") + std = float("0.0691429") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [1536, 384] + dtype = "float32" + min_val = float("-0.968364") + max_val = float("1.10238") + mean = float("2.11074e-05") + std = float("0.0475144") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [1536] + dtype = "float32" + min_val = float("-0.605898") + max_val = float("0.320137") + mean = float("-0.0129144") + std = float("0.0859867") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.60357") + max_val = float("0.526928") + mean = float("0.000204013") + std = float("0.0461804") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [384] + dtype = "float32" + min_val = float("-0.303614") + max_val = float("0.282021") + mean = float("-0.000391076") + std = float("0.0902901") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.684151") + max_val = float("0.685933") + mean = float("6.0789e-05") + std = float("0.0529309") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [384] + dtype = "float32" + min_val = float("-0.130441") + max_val = float("0.0766912") + mean = float("-0.00126491") + std = float("0.023973") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.299324") + max_val = float("0.370672") + mean = float("3.04656e-05") + std = float("0.052812") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [384] + dtype = "float32" + min_val = float("-0.0260576") + max_val = float("0.031967") + mean = float("0.000260144") + std = float("0.00541878") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.334577") + max_val = float("0.383803") + mean = float("-0.000121371") + std = float("0.0562342") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [384] + dtype = "float32" + min_val = float("-0.510457") + max_val = float("0.497722") + mean = float("0.0103026") + std = float("0.191752") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.434075") + max_val = float("0.341146") + mean = float("-8.23165e-05") + std = float("0.0586987") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [384] + dtype = "float32" + min_val = float("-0.497758") + max_val = float("1.11893") + mean = float("-0.0075174") + std = float("0.095648") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [384] + dtype = "float32" + min_val = float("0.633216") + max_val = float("1.54927") + mean = float("1.21276") + std = float("0.0839384") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [384] + dtype = "float32" + min_val = float("-0.927368") + max_val = float("0.638258") + mean = float("-0.00428897") + std = float("0.0818648") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [384] + dtype = "float32" + min_val = float("0.675674") + max_val = float("1.38855") + mean = float("0.851158") + std = float("0.0787387") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [384] + dtype = "float32" + min_val = float("-0.185525") + max_val = float("0.164513") + mean = float("0.000659684") + std = float("0.0505835") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [1536, 384] + dtype = "float32" + min_val = float("-1.3537") + max_val = float("0.638728") + mean = float("-6.90023e-05") + std = float("0.0448451") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [1536] + dtype = "float32" + min_val = float("-0.568222") + max_val = float("0.265745") + mean = float("-0.0182666") + std = float("0.0713813") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.507165") + max_val = float("0.54552") + mean = float("0.000449135") + std = float("0.048061") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [384] + dtype = "float32" + min_val = float("-0.245455") + max_val = float("0.191482") + mean = float("-0.000973907") + std = float("0.0725862") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.412449") + max_val = float("0.392298") + mean = float("-4.64105e-05") + std = float("0.0510859") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [384] + dtype = "float32" + min_val = float("-0.161156") + max_val = float("0.173705") + mean = float("-0.000121696") + std = float("0.0328289") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.342785") + max_val = float("0.354564") + mean = float("9.06021e-05") + std = float("0.0540711") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [384] + dtype = "float32" + min_val = float("-0.00574247") + max_val = float("0.00958886") + mean = float("-1.78012e-05") + std = float("0.00128518") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.361672") + max_val = float("0.296188") + mean = float("0.000181508") + std = float("0.0586697") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [384] + dtype = "float32" + min_val = float("-0.586434") + max_val = float("0.708624") + mean = float("0.00888499") + std = float("0.216066") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.333574") + max_val = float("0.335809") + mean = float("0.000129673") + std = float("0.0603112") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [384] + dtype = "float32" + min_val = float("-0.718376") + max_val = float("0.673758") + mean = float("-0.020326") + std = float("0.0791948") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [384] + dtype = "float32" + min_val = float("0.825445") + max_val = float("1.44615") + mean = float("1.26166") + std = float("0.068717") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [384] + dtype = "float32" + min_val = float("-0.964334") + max_val = float("0.513766") + mean = float("-0.00398413") + std = float("0.0785861") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [384] + dtype = "float32" + min_val = float("0.701612") + max_val = float("1.4824") + mean = float("0.906883") + std = float("0.0910949") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [384] + dtype = "float32" + min_val = float("-0.154809") + max_val = float("0.162584") + mean = float("-0.000250565") + std = float("0.0477837") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [1536, 384] + dtype = "float32" + min_val = float("-1.73948") + max_val = float("0.643734") + mean = float("-0.000113467") + std = float("0.0454782") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [1536] + dtype = "float32" + min_val = float("-0.526366") + max_val = float("0.312408") + mean = float("-0.0339425") + std = float("0.0883487") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.477368") + max_val = float("0.53428") + mean = float("0.000484869") + std = float("0.0503724") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [384] + dtype = "float32" + min_val = float("-0.342679") + max_val = float("0.282572") + mean = float("0.000261247") + std = float("0.0722197") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.563855") + max_val = float("0.984597") + mean = float("1.75323e-05") + std = float("0.0482583") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [384] + dtype = "float32" + min_val = float("-0.133465") + max_val = float("0.129601") + mean = float("-6.53647e-05") + std = float("0.030169") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.282594") + max_val = float("0.275661") + mean = float("-0.000115906") + std = float("0.0516289") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [384] + dtype = "float32" + min_val = float("-0.0032676") + max_val = float("0.00286029") + mean = float("-2.40749e-05") + std = float("0.000520308") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.305349") + max_val = float("0.358924") + mean = float("-0.000165804") + std = float("0.0595095") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [384] + dtype = "float32" + min_val = float("-0.71351") + max_val = float("0.655165") + mean = float("-0.0186359") + std = float("0.257426") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.354357") + max_val = float("0.349948") + mean = float("3.35377e-05") + std = float("0.0620203") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [384] + dtype = "float32" + min_val = float("-0.800337") + max_val = float("0.502637") + mean = float("-0.00261553") + std = float("0.0706052") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [384] + dtype = "float32" + min_val = float("0.917515") + max_val = float("1.40832") + mean = float("1.21282") + std = float("0.0614845") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [384] + dtype = "float32" + min_val = float("-0.735475") + max_val = float("0.755296") + mean = float("-0.00522761") + std = float("0.0817936") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [384] + dtype = "float32" + min_val = float("0.759203") + max_val = float("1.83626") + mean = float("0.989861") + std = float("0.103275") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [384] + dtype = "float32" + min_val = float("-0.263219") + max_val = float("0.260283") + mean = float("-6.32391e-05") + std = float("0.0597508") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [1536, 384] + dtype = "float32" + min_val = float("-1.74112") + max_val = float("0.75811") + mean = float("-8.94469e-05") + std = float("0.0433821") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [1536] + dtype = "float32" + min_val = float("-0.473519") + max_val = float("0.235361") + mean = float("-0.0326531") + std = float("0.0946908") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.643855") + max_val = float("0.475967") + mean = float("0.000316723") + std = float("0.051085") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [384] + dtype = "float32" + min_val = float("-0.250901") + max_val = float("0.332197") + mean = float("0.000391311") + std = float("0.0775819") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.483821") + max_val = float("0.537378") + mean = float("-3.38026e-05") + std = float("0.046362") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [384] + dtype = "float32" + min_val = float("-0.121611") + max_val = float("0.179814") + mean = float("-0.00213656") + std = float("0.030271") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.295654") + max_val = float("0.243312") + mean = float("-4.15521e-05") + std = float("0.0492101") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [384] + dtype = "float32" + min_val = float("-0.000948381") + max_val = float("0.00173899") + mean = float("-2.71795e-05") + std = float("0.000270028") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.714976") + max_val = float("0.845438") + mean = float("-0.000102447") + std = float("0.0622863") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [384] + dtype = "float32" + min_val = float("-0.652352") + max_val = float("0.616717") + mean = float("-0.000240025") + std = float("0.172547") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.525362") + max_val = float("0.536895") + mean = float("-4.0507e-06") + std = float("0.0712831") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [384] + dtype = "float32" + min_val = float("-0.547195") + max_val = float("0.63372") + mean = float("0.000135729") + std = float("0.0648514") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [384] + dtype = "float32" + min_val = float("0.992886") + max_val = float("1.56736") + mean = float("1.23399") + std = float("0.066556") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [384] + dtype = "float32" + min_val = float("-0.896357") + max_val = float("0.975551") + mean = float("-0.000239616") + std = float("0.0999273") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [384] + dtype = "float32" + min_val = float("0.83989") + max_val = float("1.99157") + mean = float("1.03956") + std = float("0.104826") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [384] + dtype = "float32" + min_val = float("-0.203248") + max_val = float("0.343572") + mean = float("-0.000140198") + std = float("0.071415") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [1536, 384] + dtype = "float32" + min_val = float("-1.37074") + max_val = float("0.997135") + mean = float("1.67742e-05") + std = float("0.0437274") + data = None + + +class Program_weight_tensor_parameter_72: + name = "parameter_72" + shape = [1536] + dtype = "float32" + min_val = float("-0.691778") + max_val = float("0.336149") + mean = float("-0.0270462") + std = float("0.11406") + data = None + + +class Program_weight_tensor_parameter_73: + name = "parameter_73" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.55587") + max_val = float("0.47391") + mean = float("7.49313e-05") + std = float("0.0513276") + data = None + + +class Program_weight_tensor_parameter_74: + name = "parameter_74" + shape = [384] + dtype = "float32" + min_val = float("-0.288079") + max_val = float("0.222009") + mean = float("-0.00066417") + std = float("0.0911443") + data = None + + +class Program_weight_tensor_parameter_75: + name = "parameter_75" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.268353") + max_val = float("0.253598") + mean = float("-3.45854e-05") + std = float("0.0411661") + data = None + + +class Program_weight_tensor_parameter_76: + name = "parameter_76" + shape = [384] + dtype = "float32" + min_val = float("-0.116638") + max_val = float("0.15365") + mean = float("-0.00121735") + std = float("0.0351998") + data = None + + +class Program_weight_tensor_parameter_77: + name = "parameter_77" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.225877") + max_val = float("0.255828") + mean = float("-3.096e-06") + std = float("0.0441387") + data = None + + +class Program_weight_tensor_parameter_78: + name = "parameter_78" + shape = [384] + dtype = "float32" + min_val = float("-0.00167251") + max_val = float("0.00170293") + mean = float("2.49379e-05") + std = float("0.00033044") + data = None + + +class Program_weight_tensor_parameter_79: + name = "parameter_79" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.432844") + max_val = float("0.465706") + mean = float("0.000100557") + std = float("0.0647939") + data = None + + +class Program_weight_tensor_parameter_80: + name = "parameter_80" + shape = [384] + dtype = "float32" + min_val = float("-0.702922") + max_val = float("0.748296") + mean = float("0.0106965") + std = float("0.286414") + data = None + + +class Program_weight_tensor_parameter_81: + name = "parameter_81" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.403141") + max_val = float("0.429262") + mean = float("0.000170885") + std = float("0.0618651") + data = None + + +class Program_weight_tensor_parameter_82: + name = "parameter_82" + shape = [384] + dtype = "float32" + min_val = float("-1.21378") + max_val = float("1.07389") + mean = float("0.018029") + std = float("0.120208") + data = None + + +class Program_weight_tensor_parameter_83: + name = "parameter_83" + shape = [384] + dtype = "float32" + min_val = float("0.99551") + max_val = float("1.39499") + mean = float("1.20134") + std = float("0.0555032") + data = None + + +class Program_weight_tensor_parameter_84: + name = "parameter_84" + shape = [384] + dtype = "float32" + min_val = float("-3.99256") + max_val = float("2.23512") + mean = float("0.00866233") + std = float("0.296642") + data = None + + +class Program_weight_tensor_parameter_85: + name = "parameter_85" + shape = [384] + dtype = "float32" + min_val = float("0.417885") + max_val = float("3.80234") + mean = float("0.894939") + std = float("0.24654") + data = None + + +class Program_weight_tensor_parameter_86: + name = "parameter_86" + shape = [384] + dtype = "float32" + min_val = float("-0.266796") + max_val = float("0.229544") + mean = float("-0.000156287") + std = float("0.0708849") + data = None + + +class Program_weight_tensor_parameter_87: + name = "parameter_87" + shape = [1536, 384] + dtype = "float32" + min_val = float("-1.62381") + max_val = float("0.330927") + mean = float("2.49762e-05") + std = float("0.0389715") + data = None + + +class Program_weight_tensor_parameter_88: + name = "parameter_88" + shape = [1536] + dtype = "float32" + min_val = float("-0.540665") + max_val = float("0.301294") + mean = float("-0.0273894") + std = float("0.120333") + data = None + + +class Program_weight_tensor_parameter_89: + name = "parameter_89" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.381177") + max_val = float("0.393648") + mean = float("1.33742e-05") + std = float("0.0462692") + data = None + + +class Program_weight_tensor_parameter_90: + name = "parameter_90" + shape = [384] + dtype = "float32" + min_val = float("-0.34282") + max_val = float("0.293333") + mean = float("-0.00182022") + std = float("0.110174") + data = None + + +class Program_weight_tensor_parameter_91: + name = "parameter_91" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.304494") + max_val = float("0.307784") + mean = float("-2.46241e-05") + std = float("0.0434335") + data = None + + +class Program_weight_tensor_parameter_92: + name = "parameter_92" + shape = [384] + dtype = "float32" + min_val = float("-0.392436") + max_val = float("0.420129") + mean = float("0.004269") + std = float("0.127023") + data = None + + +class Program_weight_tensor_parameter_93: + name = "parameter_93" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.350792") + max_val = float("0.408348") + mean = float("-2.77112e-05") + std = float("0.0422607") + data = None + + +class Program_weight_tensor_parameter_94: + name = "parameter_94" + shape = [384] + dtype = "float32" + min_val = float("-0.000636372") + max_val = float("0.000735308") + mean = float("9.08954e-08") + std = float("0.000154002") + data = None + + +class Program_weight_tensor_parameter_95: + name = "parameter_95" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.456937") + max_val = float("0.424983") + mean = float("0.000172264") + std = float("0.0603682") + data = None + + +class Program_weight_tensor_parameter_96: + name = "parameter_96" + shape = [384] + dtype = "float32" + min_val = float("-1.24257") + max_val = float("1.02732") + mean = float("0.0258629") + std = float("0.347143") + data = None + + +class Program_weight_tensor_parameter_97: + name = "parameter_97" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.621652") + max_val = float("0.418915") + mean = float("0.000104612") + std = float("0.0567022") + data = None + + +class Program_weight_tensor_parameter_98: + name = "parameter_98" + shape = [384] + dtype = "float32" + min_val = float("-0.324497") + max_val = float("1.50101") + mean = float("-0.0260702") + std = float("0.119517") + data = None + + +class Program_weight_tensor_parameter_99: + name = "parameter_99" + shape = [384] + dtype = "float32" + min_val = float("0.148805") + max_val = float("1.26536") + mean = float("1.07365") + std = float("0.0699137") + data = None + + +class Program_weight_tensor_parameter_100: + name = "parameter_100" + shape = [16, 384] + dtype = "float32" + min_val = float("-0.48256") + max_val = float("0.0350048") + mean = float("7.53469e-05") + std = float("0.0143862") + data = None + + +class Program_weight_tensor_parameter_101: + name = "parameter_101" + shape = [4, 384] + dtype = "float32" + min_val = float("-0.328651") + max_val = float("0.0458783") + mean = float("0.000487203") + std = float("0.0205218") + data = None + + +class Program_weight_tensor_parameter_102: + name = "parameter_102" + shape = [2048, 384] + dtype = "float32" + min_val = float("-0.345758") + max_val = float("0.338922") + mean = float("-6.15521e-06") + std = float("0.024399") + data = None + + +class Program_weight_tensor_parameter_103: + name = "parameter_103" + shape = [40000, 384] + dtype = "float32" + min_val = float("-0.589332") + max_val = float("0.572457") + mean = float("1.23116e-05") + std = float("0.0360502") + data = None diff --git a/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/graph_hash.txt b/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/graph_hash.txt new file mode 100644 index 0000000000..40cc95a2de --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/graph_hash.txt @@ -0,0 +1 @@ +7cc6b608e6de4cbdd01a02eec2e0f7b2944ae5c728d6dd4941dc72ff85c75043 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/graph_net.json b/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/graph_net.json new file mode 100644 index 0000000000..78ab51bd66 --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "rocketqa-nano-cross-encoder", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/input_meta.py b/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/model.py b/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/model.py new file mode 100644 index 0000000000..8f6b209c30 --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/model.py @@ -0,0 +1,1022 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x312xf32) <- (1x21xi64, 40000x312xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_71, 0, False) + del data_0, parameter_71 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0 + + # pd_op.embedding: (1x21x312xf32) <- (1x21xi64, 2048x312xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_70, -1, False) + del parameter_70 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x312xf32) <- (1x21xi64, 4x312xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_69, -1, False) + del data_1, parameter_69 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xi64) <- (1x21xi64, 1xf32) + scale_1 = paddle._C_ops.scale(full_2, full_4, float("0"), True) + del full_2, full_4 + + # pd_op.embedding: (1x21x312xf32) <- (1x21xi64, 16x312xf32) + embedding_3 = paddle._C_ops.embedding(scale_1, parameter_68, -1, False) + del parameter_68 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_2 = paddle._C_ops.add(add_1, embedding_3) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_2, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_5 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_3 = paddle._C_ops.add(matmul_0, parameter_64) + del parameter_64 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 26] + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_4 = paddle._C_ops.add(matmul_1, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_5 = paddle._C_ops.add(matmul_2, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_5, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_6 = paddle._C_ops.full( + [1], float("0.196116"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_6 + + # pd_op.scale: (1x12x21x26xf32) <- (1x12x21x26xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_0, full_6, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x26xf32, 1x12x21x26xf32) + matmul_3 = paddle._C_ops.matmul(scale_2, transpose_1, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_6 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_6, -1) + del add_6 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x26xf32) <- (1x12x21x21xf32, 1x12x21x26xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x12x26xf32) <- (1x12x21x26xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 312] + + # pd_op.reshape: (1x21x312xf32) <- (1x21x12x26xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_7 = paddle._C_ops.add(matmul_5, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_7, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_7 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_8 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_8, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x1248xf32) <- (1x21x312xf32, 312x1248xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x1248xf32) <- (1x21x1248xf32, 1248xf32) + add_9 = paddle._C_ops.add(matmul_6, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x1248xf32) <- (1x21x1248xf32) + gelu_0 = paddle._C_ops.gelu(add_9, False) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x1248xf32, 1248x312xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_10 = paddle._C_ops.add(matmul_7, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_10, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_10 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_11 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_11, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_12 = paddle._C_ops.add(matmul_8, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_13 = paddle._C_ops.add(matmul_9, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_14 = paddle._C_ops.add(matmul_10, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_14, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x21x26xf32) <- (1x12x21x26xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_4, full_6, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x26xf32, 1x12x21x26xf32) + matmul_11 = paddle._C_ops.matmul(scale_3, transpose_5, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_15 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_15, -1) + del add_15 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x26xf32) <- (1x12x21x21xf32, 1x12x21x26xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x12x26xf32) <- (1x12x21x26xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x312xf32) <- (1x21x12x26xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_16 = paddle._C_ops.add(matmul_13, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_16, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_16 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_17 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_17, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x1248xf32) <- (1x21x312xf32, 312x1248xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x1248xf32) <- (1x21x1248xf32, 1248xf32) + add_18 = paddle._C_ops.add(matmul_14, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x1248xf32) <- (1x21x1248xf32) + gelu_1 = paddle._C_ops.gelu(add_18, False) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x1248xf32, 1248x312xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_19 = paddle._C_ops.add(matmul_15, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_19, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_19 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_20 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_20, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_21 = paddle._C_ops.add(matmul_16, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_22 = paddle._C_ops.add(matmul_17, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_23 = paddle._C_ops.add(matmul_18, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_23, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x21x26xf32) <- (1x12x21x26xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_8, full_6, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x26xf32, 1x12x21x26xf32) + matmul_19 = paddle._C_ops.matmul(scale_4, transpose_9, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_24 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_24, -1) + del add_24 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x26xf32) <- (1x12x21x21xf32, 1x12x21x26xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x12x26xf32) <- (1x12x21x26xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x312xf32) <- (1x21x12x26xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_25 = paddle._C_ops.add(matmul_21, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_25, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_25 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_26 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_26, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x1248xf32) <- (1x21x312xf32, 312x1248xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x1248xf32) <- (1x21x1248xf32, 1248xf32) + add_27 = paddle._C_ops.add(matmul_22, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x1248xf32) <- (1x21x1248xf32) + gelu_2 = paddle._C_ops.gelu(add_27, False) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x1248xf32, 1248x312xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_28 = paddle._C_ops.add(matmul_23, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_28, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_28 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_29 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_29, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_30 = paddle._C_ops.add(matmul_24, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_31 = paddle._C_ops.add(matmul_25, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_32 = paddle._C_ops.add(matmul_26, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_32, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x21x26xf32) <- (1x12x21x26xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_12, full_6, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x26xf32, 1x12x21x26xf32) + matmul_27 = paddle._C_ops.matmul(scale_5, transpose_13, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_33 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_33, -1) + del add_33 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x26xf32) <- (1x12x21x21xf32, 1x12x21x26xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x12x26xf32) <- (1x12x21x26xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x312xf32) <- (1x21x12x26xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_34 = paddle._C_ops.add(matmul_29, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_34, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_34 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_35 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_35, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x1248xf32) <- (1x21x312xf32, 312x1248xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x1248xf32) <- (1x21x1248xf32, 1248xf32) + add_36 = paddle._C_ops.add(matmul_30, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x1248xf32) <- (1x21x1248xf32) + gelu_3 = paddle._C_ops.gelu(add_36, False) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x1248xf32, 1248x312xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_37 = paddle._C_ops.add(matmul_31, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_37, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_37 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_38 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_38, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x312xf32) <- (1x21x312xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_24, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x312xf32) <- (1x312xf32, 312x312xf32) + matmul_32 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x312xf32) <- (1x312xf32, 312xf32) + add_39 = paddle._C_ops.add(matmul_32, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x312xf32) <- (1x312xf32) + tanh_0 = paddle._C_ops.tanh(add_39) + del ( + add_0, + add_1, + add_11, + add_12, + add_13, + add_14, + add_17, + add_18, + add_2, + add_20, + add_21, + add_22, + add_23, + add_26, + add_27, + add_29, + add_3, + add_30, + add_31, + add_32, + add_35, + add_36, + add_38, + add_39, + add_4, + add_5, + add_8, + add_9, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_2, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_3, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + embedding_3, + full_5, + full_6, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_3, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + scale_5, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_2, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/weight_meta.py b/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/weight_meta.py new file mode 100644 index 0000000000..a393d10623 --- /dev/null +++ b/paddle_samples/PaddleNLP/rocketqa-nano-cross-encoder/weight_meta.py @@ -0,0 +1,790 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [312] + dtype = "float32" + min_val = float("-0.00479547") + max_val = float("0.00400258") + mean = float("-0.000158366") + std = float("0.00247905") + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.088222") + max_val = float("0.0921753") + mean = float("7.48436e-05") + std = float("0.020055") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [312] + dtype = "float32" + min_val = float("-0.183054") + max_val = float("0.287088") + mean = float("0.101001") + std = float("0.082791") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [312] + dtype = "float32" + min_val = float("0.735205") + max_val = float("1.3233") + mean = float("1.0808") + std = float("0.082471") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [312] + dtype = "float32" + min_val = float("-1.23853") + max_val = float("0.949777") + mean = float("-0.0193186") + std = float("0.145483") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [312] + dtype = "float32" + min_val = float("0.30756") + max_val = float("1.32737") + mean = float("0.672029") + std = float("0.124199") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [312] + dtype = "float32" + min_val = float("-0.146173") + max_val = float("0.145061") + mean = float("0.000706025") + std = float("0.0437121") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [1248, 312] + dtype = "float32" + min_val = float("-1.17109") + max_val = float("1.10195") + mean = float("-7.55707e-05") + std = float("0.0560936") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [1248] + dtype = "float32" + min_val = float("-0.49855") + max_val = float("0.243859") + mean = float("-0.0179523") + std = float("0.0975033") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [312, 1248] + dtype = "float32" + min_val = float("-0.635309") + max_val = float("0.702673") + mean = float("0.00041031") + std = float("0.0544385") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [312] + dtype = "float32" + min_val = float("-0.289823") + max_val = float("0.311676") + mean = float("0.00137907") + std = float("0.094963") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.546431") + max_val = float("0.502278") + mean = float("-1.67867e-05") + std = float("0.0604118") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [312] + dtype = "float32" + min_val = float("-0.16318") + max_val = float("0.158259") + mean = float("0.000635084") + std = float("0.0373608") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.537898") + max_val = float("0.544508") + mean = float("0.00021313") + std = float("0.0656904") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [312] + dtype = "float32" + min_val = float("-0.0137834") + max_val = float("0.00660073") + mean = float("-4.04407e-05") + std = float("0.00215089") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.364371") + max_val = float("0.352519") + mean = float("7.6755e-05") + std = float("0.0603038") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [312] + dtype = "float32" + min_val = float("-0.626562") + max_val = float("0.689976") + mean = float("-0.00375348") + std = float("0.227879") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.378265") + max_val = float("0.435409") + mean = float("0.000127754") + std = float("0.0649497") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [312] + dtype = "float32" + min_val = float("-0.814666") + max_val = float("0.451645") + mean = float("-0.00853634") + std = float("0.0950136") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [312] + dtype = "float32" + min_val = float("0.642988") + max_val = float("1.56878") + mean = float("1.23593") + std = float("0.0958294") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [312] + dtype = "float32" + min_val = float("-1.16759") + max_val = float("1.23421") + mean = float("-0.0217316") + std = float("0.124804") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [312] + dtype = "float32" + min_val = float("0.559871") + max_val = float("1.89353") + mean = float("0.836626") + std = float("0.127864") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [312] + dtype = "float32" + min_val = float("-0.170314") + max_val = float("0.162484") + mean = float("0.000534781") + std = float("0.0487") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [1248, 312] + dtype = "float32" + min_val = float("-0.998469") + max_val = float("1.31093") + mean = float("-5.64941e-05") + std = float("0.0518776") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [1248] + dtype = "float32" + min_val = float("-1.13426") + max_val = float("0.50614") + mean = float("-0.0277825") + std = float("0.119516") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [312, 1248] + dtype = "float32" + min_val = float("-0.468067") + max_val = float("0.581849") + mean = float("0.000229323") + std = float("0.058434") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [312] + dtype = "float32" + min_val = float("-0.369137") + max_val = float("0.304765") + mean = float("-0.000302273") + std = float("0.0911157") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.458449") + max_val = float("0.585965") + mean = float("-3.49427e-05") + std = float("0.0597071") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [312] + dtype = "float32" + min_val = float("-0.253648") + max_val = float("0.223734") + mean = float("-6.84862e-05") + std = float("0.0497449") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.402226") + max_val = float("0.391186") + mean = float("-0.00010579") + std = float("0.0672039") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [312] + dtype = "float32" + min_val = float("-0.00658234") + max_val = float("0.00333842") + mean = float("-0.000103859") + std = float("0.00111649") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.453174") + max_val = float("0.386354") + mean = float("0.000105537") + std = float("0.0638795") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [312] + dtype = "float32" + min_val = float("-0.747493") + max_val = float("0.73584") + mean = float("-0.00918406") + std = float("0.300659") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.459793") + max_val = float("0.53027") + mean = float("-0.000126143") + std = float("0.0660842") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [312] + dtype = "float32" + min_val = float("-0.859702") + max_val = float("0.576336") + mean = float("-0.0115806") + std = float("0.0902255") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [312] + dtype = "float32" + min_val = float("0.816612") + max_val = float("1.52907") + mean = float("1.25301") + std = float("0.104132") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [312] + dtype = "float32" + min_val = float("-1.87028") + max_val = float("1.31034") + mean = float("-0.00508703") + std = float("0.166782") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [312] + dtype = "float32" + min_val = float("0.354404") + max_val = float("2.13449") + mean = float("0.872557") + std = float("0.15518") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [312] + dtype = "float32" + min_val = float("-0.213892") + max_val = float("0.211573") + mean = float("-0.000594571") + std = float("0.0650852") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [1248, 312] + dtype = "float32" + min_val = float("-0.98996") + max_val = float("2.06033") + mean = float("-7.18573e-05") + std = float("0.0542309") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [1248] + dtype = "float32" + min_val = float("-0.914575") + max_val = float("0.499275") + mean = float("-0.056891") + std = float("0.149434") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [312, 1248] + dtype = "float32" + min_val = float("-0.821914") + max_val = float("1.21316") + mean = float("-0.000125267") + std = float("0.0622242") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [312] + dtype = "float32" + min_val = float("-0.3896") + max_val = float("0.3446") + mean = float("-1.31548e-05") + std = float("0.103757") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.832203") + max_val = float("1.05696") + mean = float("8.26985e-05") + std = float("0.0574571") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [312] + dtype = "float32" + min_val = float("-0.353368") + max_val = float("0.320316") + mean = float("0.00355173") + std = float("0.0695191") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.354226") + max_val = float("0.463499") + mean = float("6.12438e-05") + std = float("0.0602674") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [312] + dtype = "float32" + min_val = float("-0.000997939") + max_val = float("0.00142549") + mean = float("3.26551e-06") + std = float("0.000314399") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [312, 312] + dtype = "float32" + min_val = float("-1.60339") + max_val = float("1.20986") + mean = float("1.76226e-05") + std = float("0.0749921") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [312] + dtype = "float32" + min_val = float("-0.761006") + max_val = float("0.945708") + mean = float("-0.00920083") + std = float("0.280033") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [312, 312] + dtype = "float32" + min_val = float("-1.11518") + max_val = float("1.07226") + mean = float("-0.000302265") + std = float("0.0815575") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [312] + dtype = "float32" + min_val = float("-1.17688") + max_val = float("0.856107") + mean = float("-0.00562984") + std = float("0.118262") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [312] + dtype = "float32" + min_val = float("0.726357") + max_val = float("1.63596") + mean = float("1.24321") + std = float("0.122753") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [312] + dtype = "float32" + min_val = float("-2.56271") + max_val = float("2.612") + mean = float("0.000654266") + std = float("0.298215") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [312] + dtype = "float32" + min_val = float("0.107528") + max_val = float("3.30527") + mean = float("0.88028") + std = float("0.166283") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [312] + dtype = "float32" + min_val = float("-0.233425") + max_val = float("0.344696") + mean = float("-0.00276067") + std = float("0.0762085") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [1248, 312] + dtype = "float32" + min_val = float("-0.480039") + max_val = float("4.21929") + mean = float("1.78181e-05") + std = float("0.0510189") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [1248] + dtype = "float32" + min_val = float("-0.732765") + max_val = float("0.532125") + mean = float("-0.0584907") + std = float("0.16941") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [312, 1248] + dtype = "float32" + min_val = float("-1.06724") + max_val = float("1.00677") + mean = float("-0.000682498") + std = float("0.0583726") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [312] + dtype = "float32" + min_val = float("-0.408295") + max_val = float("0.395502") + mean = float("-0.00225698") + std = float("0.132834") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.375388") + max_val = float("0.367523") + mean = float("0.000119823") + std = float("0.05161") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [312] + dtype = "float32" + min_val = float("-0.501686") + max_val = float("0.473463") + mean = float("-0.00619321") + std = float("0.161565") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.29986") + max_val = float("0.330969") + mean = float("-7.48158e-05") + std = float("0.0531702") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [312] + dtype = "float32" + min_val = float("-0.00130328") + max_val = float("0.0010602") + mean = float("-1.82992e-05") + std = float("0.000260097") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [312, 312] + dtype = "float32" + min_val = float("-1.63077") + max_val = float("1.18834") + mean = float("3.16447e-05") + std = float("0.0683102") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [312] + dtype = "float32" + min_val = float("-1.52126") + max_val = float("1.05238") + mean = float("-0.0467981") + std = float("0.407442") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.796733") + max_val = float("0.592093") + mean = float("-9.30815e-05") + std = float("0.0627642") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [312] + dtype = "float32" + min_val = float("-0.969879") + max_val = float("1.2526") + mean = float("-0.0014663") + std = float("0.188677") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [312] + dtype = "float32" + min_val = float("0.637098") + max_val = float("1.33554") + mean = float("1.08684") + std = float("0.086843") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [16, 312] + dtype = "float32" + min_val = float("-0.0943324") + max_val = float("0.0634709") + mean = float("2.69627e-05") + std = float("0.011406") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [4, 312] + dtype = "float32" + min_val = float("-0.0756493") + max_val = float("0.0557366") + mean = float("-0.000514377") + std = float("0.0143762") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [2048, 312] + dtype = "float32" + min_val = float("-0.1679") + max_val = float("0.390725") + mean = float("2.56614e-05") + std = float("0.026501") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [40000, 312] + dtype = "float32" + min_val = float("-0.674808") + max_val = float("0.406728") + mean = float("1.08475e-05") + std = float("0.0370458") + data = None diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/graph_hash.txt b/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/graph_hash.txt new file mode 100644 index 0000000000..91cf302637 --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/graph_hash.txt @@ -0,0 +1 @@ +10743b0d3e0b6bf06a3efa5340af1698b6bd587ee1d20a447186be2c38f8939f \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/graph_net.json b/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/graph_net.json new file mode 100644 index 0000000000..0f0b6c5c65 --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "uer/chinese-roberta-6l-768h", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/input_meta.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/input_meta.py new file mode 100644 index 0000000000..26adb5b74e --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/input_meta.py @@ -0,0 +1,12 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 11] + dtype = "int64" + data = [101, 3614, 6816, 886, 4500, 4636, 2428, 7607, 3444, 106, 102] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 11] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/model.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/model.py new file mode 100644 index 0000000000..b20246dc7a --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/model.py @@ -0,0 +1,1425 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + parameter_72, + parameter_73, + parameter_74, + parameter_75, + parameter_76, + parameter_77, + parameter_78, + parameter_79, + parameter_80, + parameter_81, + parameter_82, + parameter_83, + parameter_84, + parameter_85, + parameter_86, + parameter_87, + parameter_88, + parameter_89, + parameter_90, + parameter_91, + parameter_92, + parameter_93, + parameter_94, + parameter_95, + parameter_96, + parameter_97, + parameter_98, + parameter_99, + parameter_100, + parameter_101, + parameter_102, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x11xb) <- (1x11xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x11xf32) <- (1x11xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x11xf32) <- (1x11xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x11xf32) <- (1x11xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.full: (1xf32) <- () + full_2 = paddle._C_ops.full( + [1], float("1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.full_like: (1x11xi64) <- (1x11xi64, 1xf32) + full_like_0 = paddle._C_ops.full_like( + data_0, full_2, paddle.int64, paddle.framework._current_expected_place() + ) + del full_2 + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("-1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x11xi64) <- (1x11xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_like_0, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x11xi64) <- (1x11xi64, 1x11xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_like_0) + del cumsum_0, full_like_0 + + # pd_op.embedding: (1x11x768xf32) <- (1x11xi64, 21128x768xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_102, -1, False) + del data_0, parameter_102 + + # pd_op.embedding: (1x11x768xf32) <- (1x11xi64, 512x768xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_101, -1, False) + del parameter_101 + + # pd_op.embedding: (1x11x768xf32) <- (1x11xi64, 2x768xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_100, -1, False) + del data_1, parameter_100 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_99, parameter_98, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_98, parameter_99 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_15 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_16 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_17 = full_4 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_97, False, False) + del parameter_97 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_96) + del parameter_96 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 64] + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_95, False, False) + del parameter_95 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_94) + del parameter_94 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_93, False, False) + del parameter_93 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_92) + del parameter_92 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_18 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_19 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_20 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_21 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_22 = full_5 + + # pd_op.scale: (1x12x11x64xf32) <- (1x12x11x64xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x11x11xf32) <- (1x12x11x64xf32, 1x12x11x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x12x11x11xf32) <- (1x12x11x11xf32, 1x1x1x11xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x11x11xf32) <- (1x12x11x11xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x12x11x11xf32, 1x12x11x11xui8) <- (1x12x11x11xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x11x64xf32) <- (1x12x11x11xf32, 1x12x11x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x11x12x64xf32) <- (1x12x11x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 768] + + # pd_op.reshape: (1x11x768xf32) <- (1x11x12x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_91, False, False) + del parameter_91 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_90) + del parameter_90 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_85, parameter_84, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_84, parameter_85 + + # pd_op.matmul: (1x11x3072xf32) <- (1x11x768xf32, 768x3072xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_89, False, False) + del parameter_89 + + # pd_op.add: (1x11x3072xf32) <- (1x11x3072xf32, 3072xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_88) + del parameter_88 + + # pd_op.gelu: (1x11x3072xf32) <- (1x11x3072xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x3072xf32, 3072x768xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_87, False, False) + del parameter_87 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_86) + del parameter_86 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_83, parameter_82, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_82, parameter_83 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_81, False, False) + del parameter_81 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_80) + del parameter_80 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_79, False, False) + del parameter_79 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_78) + del parameter_78 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_77, False, False) + del parameter_77 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_76) + del parameter_76 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x11x64xf32) <- (1x12x11x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x11x11xf32) <- (1x12x11x64xf32, 1x12x11x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x12x11x11xf32) <- (1x12x11x11xf32, 1x1x1x11xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x11x11xf32) <- (1x12x11x11xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x12x11x11xf32, 1x12x11x11xui8) <- (1x12x11x11xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x11x64xf32) <- (1x12x11x11xf32, 1x12x11x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x11x12x64xf32) <- (1x12x11x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x11x768xf32) <- (1x11x12x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_75, False, False) + del parameter_75 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_74) + del parameter_74 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_69, parameter_68, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_68, parameter_69 + + # pd_op.matmul: (1x11x3072xf32) <- (1x11x768xf32, 768x3072xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_73, False, False) + del parameter_73 + + # pd_op.add: (1x11x3072xf32) <- (1x11x3072xf32, 3072xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_72) + del parameter_72 + + # pd_op.gelu: (1x11x3072xf32) <- (1x11x3072xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x3072xf32, 3072x768xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_71, False, False) + del parameter_71 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_70) + del parameter_70 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_64) + del parameter_64 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_20, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_21 = paddle._C_ops.add(matmul_17, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_22 = paddle._C_ops.add(matmul_18, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x11x64xf32) <- (1x12x11x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_8, full_5, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x11x11xf32) <- (1x12x11x64xf32, 1x12x11x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_3, transpose_9, False, True) + + # pd_op.add: (1x12x11x11xf32) <- (1x12x11x11xf32, 1x1x1x11xf32) + add_23 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x11x11xf32) <- (1x12x11x11xf32) + softmax_2 = paddle._C_ops.softmax(add_23, -1) + del add_23 + + # pd_op.dropout: (1x12x11x11xf32, 1x12x11x11xui8) <- (1x12x11x11xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x11x64xf32) <- (1x12x11x11xf32, 1x12x11x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x11x12x64xf32) <- (1x12x11x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x11x768xf32) <- (1x11x12x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_24 = paddle._C_ops.add(matmul_21, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_24, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_24 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_25 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_25, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x11x3072xf32) <- (1x11x768xf32, 768x3072xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x11x3072xf32) <- (1x11x3072xf32, 3072xf32) + add_26 = paddle._C_ops.add(matmul_22, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x11x3072xf32) <- (1x11x3072xf32) + gelu_2 = paddle._C_ops.gelu(add_26, False) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x3072xf32, 3072x768xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_27 = paddle._C_ops.add(matmul_23, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_27, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_27 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_28 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_28, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_29 = paddle._C_ops.add(matmul_24, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_29, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_30 = paddle._C_ops.add(matmul_25, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_31 = paddle._C_ops.add(matmul_26, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x11x64xf32) <- (1x12x11x64xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_12, full_5, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x11x11xf32) <- (1x12x11x64xf32, 1x12x11x64xf32) + matmul_27 = paddle._C_ops.matmul(scale_4, transpose_13, False, True) + + # pd_op.add: (1x12x11x11xf32) <- (1x12x11x11xf32, 1x1x1x11xf32) + add_32 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x11x11xf32) <- (1x12x11x11xf32) + softmax_3 = paddle._C_ops.softmax(add_32, -1) + del add_32 + + # pd_op.dropout: (1x12x11x11xf32, 1x12x11x11xui8) <- (1x12x11x11xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x11x64xf32) <- (1x12x11x11xf32, 1x12x11x64xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x11x12x64xf32) <- (1x12x11x64xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x11x768xf32) <- (1x11x12x64xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_33 = paddle._C_ops.add(matmul_29, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_33, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_33 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_34 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_34, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x11x3072xf32) <- (1x11x768xf32, 768x3072xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x11x3072xf32) <- (1x11x3072xf32, 3072xf32) + add_35 = paddle._C_ops.add(matmul_30, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x11x3072xf32) <- (1x11x3072xf32) + gelu_3 = paddle._C_ops.gelu(add_35, False) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x3072xf32, 3072x768xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_36 = paddle._C_ops.add(matmul_31, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_36, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_36 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_37 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_37, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_32 = paddle._C_ops.matmul(layer_norm_24, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_38 = paddle._C_ops.add(matmul_32, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_16 = paddle._C_ops.reshape(add_38, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_16 = paddle._C_ops.transpose(reshape_16, [0, 2, 1, 3]) + del reshape_16 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_33 = paddle._C_ops.matmul(layer_norm_24, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_39 = paddle._C_ops.add(matmul_33, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_34 = paddle._C_ops.matmul(layer_norm_24, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_40 = paddle._C_ops.add(matmul_34, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_17 = paddle._C_ops.reshape(add_39, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_17 = paddle._C_ops.transpose(reshape_17, [0, 2, 1, 3]) + del reshape_17 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_18 = paddle._C_ops.reshape(add_40, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_18 = paddle._C_ops.transpose(reshape_18, [0, 2, 1, 3]) + del reshape_18 + + # pd_op.scale: (1x12x11x64xf32) <- (1x12x11x64xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_16, full_5, float("0"), True) + del transpose_16 + + # pd_op.matmul: (1x12x11x11xf32) <- (1x12x11x64xf32, 1x12x11x64xf32) + matmul_35 = paddle._C_ops.matmul(scale_5, transpose_17, False, True) + + # pd_op.add: (1x12x11x11xf32) <- (1x12x11x11xf32, 1x1x1x11xf32) + add_41 = paddle._C_ops.add(matmul_35, unsqueeze_0) + + # pd_op.softmax: (1x12x11x11xf32) <- (1x12x11x11xf32) + softmax_4 = paddle._C_ops.softmax(add_41, -1) + del add_41 + + # pd_op.dropout: (1x12x11x11xf32, 1x12x11x11xui8) <- (1x12x11x11xf32, None, 1xf32) + dropout_26, dropout_27 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_4, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x11x64xf32) <- (1x12x11x11xf32, 1x12x11x64xf32) + matmul_36 = paddle._C_ops.matmul(dropout_26, transpose_18, False, False) + + # pd_op.transpose: (1x11x12x64xf32) <- (1x12x11x64xf32) + transpose_19 = paddle._C_ops.transpose(matmul_36, [0, 2, 1, 3]) + del matmul_36 + + # pd_op.reshape: (1x11x768xf32) <- (1x11x12x64xf32, 3xi64) + reshape_19 = paddle._C_ops.reshape(transpose_19, full_int_array_2) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_37 = paddle._C_ops.matmul(reshape_19, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_42 = paddle._C_ops.add(matmul_37, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_28, dropout_29 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_42, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_42 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_43 = paddle._C_ops.add(layer_norm_24, dropout_28) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_27, layer_norm_28, layer_norm_29 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_43, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x11x3072xf32) <- (1x11x768xf32, 768x3072xf32) + matmul_38 = paddle._C_ops.matmul(layer_norm_27, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x11x3072xf32) <- (1x11x3072xf32, 3072xf32) + add_44 = paddle._C_ops.add(matmul_38, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x11x3072xf32) <- (1x11x3072xf32) + gelu_4 = paddle._C_ops.gelu(add_44, False) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x3072xf32, 3072x768xf32) + matmul_39 = paddle._C_ops.matmul(gelu_4, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_45 = paddle._C_ops.add(matmul_39, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_30, dropout_31 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_45, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_45 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_46 = paddle._C_ops.add(layer_norm_27, dropout_30) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_30, layer_norm_31, layer_norm_32 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_46, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_40 = paddle._C_ops.matmul(layer_norm_30, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_47 = paddle._C_ops.add(matmul_40, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_20 = paddle._C_ops.reshape(add_47, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_20 = paddle._C_ops.transpose(reshape_20, [0, 2, 1, 3]) + del reshape_20 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_41 = paddle._C_ops.matmul(layer_norm_30, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_48 = paddle._C_ops.add(matmul_41, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_42 = paddle._C_ops.matmul(layer_norm_30, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_49 = paddle._C_ops.add(matmul_42, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_21 = paddle._C_ops.reshape(add_48, full_int_array_1) + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_21 = paddle._C_ops.transpose(reshape_21, [0, 2, 1, 3]) + del reshape_21 + + # pd_op.reshape: (1x11x12x64xf32) <- (1x11x768xf32, 4xi64) + reshape_22 = paddle._C_ops.reshape(add_49, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x11x64xf32) <- (1x11x12x64xf32) + transpose_22 = paddle._C_ops.transpose(reshape_22, [0, 2, 1, 3]) + del reshape_22 + + # pd_op.scale: (1x12x11x64xf32) <- (1x12x11x64xf32, 1xf32) + scale_6 = paddle._C_ops.scale(transpose_20, full_5, float("0"), True) + del transpose_20 + + # pd_op.matmul: (1x12x11x11xf32) <- (1x12x11x64xf32, 1x12x11x64xf32) + matmul_43 = paddle._C_ops.matmul(scale_6, transpose_21, False, True) + + # pd_op.add: (1x12x11x11xf32) <- (1x12x11x11xf32, 1x1x1x11xf32) + add_50 = paddle._C_ops.add(matmul_43, unsqueeze_0) + + # pd_op.softmax: (1x12x11x11xf32) <- (1x12x11x11xf32) + softmax_5 = paddle._C_ops.softmax(add_50, -1) + del add_50 + + # pd_op.dropout: (1x12x11x11xf32, 1x12x11x11xui8) <- (1x12x11x11xf32, None, 1xf32) + dropout_32, dropout_33 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_5, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x11x64xf32) <- (1x12x11x11xf32, 1x12x11x64xf32) + matmul_44 = paddle._C_ops.matmul(dropout_32, transpose_22, False, False) + + # pd_op.transpose: (1x11x12x64xf32) <- (1x12x11x64xf32) + transpose_23 = paddle._C_ops.transpose(matmul_44, [0, 2, 1, 3]) + del matmul_44 + + # pd_op.reshape: (1x11x768xf32) <- (1x11x12x64xf32, 3xi64) + reshape_23 = paddle._C_ops.reshape(transpose_23, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x11x768xf32) <- (1x11x768xf32, 768x768xf32) + matmul_45 = paddle._C_ops.matmul(reshape_23, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_51 = paddle._C_ops.add(matmul_45, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_34, dropout_35 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_51, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_51 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_52 = paddle._C_ops.add(layer_norm_30, dropout_34) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_33, layer_norm_34, layer_norm_35 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_52, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x11x3072xf32) <- (1x11x768xf32, 768x3072xf32) + matmul_46 = paddle._C_ops.matmul(layer_norm_33, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x11x3072xf32) <- (1x11x3072xf32, 3072xf32) + add_53 = paddle._C_ops.add(matmul_46, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x11x3072xf32) <- (1x11x3072xf32) + gelu_5 = paddle._C_ops.gelu(add_53, False) + + # pd_op.matmul: (1x11x768xf32) <- (1x11x3072xf32, 3072x768xf32) + matmul_47 = paddle._C_ops.matmul(gelu_5, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 768xf32) + add_54 = paddle._C_ops.add(matmul_47, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x11x768xf32, 1x11x768xui8) <- (1x11x768xf32, None, 1xf32) + dropout_36, dropout_37 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_54, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_54 + + # pd_op.add: (1x11x768xf32) <- (1x11x768xf32, 1x11x768xf32) + add_55 = paddle._C_ops.add(layer_norm_33, dropout_36) + + # pd_op.layer_norm: (1x11x768xf32, 1x11xf32, 1x11xf32) <- (1x11x768xf32, 768xf32, 768xf32) + layer_norm_36, layer_norm_37, layer_norm_38 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_55, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x768xf32) <- (1x11x768xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_36, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x768xf32) <- (1x768xf32, 768x768xf32) + matmul_48 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x768xf32) <- (1x768xf32, 768xf32) + add_56 = paddle._C_ops.add(matmul_48, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x768xf32) <- (1x768xf32) + tanh_0 = paddle._C_ops.tanh(add_56) + del ( + add_0, + add_1, + add_10, + add_11, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_21, + add_22, + add_25, + add_26, + add_28, + add_29, + add_3, + add_30, + add_31, + add_34, + add_35, + add_37, + add_38, + add_39, + add_4, + add_40, + add_43, + add_44, + add_46, + add_47, + add_48, + add_49, + add_52, + add_53, + add_55, + add_56, + add_7, + add_8, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_15, + assign_16, + assign_17, + assign_18, + assign_19, + assign_2, + assign_20, + assign_21, + assign_22, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_26, + dropout_27, + dropout_28, + dropout_29, + dropout_3, + dropout_30, + dropout_31, + dropout_32, + dropout_33, + dropout_34, + dropout_35, + dropout_36, + dropout_37, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + gelu_4, + gelu_5, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_27, + layer_norm_28, + layer_norm_29, + layer_norm_3, + layer_norm_30, + layer_norm_31, + layer_norm_32, + layer_norm_33, + layer_norm_34, + layer_norm_35, + layer_norm_36, + layer_norm_37, + layer_norm_38, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_33, + matmul_34, + matmul_35, + matmul_37, + matmul_38, + matmul_39, + matmul_40, + matmul_41, + matmul_42, + matmul_43, + matmul_45, + matmul_46, + matmul_47, + matmul_48, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_19, + reshape_23, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + scale_5, + scale_6, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + softmax_4, + softmax_5, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_17, + transpose_18, + transpose_19, + transpose_2, + transpose_21, + transpose_22, + transpose_23, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/weight_meta.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/weight_meta.py new file mode 100644 index 0000000000..2c96dd64de --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-6l-768h/weight_meta.py @@ -0,0 +1,1127 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [768] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.0951101") + max_val = float("0.0915065") + mean = float("-4.08452e-06") + std = float("0.0200228") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [768] + dtype = "float32" + min_val = float("-0.187084") + max_val = float("0.236171") + mean = float("0.0108069") + std = float("0.0730651") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [768] + dtype = "float32" + min_val = float("0.26898") + max_val = float("0.835685") + mean = float("0.758951") + std = float("0.0252431") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [768] + dtype = "float32" + min_val = float("-0.530898") + max_val = float("1.77794") + mean = float("0.0292736") + std = float("0.0784804") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [768] + dtype = "float32" + min_val = float("0.403284") + max_val = float("1.13862") + mean = float("0.801365") + std = float("0.0319886") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [768] + dtype = "float32" + min_val = float("-0.215315") + max_val = float("1.35161") + mean = float("0.000893812") + std = float("0.095905") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [3072, 768] + dtype = "float32" + min_val = float("-0.73654") + max_val = float("0.624639") + mean = float("4.64862e-06") + std = float("0.0428148") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [3072] + dtype = "float32" + min_val = float("-0.358415") + max_val = float("0.328635") + mean = float("-0.0362511") + std = float("0.0385331") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.955464") + max_val = float("0.297099") + mean = float("0.00034511") + std = float("0.0423272") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [768] + dtype = "float32" + min_val = float("-0.95753") + max_val = float("0.348268") + mean = float("-0.00161196") + std = float("0.129909") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.683759") + max_val = float("0.584564") + mean = float("-1.13607e-05") + std = float("0.0408312") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [768] + dtype = "float32" + min_val = float("-0.164753") + max_val = float("0.171064") + mean = float("0.00168807") + std = float("0.0531337") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.291091") + max_val = float("0.277365") + mean = float("2.03826e-05") + std = float("0.0460566") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [768] + dtype = "float32" + min_val = float("-0.0576338") + max_val = float("0.0686215") + mean = float("0.000692104") + std = float("0.0190491") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.630624") + max_val = float("0.506957") + mean = float("-3.58379e-05") + std = float("0.0603951") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [768] + dtype = "float32" + min_val = float("-0.296514") + max_val = float("0.448602") + mean = float("0.00304451") + std = float("0.09327") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.314816") + max_val = float("0.34188") + mean = float("7.0897e-05") + std = float("0.0645287") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [768] + dtype = "float32" + min_val = float("-0.385683") + max_val = float("1.96503") + mean = float("0.0409484") + std = float("0.0862538") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [768] + dtype = "float32" + min_val = float("0.297531") + max_val = float("1.37019") + mean = float("0.950849") + std = float("0.0375915") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [768] + dtype = "float32" + min_val = float("-0.421618") + max_val = float("1.82839") + mean = float("0.0234088") + std = float("0.107333") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [768] + dtype = "float32" + min_val = float("0.680425") + max_val = float("2.38872") + mean = float("0.807613") + std = float("0.0891971") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [768] + dtype = "float32" + min_val = float("-0.370016") + max_val = float("1.84701") + mean = float("0.000854585") + std = float("0.101645") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.46853") + max_val = float("4.4509") + mean = float("1.68839e-05") + std = float("0.0433756") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [3072] + dtype = "float32" + min_val = float("-0.280125") + max_val = float("0.35627") + mean = float("-0.046208") + std = float("0.0480415") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [768, 3072] + dtype = "float32" + min_val = float("-1.04428") + max_val = float("0.324276") + mean = float("0.000130322") + std = float("0.0424783") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [768] + dtype = "float32" + min_val = float("-0.829473") + max_val = float("0.279158") + mean = float("-0.00047798") + std = float("0.0782974") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.545803") + max_val = float("0.480783") + mean = float("5.79912e-06") + std = float("0.0343805") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [768] + dtype = "float32" + min_val = float("-0.293513") + max_val = float("0.254092") + mean = float("0.00397948") + std = float("0.0555737") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.23478") + max_val = float("0.226955") + mean = float("8.41382e-05") + std = float("0.0372403") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [768] + dtype = "float32" + min_val = float("-0.0677966") + max_val = float("0.0576298") + mean = float("-1.63782e-05") + std = float("0.0198951") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.321371") + max_val = float("0.418273") + mean = float("3.52578e-05") + std = float("0.0573731") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [768] + dtype = "float32" + min_val = float("-0.338944") + max_val = float("0.327787") + mean = float("-0.00167364") + std = float("0.094716") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.318707") + max_val = float("0.330479") + mean = float("-7.95397e-05") + std = float("0.061164") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [768] + dtype = "float32" + min_val = float("-0.220979") + max_val = float("1.86057") + mean = float("0.03518") + std = float("0.0782147") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [768] + dtype = "float32" + min_val = float("0.378974") + max_val = float("1.26597") + mean = float("0.9229") + std = float("0.045048") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [768] + dtype = "float32" + min_val = float("-0.392688") + max_val = float("1.90904") + mean = float("0.0196212") + std = float("0.122604") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [768] + dtype = "float32" + min_val = float("0.6406") + max_val = float("1.4316") + mean = float("0.813585") + std = float("0.0508038") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [768] + dtype = "float32" + min_val = float("-0.436666") + max_val = float("1.26454") + mean = float("0.000909787") + std = float("0.103688") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.69486") + max_val = float("3.02931") + mean = float("1.49e-05") + std = float("0.0424761") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [3072] + dtype = "float32" + min_val = float("-0.346112") + max_val = float("0.279668") + mean = float("-0.0470719") + std = float("0.0605532") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.991625") + max_val = float("0.981052") + mean = float("0.000290659") + std = float("0.0449119") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [768] + dtype = "float32" + min_val = float("-0.572166") + max_val = float("0.204316") + mean = float("0.000615664") + std = float("0.0726012") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.208274") + max_val = float("0.303141") + mean = float("3.53884e-06") + std = float("0.0305677") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [768] + dtype = "float32" + min_val = float("-0.159667") + max_val = float("0.216779") + mean = float("-0.00142718") + std = float("0.0401194") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.192151") + max_val = float("0.191176") + mean = float("-0.000106805") + std = float("0.0332221") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [768] + dtype = "float32" + min_val = float("-0.0663306") + max_val = float("0.0653055") + mean = float("0.000123884") + std = float("0.0193474") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.40328") + max_val = float("0.423238") + mean = float("-1.28125e-05") + std = float("0.0603932") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [768] + dtype = "float32" + min_val = float("-0.2478") + max_val = float("0.278904") + mean = float("-0.00134516") + std = float("0.0720277") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.348154") + max_val = float("0.386852") + mean = float("-2.51627e-05") + std = float("0.0636683") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [768] + dtype = "float32" + min_val = float("-0.267356") + max_val = float("1.49331") + mean = float("0.0295651") + std = float("0.0711877") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [768] + dtype = "float32" + min_val = float("0.411278") + max_val = float("1.08315") + mean = float("0.970837") + std = float("0.0424521") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [768] + dtype = "float32" + min_val = float("-0.347462") + max_val = float("1.98716") + mean = float("0.0157312") + std = float("0.111181") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [768] + dtype = "float32" + min_val = float("0.585677") + max_val = float("1.90405") + mean = float("0.787174") + std = float("0.0638697") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [768] + dtype = "float32" + min_val = float("-0.2102") + max_val = float("0.75658") + mean = float("0.000296162") + std = float("0.0790682") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.50857") + max_val = float("2.30455") + mean = float("5.93061e-06") + std = float("0.0412044") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [3072] + dtype = "float32" + min_val = float("-0.47881") + max_val = float("0.343536") + mean = float("-0.0490502") + std = float("0.0635711") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.496444") + max_val = float("0.294387") + mean = float("0.000203136") + std = float("0.0438971") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [768] + dtype = "float32" + min_val = float("-0.242585") + max_val = float("0.21969") + mean = float("-0.000451162") + std = float("0.0729275") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.559738") + max_val = float("0.396764") + mean = float("8.88675e-08") + std = float("0.0323631") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [768] + dtype = "float32" + min_val = float("-0.140477") + max_val = float("0.130961") + mean = float("-0.00201887") + std = float("0.0369291") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.192576") + max_val = float("0.205121") + mean = float("-1.79898e-05") + std = float("0.0352589") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [768] + dtype = "float32" + min_val = float("-0.0571848") + max_val = float("0.0761802") + mean = float("0.000368802") + std = float("0.0197944") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.345457") + max_val = float("0.379898") + mean = float("-6.13561e-05") + std = float("0.0562462") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [768] + dtype = "float32" + min_val = float("-0.518371") + max_val = float("0.66305") + mean = float("0.0018515") + std = float("0.124264") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.320824") + max_val = float("0.302078") + mean = float("4.58569e-05") + std = float("0.0571292") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [768] + dtype = "float32" + min_val = float("-0.38677") + max_val = float("1.31462") + mean = float("0.0306895") + std = float("0.0768263") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [768] + dtype = "float32" + min_val = float("0.36269") + max_val = float("1.04182") + mean = float("0.928695") + std = float("0.0487138") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [768] + dtype = "float32" + min_val = float("-0.607248") + max_val = float("2.84609") + mean = float("0.0106134") + std = float("0.144464") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [768] + dtype = "float32" + min_val = float("0.588881") + max_val = float("2.24268") + mean = float("0.760834") + std = float("0.0700509") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [768] + dtype = "float32" + min_val = float("-0.255233") + max_val = float("0.255257") + mean = float("0.00065136") + std = float("0.0743329") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [3072, 768] + dtype = "float32" + min_val = float("-0.783864") + max_val = float("2.14067") + mean = float("1.23391e-05") + std = float("0.0419355") + data = None + + +class Program_weight_tensor_parameter_72: + name = "parameter_72" + shape = [3072] + dtype = "float32" + min_val = float("-0.402162") + max_val = float("0.520077") + mean = float("-0.0511108") + std = float("0.0636129") + data = None + + +class Program_weight_tensor_parameter_73: + name = "parameter_73" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.319895") + max_val = float("0.403205") + mean = float("0.000222389") + std = float("0.0435321") + data = None + + +class Program_weight_tensor_parameter_74: + name = "parameter_74" + shape = [768] + dtype = "float32" + min_val = float("-0.286014") + max_val = float("0.274193") + mean = float("-0.00104592") + std = float("0.092887") + data = None + + +class Program_weight_tensor_parameter_75: + name = "parameter_75" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.450298") + max_val = float("0.494805") + mean = float("1.24658e-05") + std = float("0.0345501") + data = None + + +class Program_weight_tensor_parameter_76: + name = "parameter_76" + shape = [768] + dtype = "float32" + min_val = float("-0.206361") + max_val = float("0.158086") + mean = float("-0.000613094") + std = float("0.0387539") + data = None + + +class Program_weight_tensor_parameter_77: + name = "parameter_77" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.307917") + max_val = float("0.273593") + mean = float("-9.95247e-05") + std = float("0.0366367") + data = None + + +class Program_weight_tensor_parameter_78: + name = "parameter_78" + shape = [768] + dtype = "float32" + min_val = float("-0.063749") + max_val = float("0.0579999") + mean = float("-0.00119321") + std = float("0.0200192") + data = None + + +class Program_weight_tensor_parameter_79: + name = "parameter_79" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.370335") + max_val = float("0.384862") + mean = float("-9.32044e-05") + std = float("0.0521292") + data = None + + +class Program_weight_tensor_parameter_80: + name = "parameter_80" + shape = [768] + dtype = "float32" + min_val = float("-0.824785") + max_val = float("0.982521") + mean = float("0.0163023") + std = float("0.189771") + data = None + + +class Program_weight_tensor_parameter_81: + name = "parameter_81" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.331837") + max_val = float("0.317677") + mean = float("0.000372827") + std = float("0.0522474") + data = None + + +class Program_weight_tensor_parameter_82: + name = "parameter_82" + shape = [768] + dtype = "float32" + min_val = float("-0.448862") + max_val = float("2.65113") + mean = float("0.0419053") + std = float("0.114875") + data = None + + +class Program_weight_tensor_parameter_83: + name = "parameter_83" + shape = [768] + dtype = "float32" + min_val = float("0.185339") + max_val = float("0.869487") + mean = float("0.77751") + std = float("0.0507769") + data = None + + +class Program_weight_tensor_parameter_84: + name = "parameter_84" + shape = [768] + dtype = "float32" + min_val = float("-1.07897") + max_val = float("4.20848") + mean = float("0.00538466") + std = float("0.230401") + data = None + + +class Program_weight_tensor_parameter_85: + name = "parameter_85" + shape = [768] + dtype = "float32" + min_val = float("0.552525") + max_val = float("2.47245") + mean = float("0.754071") + std = float("0.0902793") + data = None + + +class Program_weight_tensor_parameter_86: + name = "parameter_86" + shape = [768] + dtype = "float32" + min_val = float("-0.454262") + max_val = float("0.378935") + mean = float("-9.2226e-05") + std = float("0.0892891") + data = None + + +class Program_weight_tensor_parameter_87: + name = "parameter_87" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.37155") + max_val = float("2.16909") + mean = float("4.74612e-05") + std = float("0.0439463") + data = None + + +class Program_weight_tensor_parameter_88: + name = "parameter_88" + shape = [3072] + dtype = "float32" + min_val = float("-0.369663") + max_val = float("0.418732") + mean = float("-0.0670956") + std = float("0.047969") + data = None + + +class Program_weight_tensor_parameter_89: + name = "parameter_89" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.345269") + max_val = float("0.320551") + mean = float("0.000170815") + std = float("0.0437325") + data = None + + +class Program_weight_tensor_parameter_90: + name = "parameter_90" + shape = [768] + dtype = "float32" + min_val = float("-0.288463") + max_val = float("0.267296") + mean = float("-0.00131051") + std = float("0.0740263") + data = None + + +class Program_weight_tensor_parameter_91: + name = "parameter_91" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.692054") + max_val = float("0.617643") + mean = float("1.3278e-05") + std = float("0.0350961") + data = None + + +class Program_weight_tensor_parameter_92: + name = "parameter_92" + shape = [768] + dtype = "float32" + min_val = float("-0.59354") + max_val = float("0.401988") + mean = float("-0.00132442") + std = float("0.0746097") + data = None + + +class Program_weight_tensor_parameter_93: + name = "parameter_93" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.21896") + max_val = float("0.436242") + mean = float("-1.8892e-05") + std = float("0.0334871") + data = None + + +class Program_weight_tensor_parameter_94: + name = "parameter_94" + shape = [768] + dtype = "float32" + min_val = float("-0.084057") + max_val = float("0.0598119") + mean = float("0.00017175") + std = float("0.0201233") + data = None + + +class Program_weight_tensor_parameter_95: + name = "parameter_95" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.303294") + max_val = float("0.309711") + mean = float("6.33029e-05") + std = float("0.0525814") + data = None + + +class Program_weight_tensor_parameter_96: + name = "parameter_96" + shape = [768] + dtype = "float32" + min_val = float("-1.12167") + max_val = float("0.876916") + mean = float("-0.00649356") + std = float("0.287089") + data = None + + +class Program_weight_tensor_parameter_97: + name = "parameter_97" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.402038") + max_val = float("0.285918") + mean = float("6.29628e-06") + std = float("0.0513321") + data = None + + +class Program_weight_tensor_parameter_98: + name = "parameter_98" + shape = [768] + dtype = "float32" + min_val = float("-2.57634") + max_val = float("0.333213") + mean = float("0.0167901") + std = float("0.110267") + data = None + + +class Program_weight_tensor_parameter_99: + name = "parameter_99" + shape = [768] + dtype = "float32" + min_val = float("0.281089") + max_val = float("0.871686") + mean = float("0.76844") + std = float("0.0767907") + data = None + + +class Program_weight_tensor_parameter_100: + name = "parameter_100" + shape = [2, 768] + dtype = "float32" + min_val = float("-0.119814") + max_val = float("1.45921") + mean = float("0.000485793") + std = float("0.0408825") + data = None + + +class Program_weight_tensor_parameter_101: + name = "parameter_101" + shape = [512, 768] + dtype = "float32" + min_val = float("-0.174722") + max_val = float("0.22605") + mean = float("1.75719e-05") + std = float("0.0281067") + data = None + + +class Program_weight_tensor_parameter_102: + name = "parameter_102" + shape = [21128, 768] + dtype = "float32" + min_val = float("-0.769607") + max_val = float("0.969094") + mean = float("-0.00734891") + std = float("0.0611776") + data = None diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/graph_hash.txt b/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/graph_hash.txt new file mode 100644 index 0000000000..66792f1b8f --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/graph_hash.txt @@ -0,0 +1 @@ +502c06bb696ef061b972e5bf35280fea35704699d04c7fe9ceb4bb6e4cff329f \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/graph_net.json b/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/graph_net.json new file mode 100644 index 0000000000..5ccd5d6631 --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "uer/chinese-roberta-medium", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/input_meta.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/input_meta.py new file mode 100644 index 0000000000..26adb5b74e --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/input_meta.py @@ -0,0 +1,12 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 11] + dtype = "int64" + data = [101, 3614, 6816, 886, 4500, 4636, 2428, 7607, 3444, 106, 102] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 11] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/model.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/model.py new file mode 100644 index 0000000000..cf1eca510b --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/model.py @@ -0,0 +1,1845 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + parameter_72, + parameter_73, + parameter_74, + parameter_75, + parameter_76, + parameter_77, + parameter_78, + parameter_79, + parameter_80, + parameter_81, + parameter_82, + parameter_83, + parameter_84, + parameter_85, + parameter_86, + parameter_87, + parameter_88, + parameter_89, + parameter_90, + parameter_91, + parameter_92, + parameter_93, + parameter_94, + parameter_95, + parameter_96, + parameter_97, + parameter_98, + parameter_99, + parameter_100, + parameter_101, + parameter_102, + parameter_103, + parameter_104, + parameter_105, + parameter_106, + parameter_107, + parameter_108, + parameter_109, + parameter_110, + parameter_111, + parameter_112, + parameter_113, + parameter_114, + parameter_115, + parameter_116, + parameter_117, + parameter_118, + parameter_119, + parameter_120, + parameter_121, + parameter_122, + parameter_123, + parameter_124, + parameter_125, + parameter_126, + parameter_127, + parameter_128, + parameter_129, + parameter_130, + parameter_131, + parameter_132, + parameter_133, + parameter_134, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x11xb) <- (1x11xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x11xf32) <- (1x11xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x11xf32) <- (1x11xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x11xf32) <- (1x11xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.full: (1xf32) <- () + full_2 = paddle._C_ops.full( + [1], float("1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.full_like: (1x11xi64) <- (1x11xi64, 1xf32) + full_like_0 = paddle._C_ops.full_like( + data_0, full_2, paddle.int64, paddle.framework._current_expected_place() + ) + del full_2 + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("-1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x11xi64) <- (1x11xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_like_0, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x11xi64) <- (1x11xi64, 1x11xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_like_0) + del cumsum_0, full_like_0 + + # pd_op.embedding: (1x11x512xf32) <- (1x11xi64, 21128x512xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_134, -1, False) + del data_0, parameter_134 + + # pd_op.embedding: (1x11x512xf32) <- (1x11xi64, 512x512xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_133, -1, False) + del parameter_133 + + # pd_op.embedding: (1x11x512xf32) <- (1x11xi64, 2x512xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_132, -1, False) + del data_1, parameter_132 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_131, parameter_130, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_130, parameter_131 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_15 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_16 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_17 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_18 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_19 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_20 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_21 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_22 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_23 = full_4 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_129, False, False) + del parameter_129 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_128) + del parameter_128 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 8, 64] + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_127, False, False) + del parameter_127 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_126) + del parameter_126 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_125, False, False) + del parameter_125 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_124) + del parameter_124 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_24 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_25 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_26 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_27 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_28 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_29 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_30 = full_5 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 512] + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_123, False, False) + del parameter_123 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_122) + del parameter_122 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_117, parameter_116, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_116, parameter_117 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_121, False, False) + del parameter_121 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_120) + del parameter_120 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_119, False, False) + del parameter_119 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_118) + del parameter_118 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_115, parameter_114, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_114, parameter_115 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_113, False, False) + del parameter_113 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_112) + del parameter_112 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_111, False, False) + del parameter_111 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_110) + del parameter_110 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_109, False, False) + del parameter_109 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_108) + del parameter_108 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_107, False, False) + del parameter_107 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_106) + del parameter_106 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_101, parameter_100, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_100, parameter_101 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_105, False, False) + del parameter_105 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_104) + del parameter_104 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_103, False, False) + del parameter_103 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_102) + del parameter_102 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_99, parameter_98, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_98, parameter_99 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_97, False, False) + del parameter_97 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_96) + del parameter_96 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_20, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_95, False, False) + del parameter_95 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_21 = paddle._C_ops.add(matmul_17, parameter_94) + del parameter_94 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_93, False, False) + del parameter_93 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_22 = paddle._C_ops.add(matmul_18, parameter_92) + del parameter_92 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_8, full_5, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_3, transpose_9, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_23 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_2 = paddle._C_ops.softmax(add_23, -1) + del add_23 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_91, False, False) + del parameter_91 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_24 = paddle._C_ops.add(matmul_21, parameter_90) + del parameter_90 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_24, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_24 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_25 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_25, parameter_85, parameter_84, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_84, parameter_85 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_89, False, False) + del parameter_89 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_26 = paddle._C_ops.add(matmul_22, parameter_88) + del parameter_88 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_2 = paddle._C_ops.gelu(add_26, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_87, False, False) + del parameter_87 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_27 = paddle._C_ops.add(matmul_23, parameter_86) + del parameter_86 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_27, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_27 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_28 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_28, parameter_83, parameter_82, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_82, parameter_83 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_81, False, False) + del parameter_81 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_29 = paddle._C_ops.add(matmul_24, parameter_80) + del parameter_80 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_29, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_79, False, False) + del parameter_79 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_30 = paddle._C_ops.add(matmul_25, parameter_78) + del parameter_78 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_77, False, False) + del parameter_77 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_31 = paddle._C_ops.add(matmul_26, parameter_76) + del parameter_76 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_12, full_5, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_27 = paddle._C_ops.matmul(scale_4, transpose_13, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_32 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_3 = paddle._C_ops.softmax(add_32, -1) + del add_32 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_75, False, False) + del parameter_75 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_33 = paddle._C_ops.add(matmul_29, parameter_74) + del parameter_74 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_33, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_33 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_34 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_34, parameter_69, parameter_68, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_68, parameter_69 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_73, False, False) + del parameter_73 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_35 = paddle._C_ops.add(matmul_30, parameter_72) + del parameter_72 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_3 = paddle._C_ops.gelu(add_35, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_71, False, False) + del parameter_71 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_36 = paddle._C_ops.add(matmul_31, parameter_70) + del parameter_70 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_36, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_36 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_37 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_37, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_32 = paddle._C_ops.matmul(layer_norm_24, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_38 = paddle._C_ops.add(matmul_32, parameter_64) + del parameter_64 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_16 = paddle._C_ops.reshape(add_38, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_16 = paddle._C_ops.transpose(reshape_16, [0, 2, 1, 3]) + del reshape_16 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_33 = paddle._C_ops.matmul(layer_norm_24, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_39 = paddle._C_ops.add(matmul_33, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_34 = paddle._C_ops.matmul(layer_norm_24, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_40 = paddle._C_ops.add(matmul_34, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_17 = paddle._C_ops.reshape(add_39, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_17 = paddle._C_ops.transpose(reshape_17, [0, 2, 1, 3]) + del reshape_17 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_18 = paddle._C_ops.reshape(add_40, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_18 = paddle._C_ops.transpose(reshape_18, [0, 2, 1, 3]) + del reshape_18 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_16, full_5, float("0"), True) + del transpose_16 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_35 = paddle._C_ops.matmul(scale_5, transpose_17, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_41 = paddle._C_ops.add(matmul_35, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_4 = paddle._C_ops.softmax(add_41, -1) + del add_41 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_26, dropout_27 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_4, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_36 = paddle._C_ops.matmul(dropout_26, transpose_18, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_19 = paddle._C_ops.transpose(matmul_36, [0, 2, 1, 3]) + del matmul_36 + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_19 = paddle._C_ops.reshape(transpose_19, full_int_array_2) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_37 = paddle._C_ops.matmul(reshape_19, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_42 = paddle._C_ops.add(matmul_37, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_28, dropout_29 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_42, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_42 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_43 = paddle._C_ops.add(layer_norm_24, dropout_28) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_27, layer_norm_28, layer_norm_29 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_43, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_38 = paddle._C_ops.matmul(layer_norm_27, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_44 = paddle._C_ops.add(matmul_38, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_4 = paddle._C_ops.gelu(add_44, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_39 = paddle._C_ops.matmul(gelu_4, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_45 = paddle._C_ops.add(matmul_39, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_30, dropout_31 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_45, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_45 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_46 = paddle._C_ops.add(layer_norm_27, dropout_30) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_30, layer_norm_31, layer_norm_32 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_46, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_40 = paddle._C_ops.matmul(layer_norm_30, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_47 = paddle._C_ops.add(matmul_40, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_20 = paddle._C_ops.reshape(add_47, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_20 = paddle._C_ops.transpose(reshape_20, [0, 2, 1, 3]) + del reshape_20 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_41 = paddle._C_ops.matmul(layer_norm_30, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_48 = paddle._C_ops.add(matmul_41, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_42 = paddle._C_ops.matmul(layer_norm_30, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_49 = paddle._C_ops.add(matmul_42, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_21 = paddle._C_ops.reshape(add_48, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_21 = paddle._C_ops.transpose(reshape_21, [0, 2, 1, 3]) + del reshape_21 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_22 = paddle._C_ops.reshape(add_49, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_22 = paddle._C_ops.transpose(reshape_22, [0, 2, 1, 3]) + del reshape_22 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_6 = paddle._C_ops.scale(transpose_20, full_5, float("0"), True) + del transpose_20 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_43 = paddle._C_ops.matmul(scale_6, transpose_21, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_50 = paddle._C_ops.add(matmul_43, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_5 = paddle._C_ops.softmax(add_50, -1) + del add_50 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_32, dropout_33 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_5, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_44 = paddle._C_ops.matmul(dropout_32, transpose_22, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_23 = paddle._C_ops.transpose(matmul_44, [0, 2, 1, 3]) + del matmul_44 + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_23 = paddle._C_ops.reshape(transpose_23, full_int_array_2) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_45 = paddle._C_ops.matmul(reshape_23, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_51 = paddle._C_ops.add(matmul_45, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_34, dropout_35 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_51, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_51 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_52 = paddle._C_ops.add(layer_norm_30, dropout_34) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_33, layer_norm_34, layer_norm_35 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_52, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_46 = paddle._C_ops.matmul(layer_norm_33, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_53 = paddle._C_ops.add(matmul_46, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_5 = paddle._C_ops.gelu(add_53, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_47 = paddle._C_ops.matmul(gelu_5, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_54 = paddle._C_ops.add(matmul_47, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_36, dropout_37 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_54, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_54 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_55 = paddle._C_ops.add(layer_norm_33, dropout_36) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_36, layer_norm_37, layer_norm_38 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_55, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_48 = paddle._C_ops.matmul(layer_norm_36, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_56 = paddle._C_ops.add(matmul_48, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_24 = paddle._C_ops.reshape(add_56, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_24 = paddle._C_ops.transpose(reshape_24, [0, 2, 1, 3]) + del reshape_24 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_49 = paddle._C_ops.matmul(layer_norm_36, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_57 = paddle._C_ops.add(matmul_49, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_50 = paddle._C_ops.matmul(layer_norm_36, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_58 = paddle._C_ops.add(matmul_50, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_25 = paddle._C_ops.reshape(add_57, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_25 = paddle._C_ops.transpose(reshape_25, [0, 2, 1, 3]) + del reshape_25 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_26 = paddle._C_ops.reshape(add_58, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_26 = paddle._C_ops.transpose(reshape_26, [0, 2, 1, 3]) + del reshape_26 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_7 = paddle._C_ops.scale(transpose_24, full_5, float("0"), True) + del transpose_24 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_51 = paddle._C_ops.matmul(scale_7, transpose_25, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_59 = paddle._C_ops.add(matmul_51, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_6 = paddle._C_ops.softmax(add_59, -1) + del add_59 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_38, dropout_39 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_52 = paddle._C_ops.matmul(dropout_38, transpose_26, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_27 = paddle._C_ops.transpose(matmul_52, [0, 2, 1, 3]) + del matmul_52 + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_27 = paddle._C_ops.reshape(transpose_27, full_int_array_2) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_53 = paddle._C_ops.matmul(reshape_27, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_60 = paddle._C_ops.add(matmul_53, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_40, dropout_41 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_60, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_60 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_61 = paddle._C_ops.add(layer_norm_36, dropout_40) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_39, layer_norm_40, layer_norm_41 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_61, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_54 = paddle._C_ops.matmul(layer_norm_39, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_62 = paddle._C_ops.add(matmul_54, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_6 = paddle._C_ops.gelu(add_62, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_55 = paddle._C_ops.matmul(gelu_6, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_63 = paddle._C_ops.add(matmul_55, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_42, dropout_43 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_63, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_63 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_64 = paddle._C_ops.add(layer_norm_39, dropout_42) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_42, layer_norm_43, layer_norm_44 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_64, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_56 = paddle._C_ops.matmul(layer_norm_42, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_65 = paddle._C_ops.add(matmul_56, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_28 = paddle._C_ops.reshape(add_65, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_28 = paddle._C_ops.transpose(reshape_28, [0, 2, 1, 3]) + del reshape_28 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_57 = paddle._C_ops.matmul(layer_norm_42, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_66 = paddle._C_ops.add(matmul_57, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_58 = paddle._C_ops.matmul(layer_norm_42, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_67 = paddle._C_ops.add(matmul_58, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_29 = paddle._C_ops.reshape(add_66, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_29 = paddle._C_ops.transpose(reshape_29, [0, 2, 1, 3]) + del reshape_29 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_30 = paddle._C_ops.reshape(add_67, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_30 = paddle._C_ops.transpose(reshape_30, [0, 2, 1, 3]) + del reshape_30 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_8 = paddle._C_ops.scale(transpose_28, full_5, float("0"), True) + del transpose_28 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_59 = paddle._C_ops.matmul(scale_8, transpose_29, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_68 = paddle._C_ops.add(matmul_59, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_7 = paddle._C_ops.softmax(add_68, -1) + del add_68 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_44, dropout_45 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_7, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_60 = paddle._C_ops.matmul(dropout_44, transpose_30, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_31 = paddle._C_ops.transpose(matmul_60, [0, 2, 1, 3]) + del matmul_60 + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_31 = paddle._C_ops.reshape(transpose_31, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_61 = paddle._C_ops.matmul(reshape_31, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_69 = paddle._C_ops.add(matmul_61, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_46, dropout_47 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_69, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_69 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_70 = paddle._C_ops.add(layer_norm_42, dropout_46) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_45, layer_norm_46, layer_norm_47 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_70, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_62 = paddle._C_ops.matmul(layer_norm_45, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_71 = paddle._C_ops.add(matmul_62, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_7 = paddle._C_ops.gelu(add_71, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_63 = paddle._C_ops.matmul(gelu_7, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_72 = paddle._C_ops.add(matmul_63, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_48, dropout_49 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_72, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_72 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_73 = paddle._C_ops.add(layer_norm_45, dropout_48) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_48, layer_norm_49, layer_norm_50 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_73, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x512xf32) <- (1x11x512xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_48, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x512xf32) <- (1x512xf32, 512x512xf32) + matmul_64 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x512xf32) <- (1x512xf32, 512xf32) + add_74 = paddle._C_ops.add(matmul_64, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x512xf32) <- (1x512xf32) + tanh_0 = paddle._C_ops.tanh(add_74) + del ( + add_0, + add_1, + add_10, + add_11, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_21, + add_22, + add_25, + add_26, + add_28, + add_29, + add_3, + add_30, + add_31, + add_34, + add_35, + add_37, + add_38, + add_39, + add_4, + add_40, + add_43, + add_44, + add_46, + add_47, + add_48, + add_49, + add_52, + add_53, + add_55, + add_56, + add_57, + add_58, + add_61, + add_62, + add_64, + add_65, + add_66, + add_67, + add_7, + add_70, + add_71, + add_73, + add_74, + add_8, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_15, + assign_16, + assign_17, + assign_18, + assign_19, + assign_2, + assign_20, + assign_21, + assign_22, + assign_23, + assign_24, + assign_25, + assign_26, + assign_27, + assign_28, + assign_29, + assign_3, + assign_30, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_26, + dropout_27, + dropout_28, + dropout_29, + dropout_3, + dropout_30, + dropout_31, + dropout_32, + dropout_33, + dropout_34, + dropout_35, + dropout_36, + dropout_37, + dropout_38, + dropout_39, + dropout_4, + dropout_40, + dropout_41, + dropout_42, + dropout_43, + dropout_44, + dropout_45, + dropout_46, + dropout_47, + dropout_48, + dropout_49, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + gelu_4, + gelu_5, + gelu_6, + gelu_7, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_27, + layer_norm_28, + layer_norm_29, + layer_norm_3, + layer_norm_30, + layer_norm_31, + layer_norm_32, + layer_norm_33, + layer_norm_34, + layer_norm_35, + layer_norm_36, + layer_norm_37, + layer_norm_38, + layer_norm_39, + layer_norm_4, + layer_norm_40, + layer_norm_41, + layer_norm_42, + layer_norm_43, + layer_norm_44, + layer_norm_45, + layer_norm_46, + layer_norm_47, + layer_norm_48, + layer_norm_49, + layer_norm_5, + layer_norm_50, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_33, + matmul_34, + matmul_35, + matmul_37, + matmul_38, + matmul_39, + matmul_40, + matmul_41, + matmul_42, + matmul_43, + matmul_45, + matmul_46, + matmul_47, + matmul_48, + matmul_49, + matmul_5, + matmul_50, + matmul_51, + matmul_53, + matmul_54, + matmul_55, + matmul_56, + matmul_57, + matmul_58, + matmul_59, + matmul_6, + matmul_61, + matmul_62, + matmul_63, + matmul_64, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_19, + reshape_23, + reshape_27, + reshape_3, + reshape_31, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + scale_5, + scale_6, + scale_7, + scale_8, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + softmax_4, + softmax_5, + softmax_6, + softmax_7, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_17, + transpose_18, + transpose_19, + transpose_2, + transpose_21, + transpose_22, + transpose_23, + transpose_25, + transpose_26, + transpose_27, + transpose_29, + transpose_3, + transpose_30, + transpose_31, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/weight_meta.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/weight_meta.py new file mode 100644 index 0000000000..babf99a1b9 --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-medium/weight_meta.py @@ -0,0 +1,1479 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [512] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.0894175") + max_val = float("0.105501") + mean = float("2.25618e-05") + std = float("0.0199735") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [512] + dtype = "float32" + min_val = float("-0.253323") + max_val = float("0.227163") + mean = float("0.0064847") + std = float("0.0762205") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [512] + dtype = "float32" + min_val = float("0.396939") + max_val = float("0.902477") + mean = float("0.792503") + std = float("0.0299704") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [512] + dtype = "float32" + min_val = float("-0.314978") + max_val = float("1.62996") + mean = float("0.0288801") + std = float("0.092014") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [512] + dtype = "float32" + min_val = float("0.320513") + max_val = float("1.11581") + mean = float("0.864891") + std = float("0.0486386") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [512] + dtype = "float32" + min_val = float("-0.150738") + max_val = float("1.11711") + mean = float("0.00145233") + std = float("0.0790642") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [2048, 512] + dtype = "float32" + min_val = float("-1.18233") + max_val = float("0.281758") + mean = float("1.11108e-05") + std = float("0.0474154") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [2048] + dtype = "float32" + min_val = float("-0.318298") + max_val = float("0.245454") + mean = float("-0.034403") + std = float("0.0417624") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.52255") + max_val = float("0.228606") + mean = float("0.000525448") + std = float("0.0465088") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [512] + dtype = "float32" + min_val = float("-1.02399") + max_val = float("0.417144") + mean = float("-0.000735359") + std = float("0.155629") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.523496") + max_val = float("0.582744") + mean = float("9.27255e-06") + std = float("0.0480931") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [512] + dtype = "float32" + min_val = float("-0.129974") + max_val = float("0.127745") + mean = float("-0.00196889") + std = float("0.0472955") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.284344") + max_val = float("0.273489") + mean = float("3.62744e-05") + std = float("0.0515097") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [512] + dtype = "float32" + min_val = float("-0.0623092") + max_val = float("0.0669615") + mean = float("-0.000322177") + std = float("0.0195285") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.493975") + max_val = float("0.430791") + mean = float("2.33086e-05") + std = float("0.0633328") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [512] + dtype = "float32" + min_val = float("-0.54773") + max_val = float("0.586705") + mean = float("0.00314373") + std = float("0.143958") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.386269") + max_val = float("0.367301") + mean = float("-3.26001e-05") + std = float("0.0737359") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [512] + dtype = "float32" + min_val = float("-0.151832") + max_val = float("1.66242") + mean = float("5.07995e-05") + std = float("0.0954895") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [512] + dtype = "float32" + min_val = float("0.475077") + max_val = float("1.81469") + mean = float("0.994642") + std = float("0.0507331") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [512] + dtype = "float32" + min_val = float("-1.4867") + max_val = float("0.816875") + mean = float("0.00928379") + std = float("0.0910959") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [512] + dtype = "float32" + min_val = float("0.786039") + max_val = float("2.59209") + mean = float("0.890067") + std = float("0.093233") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [512] + dtype = "float32" + min_val = float("-0.737404") + max_val = float("1.02506") + mean = float("-0.000198238") + std = float("0.0922636") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [2048, 512] + dtype = "float32" + min_val = float("-5.70945") + max_val = float("0.937745") + mean = float("-2.59088e-05") + std = float("0.0469222") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [2048] + dtype = "float32" + min_val = float("-0.25023") + max_val = float("0.348202") + mean = float("-0.0670001") + std = float("0.0488116") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.65548") + max_val = float("0.445752") + mean = float("0.000649754") + std = float("0.0462103") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [512] + dtype = "float32" + min_val = float("-1.27249") + max_val = float("0.321674") + mean = float("-0.000993145") + std = float("0.116902") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.370106") + max_val = float("0.286359") + mean = float("-7.06565e-06") + std = float("0.0358652") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [512] + dtype = "float32" + min_val = float("-0.281529") + max_val = float("0.276711") + mean = float("0.000489536") + std = float("0.062046") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.184953") + max_val = float("0.203524") + mean = float("5.16138e-05") + std = float("0.0391865") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [512] + dtype = "float32" + min_val = float("-0.0606089") + max_val = float("0.0530795") + mean = float("-0.000160504") + std = float("0.0190719") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.457794") + max_val = float("0.467982") + mean = float("2.46767e-05") + std = float("0.0626208") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [512] + dtype = "float32" + min_val = float("-0.347791") + max_val = float("0.366984") + mean = float("0.0096646") + std = float("0.11264") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.429543") + max_val = float("0.393597") + mean = float("9.97255e-06") + std = float("0.0824405") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [512] + dtype = "float32" + min_val = float("-0.820704") + max_val = float("0.984762") + mean = float("0.00430575") + std = float("0.0639274") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [512] + dtype = "float32" + min_val = float("0.576931") + max_val = float("1.30206") + mean = float("1.02376") + std = float("0.0385582") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [512] + dtype = "float32" + min_val = float("-1.36535") + max_val = float("0.989126") + mean = float("0.00577617") + std = float("0.102071") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [512] + dtype = "float32" + min_val = float("0.729317") + max_val = float("1.70785") + mean = float("0.884105") + std = float("0.0545118") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [512] + dtype = "float32" + min_val = float("-0.792903") + max_val = float("0.786241") + mean = float("0.000889485") + std = float("0.0886374") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [2048, 512] + dtype = "float32" + min_val = float("-4.92933") + max_val = float("1.65625") + mean = float("-4.27979e-06") + std = float("0.0457538") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [2048] + dtype = "float32" + min_val = float("-0.384431") + max_val = float("0.239298") + mean = float("-0.0639916") + std = float("0.0514914") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [512, 2048] + dtype = "float32" + min_val = float("-1.00796") + max_val = float("1.02155") + mean = float("0.000665669") + std = float("0.0486474") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [512] + dtype = "float32" + min_val = float("-0.489409") + max_val = float("0.239671") + mean = float("-0.000557846") + std = float("0.0779405") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.245668") + max_val = float("0.249669") + mean = float("1.58738e-06") + std = float("0.033103") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [512] + dtype = "float32" + min_val = float("-0.152431") + max_val = float("0.135037") + mean = float("0.000145004") + std = float("0.0444765") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.248779") + max_val = float("0.189045") + mean = float("-5.58235e-05") + std = float("0.0365995") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [512] + dtype = "float32" + min_val = float("-0.0691665") + max_val = float("0.0599803") + mean = float("-0.000485448") + std = float("0.0205152") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.525277") + max_val = float("0.588057") + mean = float("2.99941e-05") + std = float("0.0695613") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [512] + dtype = "float32" + min_val = float("-0.342983") + max_val = float("0.272747") + mean = float("-0.00241758") + std = float("0.0851831") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.490275") + max_val = float("0.675993") + mean = float("-9.48777e-06") + std = float("0.0823815") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [512] + dtype = "float32" + min_val = float("-0.772059") + max_val = float("0.906854") + mean = float("0.0190953") + std = float("0.0634394") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [512] + dtype = "float32" + min_val = float("0.840794") + max_val = float("1.38473") + mean = float("1.06717") + std = float("0.036675") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [512] + dtype = "float32" + min_val = float("-0.937761") + max_val = float("1.07752") + mean = float("0.00646644") + std = float("0.0892434") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [512] + dtype = "float32" + min_val = float("0.636629") + max_val = float("1.66727") + mean = float("0.864401") + std = float("0.0602749") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [512] + dtype = "float32" + min_val = float("-0.46151") + max_val = float("0.724493") + mean = float("0.000502797") + std = float("0.0762598") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [2048, 512] + dtype = "float32" + min_val = float("-1.51137") + max_val = float("1.8962") + mean = float("2.1915e-05") + std = float("0.0434321") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [2048] + dtype = "float32" + min_val = float("-0.349105") + max_val = float("0.186915") + mean = float("-0.0596907") + std = float("0.0587008") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.371077") + max_val = float("0.447255") + mean = float("0.000501849") + std = float("0.0470652") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [512] + dtype = "float32" + min_val = float("-0.397494") + max_val = float("0.24091") + mean = float("-0.000238614") + std = float("0.0751574") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.189707") + max_val = float("0.20447") + mean = float("-1.09746e-06") + std = float("0.0323642") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [512] + dtype = "float32" + min_val = float("-0.11837") + max_val = float("0.125069") + mean = float("-0.000758394") + std = float("0.0366372") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.212853") + max_val = float("0.184593") + mean = float("-4.79056e-05") + std = float("0.0367611") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [512] + dtype = "float32" + min_val = float("-0.0696714") + max_val = float("0.0724269") + mean = float("-0.00169909") + std = float("0.0202891") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.553874") + max_val = float("0.54645") + mean = float("-2.52561e-05") + std = float("0.0690689") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [512] + dtype = "float32" + min_val = float("-0.460022") + max_val = float("0.436672") + mean = float("0.00223835") + std = float("0.099194") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.624175") + max_val = float("0.470302") + mean = float("0.000149106") + std = float("0.0811845") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [512] + dtype = "float32" + min_val = float("-0.242863") + max_val = float("0.533821") + mean = float("0.019917") + std = float("0.0511224") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [512] + dtype = "float32" + min_val = float("0.705949") + max_val = float("1.10739") + mean = float("1.03652") + std = float("0.0442884") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [512] + dtype = "float32" + min_val = float("-0.820528") + max_val = float("1.2156") + mean = float("0.00389811") + std = float("0.104394") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [512] + dtype = "float32" + min_val = float("0.577269") + max_val = float("1.95878") + mean = float("0.825116") + std = float("0.0732993") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [512] + dtype = "float32" + min_val = float("-0.222225") + max_val = float("0.31417") + mean = float("-0.000278372") + std = float("0.0524744") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [2048, 512] + dtype = "float32" + min_val = float("-0.982369") + max_val = float("1.65349") + mean = float("1.2078e-05") + std = float("0.0438761") + data = None + + +class Program_weight_tensor_parameter_72: + name = "parameter_72" + shape = [2048] + dtype = "float32" + min_val = float("-0.508888") + max_val = float("0.402931") + mean = float("-0.0528263") + std = float("0.0748547") + data = None + + +class Program_weight_tensor_parameter_73: + name = "parameter_73" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.316359") + max_val = float("0.351882") + mean = float("0.000463961") + std = float("0.0467801") + data = None + + +class Program_weight_tensor_parameter_74: + name = "parameter_74" + shape = [512] + dtype = "float32" + min_val = float("-0.200516") + max_val = float("0.196959") + mean = float("-0.000702494") + std = float("0.0603965") + data = None + + +class Program_weight_tensor_parameter_75: + name = "parameter_75" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.359341") + max_val = float("0.427888") + mean = float("2.49288e-05") + std = float("0.0375369") + data = None + + +class Program_weight_tensor_parameter_76: + name = "parameter_76" + shape = [512] + dtype = "float32" + min_val = float("-0.109351") + max_val = float("0.119218") + mean = float("0.00148425") + std = float("0.0296331") + data = None + + +class Program_weight_tensor_parameter_77: + name = "parameter_77" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.23137") + max_val = float("0.218054") + mean = float("-2.18454e-05") + std = float("0.0414046") + data = None + + +class Program_weight_tensor_parameter_78: + name = "parameter_78" + shape = [512] + dtype = "float32" + min_val = float("-0.0532107") + max_val = float("0.0504003") + mean = float("-0.000862264") + std = float("0.018682") + data = None + + +class Program_weight_tensor_parameter_79: + name = "parameter_79" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.457491") + max_val = float("0.483576") + mean = float("-0.000172465") + std = float("0.0599863") + data = None + + +class Program_weight_tensor_parameter_80: + name = "parameter_80" + shape = [512] + dtype = "float32" + min_val = float("-0.304324") + max_val = float("0.248104") + mean = float("0.0112257") + std = float("0.0873064") + data = None + + +class Program_weight_tensor_parameter_81: + name = "parameter_81" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.350126") + max_val = float("0.317995") + mean = float("-5.11466e-05") + std = float("0.0615544") + data = None + + +class Program_weight_tensor_parameter_82: + name = "parameter_82" + shape = [512] + dtype = "float32" + min_val = float("-0.108253") + max_val = float("0.442444") + mean = float("0.0245484") + std = float("0.0547247") + data = None + + +class Program_weight_tensor_parameter_83: + name = "parameter_83" + shape = [512] + dtype = "float32" + min_val = float("0.591987") + max_val = float("1.08392") + mean = float("0.968517") + std = float("0.0437245") + data = None + + +class Program_weight_tensor_parameter_84: + name = "parameter_84" + shape = [512] + dtype = "float32" + min_val = float("-0.612608") + max_val = float("1.6787") + mean = float("0.00499569") + std = float("0.113565") + data = None + + +class Program_weight_tensor_parameter_85: + name = "parameter_85" + shape = [512] + dtype = "float32" + min_val = float("0.550245") + max_val = float("1.9371") + mean = float("0.825003") + std = float("0.0736421") + data = None + + +class Program_weight_tensor_parameter_86: + name = "parameter_86" + shape = [512] + dtype = "float32" + min_val = float("-0.20507") + max_val = float("0.462259") + mean = float("-0.00151525") + std = float("0.0619102") + data = None + + +class Program_weight_tensor_parameter_87: + name = "parameter_87" + shape = [2048, 512] + dtype = "float32" + min_val = float("-0.62616") + max_val = float("2.70157") + mean = float("4.81677e-06") + std = float("0.0439138") + data = None + + +class Program_weight_tensor_parameter_88: + name = "parameter_88" + shape = [2048] + dtype = "float32" + min_val = float("-0.534594") + max_val = float("0.320717") + mean = float("-0.05459") + std = float("0.0754932") + data = None + + +class Program_weight_tensor_parameter_89: + name = "parameter_89" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.417653") + max_val = float("0.348558") + mean = float("0.000379505") + std = float("0.0459584") + data = None + + +class Program_weight_tensor_parameter_90: + name = "parameter_90" + shape = [512] + dtype = "float32" + min_val = float("-0.281413") + max_val = float("0.264865") + mean = float("-2.15754e-05") + std = float("0.0879467") + data = None + + +class Program_weight_tensor_parameter_91: + name = "parameter_91" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.259735") + max_val = float("0.353676") + mean = float("9.94279e-07") + std = float("0.0399032") + data = None + + +class Program_weight_tensor_parameter_92: + name = "parameter_92" + shape = [512] + dtype = "float32" + min_val = float("-0.150273") + max_val = float("0.129804") + mean = float("-0.00198688") + std = float("0.0327796") + data = None + + +class Program_weight_tensor_parameter_93: + name = "parameter_93" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.231431") + max_val = float("0.250587") + mean = float("5.46923e-06") + std = float("0.0426072") + data = None + + +class Program_weight_tensor_parameter_94: + name = "parameter_94" + shape = [512] + dtype = "float32" + min_val = float("-0.0506532") + max_val = float("0.0552798") + mean = float("-0.000341343") + std = float("0.0200333") + data = None + + +class Program_weight_tensor_parameter_95: + name = "parameter_95" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.327243") + max_val = float("0.401406") + mean = float("-0.000100963") + std = float("0.0577851") + data = None + + +class Program_weight_tensor_parameter_96: + name = "parameter_96" + shape = [512] + dtype = "float32" + min_val = float("-0.458864") + max_val = float("0.389266") + mean = float("0.00516745") + std = float("0.123286") + data = None + + +class Program_weight_tensor_parameter_97: + name = "parameter_97" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.318561") + max_val = float("0.3009") + mean = float("-1.80535e-05") + std = float("0.0580984") + data = None + + +class Program_weight_tensor_parameter_98: + name = "parameter_98" + shape = [512] + dtype = "float32" + min_val = float("-0.164502") + max_val = float("0.842328") + mean = float("0.0212857") + std = float("0.0600445") + data = None + + +class Program_weight_tensor_parameter_99: + name = "parameter_99" + shape = [512] + dtype = "float32" + min_val = float("0.560151") + max_val = float("1.19552") + mean = float("0.924714") + std = float("0.0470339") + data = None + + +class Program_weight_tensor_parameter_100: + name = "parameter_100" + shape = [512] + dtype = "float32" + min_val = float("-0.61856") + max_val = float("2.54185") + mean = float("0.0058001") + std = float("0.137982") + data = None + + +class Program_weight_tensor_parameter_101: + name = "parameter_101" + shape = [512] + dtype = "float32" + min_val = float("0.581271") + max_val = float("2.16103") + mean = float("0.842449") + std = float("0.0752741") + data = None + + +class Program_weight_tensor_parameter_102: + name = "parameter_102" + shape = [512] + dtype = "float32" + min_val = float("-0.171914") + max_val = float("0.290126") + mean = float("-0.00124093") + std = float("0.0587843") + data = None + + +class Program_weight_tensor_parameter_103: + name = "parameter_103" + shape = [2048, 512] + dtype = "float32" + min_val = float("-0.992933") + max_val = float("1.53937") + mean = float("2.48266e-05") + std = float("0.0437467") + data = None + + +class Program_weight_tensor_parameter_104: + name = "parameter_104" + shape = [2048] + dtype = "float32" + min_val = float("-0.395856") + max_val = float("0.208431") + mean = float("-0.0594019") + std = float("0.0676681") + data = None + + +class Program_weight_tensor_parameter_105: + name = "parameter_105" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.401998") + max_val = float("0.451009") + mean = float("0.000234482") + std = float("0.0462565") + data = None + + +class Program_weight_tensor_parameter_106: + name = "parameter_106" + shape = [512] + dtype = "float32" + min_val = float("-0.352865") + max_val = float("0.370052") + mean = float("-0.000880867") + std = float("0.0855979") + data = None + + +class Program_weight_tensor_parameter_107: + name = "parameter_107" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.346555") + max_val = float("0.335371") + mean = float("-1.8901e-05") + std = float("0.0368182") + data = None + + +class Program_weight_tensor_parameter_108: + name = "parameter_108" + shape = [512] + dtype = "float32" + min_val = float("-0.113188") + max_val = float("0.148588") + mean = float("0.00118497") + std = float("0.0348186") + data = None + + +class Program_weight_tensor_parameter_109: + name = "parameter_109" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.206628") + max_val = float("0.19462") + mean = float("7.06577e-05") + std = float("0.0387166") + data = None + + +class Program_weight_tensor_parameter_110: + name = "parameter_110" + shape = [512] + dtype = "float32" + min_val = float("-0.0524268") + max_val = float("0.068459") + mean = float("-0.000535169") + std = float("0.0197126") + data = None + + +class Program_weight_tensor_parameter_111: + name = "parameter_111" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.345577") + max_val = float("0.327953") + mean = float("-5.4165e-06") + std = float("0.0561798") + data = None + + +class Program_weight_tensor_parameter_112: + name = "parameter_112" + shape = [512] + dtype = "float32" + min_val = float("-0.691041") + max_val = float("0.892565") + mean = float("-0.00755194") + std = float("0.213369") + data = None + + +class Program_weight_tensor_parameter_113: + name = "parameter_113" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.365654") + max_val = float("0.328012") + mean = float("-2.56417e-05") + std = float("0.0547496") + data = None + + +class Program_weight_tensor_parameter_114: + name = "parameter_114" + shape = [512] + dtype = "float32" + min_val = float("-0.402518") + max_val = float("1.67075") + mean = float("0.0242954") + std = float("0.0900075") + data = None + + +class Program_weight_tensor_parameter_115: + name = "parameter_115" + shape = [512] + dtype = "float32" + min_val = float("0.21081") + max_val = float("0.971453") + mean = float("0.897021") + std = float("0.0669615") + data = None + + +class Program_weight_tensor_parameter_116: + name = "parameter_116" + shape = [512] + dtype = "float32" + min_val = float("-1.30365") + max_val = float("4.57849") + mean = float("-0.00239304") + std = float("0.270891") + data = None + + +class Program_weight_tensor_parameter_117: + name = "parameter_117" + shape = [512] + dtype = "float32" + min_val = float("0.485716") + max_val = float("2.29312") + mean = float("0.819859") + std = float("0.0805283") + data = None + + +class Program_weight_tensor_parameter_118: + name = "parameter_118" + shape = [512] + dtype = "float32" + min_val = float("-0.167255") + max_val = float("0.283408") + mean = float("-0.000243411") + std = float("0.0551525") + data = None + + +class Program_weight_tensor_parameter_119: + name = "parameter_119" + shape = [2048, 512] + dtype = "float32" + min_val = float("-0.510613") + max_val = float("1.3594") + mean = float("2.79523e-05") + std = float("0.0435764") + data = None + + +class Program_weight_tensor_parameter_120: + name = "parameter_120" + shape = [2048] + dtype = "float32" + min_val = float("-0.377865") + max_val = float("0.227676") + mean = float("-0.0800511") + std = float("0.062134") + data = None + + +class Program_weight_tensor_parameter_121: + name = "parameter_121" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.290436") + max_val = float("0.325917") + mean = float("0.000342583") + std = float("0.0446749") + data = None + + +class Program_weight_tensor_parameter_122: + name = "parameter_122" + shape = [512] + dtype = "float32" + min_val = float("-0.236715") + max_val = float("0.273077") + mean = float("0.000566264") + std = float("0.0863549") + data = None + + +class Program_weight_tensor_parameter_123: + name = "parameter_123" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.621073") + max_val = float("0.58648") + mean = float("-2.19676e-05") + std = float("0.0391482") + data = None + + +class Program_weight_tensor_parameter_124: + name = "parameter_124" + shape = [512] + dtype = "float32" + min_val = float("-0.434387") + max_val = float("0.475734") + mean = float("-0.00296182") + std = float("0.111376") + data = None + + +class Program_weight_tensor_parameter_125: + name = "parameter_125" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.195048") + max_val = float("0.313092") + mean = float("-9.08528e-05") + std = float("0.036227") + data = None + + +class Program_weight_tensor_parameter_126: + name = "parameter_126" + shape = [512] + dtype = "float32" + min_val = float("-0.0737398") + max_val = float("0.060897") + mean = float("-0.00238993") + std = float("0.0198197") + data = None + + +class Program_weight_tensor_parameter_127: + name = "parameter_127" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.542187") + max_val = float("0.552538") + mean = float("1.6441e-05") + std = float("0.059109") + data = None + + +class Program_weight_tensor_parameter_128: + name = "parameter_128" + shape = [512] + dtype = "float32" + min_val = float("-1.12321") + max_val = float("1.17346") + mean = float("0.014935") + std = float("0.3524") + data = None + + +class Program_weight_tensor_parameter_129: + name = "parameter_129" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.562419") + max_val = float("0.7424") + mean = float("-2.79614e-05") + std = float("0.0586232") + data = None + + +class Program_weight_tensor_parameter_130: + name = "parameter_130" + shape = [512] + dtype = "float32" + min_val = float("-1.35166") + max_val = float("1.13697") + mean = float("-0.00503444") + std = float("0.135827") + data = None + + +class Program_weight_tensor_parameter_131: + name = "parameter_131" + shape = [512] + dtype = "float32" + min_val = float("0.196767") + max_val = float("1.00264") + mean = float("0.89392") + std = float("0.102108") + data = None + + +class Program_weight_tensor_parameter_132: + name = "parameter_132" + shape = [2, 512] + dtype = "float32" + min_val = float("-0.42832") + max_val = float("0.28691") + mean = float("0.000522765") + std = float("0.0296367") + data = None + + +class Program_weight_tensor_parameter_133: + name = "parameter_133" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.432237") + max_val = float("0.340381") + mean = float("-1.37893e-05") + std = float("0.0297153") + data = None + + +class Program_weight_tensor_parameter_134: + name = "parameter_134" + shape = [21128, 512] + dtype = "float32" + min_val = float("-0.973177") + max_val = float("1.07461") + mean = float("-0.00428964") + std = float("0.0659693") + data = None diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/graph_hash.txt b/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/graph_hash.txt new file mode 100644 index 0000000000..1d8da86d20 --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/graph_hash.txt @@ -0,0 +1 @@ +a75f85f129c28c95329ab6a86365047d63da6bdb69ea1b1a21ba8a32781a54c3 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/graph_net.json b/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/graph_net.json new file mode 100644 index 0000000000..dc3e64293c --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "uer/chinese-roberta-mini", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/input_meta.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/input_meta.py new file mode 100644 index 0000000000..26adb5b74e --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/input_meta.py @@ -0,0 +1,12 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 11] + dtype = "int64" + data = [101, 3614, 6816, 886, 4500, 4636, 2428, 7607, 3444, 106, 102] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 11] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/model.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/model.py new file mode 100644 index 0000000000..cbf0ee554c --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/model.py @@ -0,0 +1,1005 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x11xb) <- (1x11xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x11xf32) <- (1x11xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x11xf32) <- (1x11xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x11xf32) <- (1x11xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.full: (1xf32) <- () + full_2 = paddle._C_ops.full( + [1], float("1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.full_like: (1x11xi64) <- (1x11xi64, 1xf32) + full_like_0 = paddle._C_ops.full_like( + data_0, full_2, paddle.int64, paddle.framework._current_expected_place() + ) + del full_2 + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("-1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x11xi64) <- (1x11xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_like_0, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x11xi64) <- (1x11xi64, 1x11xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_like_0) + del cumsum_0, full_like_0 + + # pd_op.embedding: (1x11x256xf32) <- (1x11xi64, 21128x256xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_70, -1, False) + del data_0, parameter_70 + + # pd_op.embedding: (1x11x256xf32) <- (1x11xi64, 512x256xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_69, -1, False) + del parameter_69 + + # pd_op.embedding: (1x11x256xf32) <- (1x11xi64, 2x256xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_68, -1, False) + del data_1, parameter_68 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 1x11x256xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 1x11x256xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x11x256xf32, 1x11xf32, 1x11xf32) <- (1x11x256xf32, 256xf32, 256xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_4 + + # pd_op.dropout: (1x11x256xf32, 1x11x256xui8) <- (1x11x256xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_64) + del parameter_64 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 4, 64] + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_5 + + # pd_op.scale: (1x4x11x64xf32) <- (1x4x11x64xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x4x11x11xf32) <- (1x4x11x64xf32, 1x4x11x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x4x11x11xf32) <- (1x4x11x11xf32, 1x1x1x11xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x4x11x11xf32) <- (1x4x11x11xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x4x11x11xf32, 1x4x11x11xui8) <- (1x4x11x11xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x4x11x64xf32) <- (1x4x11x11xf32, 1x4x11x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x11x4x64xf32) <- (1x4x11x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 256] + + # pd_op.reshape: (1x11x256xf32) <- (1x11x4x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x11x256xf32, 1x11x256xui8) <- (1x11x256xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 1x11x256xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x11x256xf32, 1x11xf32, 1x11xf32) <- (1x11x256xf32, 256xf32, 256xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x11x1024xf32) <- (1x11x256xf32, 256x1024xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x11x1024xf32) <- (1x11x1024xf32, 1024xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x11x1024xf32) <- (1x11x1024xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x11x256xf32) <- (1x11x1024xf32, 1024x256xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x11x256xf32, 1x11x256xui8) <- (1x11x256xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 1x11x256xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x11x256xf32, 1x11xf32, 1x11xf32) <- (1x11x256xf32, 256xf32, 256xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x4x11x64xf32) <- (1x4x11x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x4x11x11xf32) <- (1x4x11x64xf32, 1x4x11x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x4x11x11xf32) <- (1x4x11x11xf32, 1x1x1x11xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x4x11x11xf32) <- (1x4x11x11xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x4x11x11xf32, 1x4x11x11xui8) <- (1x4x11x11xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x4x11x64xf32) <- (1x4x11x11xf32, 1x4x11x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x11x4x64xf32) <- (1x4x11x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x11x256xf32) <- (1x11x4x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x11x256xf32, 1x11x256xui8) <- (1x11x256xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 1x11x256xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x11x256xf32, 1x11xf32, 1x11xf32) <- (1x11x256xf32, 256xf32, 256xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x11x1024xf32) <- (1x11x256xf32, 256x1024xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x11x1024xf32) <- (1x11x1024xf32, 1024xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x11x1024xf32) <- (1x11x1024xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x11x256xf32) <- (1x11x1024xf32, 1024x256xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x11x256xf32, 1x11x256xui8) <- (1x11x256xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 1x11x256xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x11x256xf32, 1x11xf32, 1x11xf32) <- (1x11x256xf32, 256xf32, 256xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_20, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_21 = paddle._C_ops.add(matmul_17, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_22 = paddle._C_ops.add(matmul_18, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x4x11x64xf32) <- (1x4x11x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_8, full_5, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x4x11x11xf32) <- (1x4x11x64xf32, 1x4x11x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_3, transpose_9, False, True) + + # pd_op.add: (1x4x11x11xf32) <- (1x4x11x11xf32, 1x1x1x11xf32) + add_23 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x4x11x11xf32) <- (1x4x11x11xf32) + softmax_2 = paddle._C_ops.softmax(add_23, -1) + del add_23 + + # pd_op.dropout: (1x4x11x11xf32, 1x4x11x11xui8) <- (1x4x11x11xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x4x11x64xf32) <- (1x4x11x11xf32, 1x4x11x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x11x4x64xf32) <- (1x4x11x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x11x256xf32) <- (1x11x4x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_24 = paddle._C_ops.add(matmul_21, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x11x256xf32, 1x11x256xui8) <- (1x11x256xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_24, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_24 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 1x11x256xf32) + add_25 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x11x256xf32, 1x11xf32, 1x11xf32) <- (1x11x256xf32, 256xf32, 256xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_25, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x11x1024xf32) <- (1x11x256xf32, 256x1024xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x11x1024xf32) <- (1x11x1024xf32, 1024xf32) + add_26 = paddle._C_ops.add(matmul_22, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x11x1024xf32) <- (1x11x1024xf32) + gelu_2 = paddle._C_ops.gelu(add_26, False) + + # pd_op.matmul: (1x11x256xf32) <- (1x11x1024xf32, 1024x256xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_27 = paddle._C_ops.add(matmul_23, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x11x256xf32, 1x11x256xui8) <- (1x11x256xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_27, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_27 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 1x11x256xf32) + add_28 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x11x256xf32, 1x11xf32, 1x11xf32) <- (1x11x256xf32, 256xf32, 256xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_28, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_29 = paddle._C_ops.add(matmul_24, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_29, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_30 = paddle._C_ops.add(matmul_25, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_31 = paddle._C_ops.add(matmul_26, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x11x4x64xf32) <- (1x11x256xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_31, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x4x11x64xf32) <- (1x11x4x64xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x4x11x64xf32) <- (1x4x11x64xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_12, full_5, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x4x11x11xf32) <- (1x4x11x64xf32, 1x4x11x64xf32) + matmul_27 = paddle._C_ops.matmul(scale_4, transpose_13, False, True) + + # pd_op.add: (1x4x11x11xf32) <- (1x4x11x11xf32, 1x1x1x11xf32) + add_32 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x4x11x11xf32) <- (1x4x11x11xf32) + softmax_3 = paddle._C_ops.softmax(add_32, -1) + del add_32 + + # pd_op.dropout: (1x4x11x11xf32, 1x4x11x11xui8) <- (1x4x11x11xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x4x11x64xf32) <- (1x4x11x11xf32, 1x4x11x64xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x11x4x64xf32) <- (1x4x11x64xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x11x256xf32) <- (1x11x4x64xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x11x256xf32) <- (1x11x256xf32, 256x256xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_33 = paddle._C_ops.add(matmul_29, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x11x256xf32, 1x11x256xui8) <- (1x11x256xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_33, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_33 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 1x11x256xf32) + add_34 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x11x256xf32, 1x11xf32, 1x11xf32) <- (1x11x256xf32, 256xf32, 256xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_34, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x11x1024xf32) <- (1x11x256xf32, 256x1024xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x11x1024xf32) <- (1x11x1024xf32, 1024xf32) + add_35 = paddle._C_ops.add(matmul_30, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x11x1024xf32) <- (1x11x1024xf32) + gelu_3 = paddle._C_ops.gelu(add_35, False) + + # pd_op.matmul: (1x11x256xf32) <- (1x11x1024xf32, 1024x256xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 256xf32) + add_36 = paddle._C_ops.add(matmul_31, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x11x256xf32, 1x11x256xui8) <- (1x11x256xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_36, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_36 + + # pd_op.add: (1x11x256xf32) <- (1x11x256xf32, 1x11x256xf32) + add_37 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x11x256xf32, 1x11xf32, 1x11xf32) <- (1x11x256xf32, 256xf32, 256xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_37, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x256xf32) <- (1x11x256xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_24, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x256xf32) <- (1x256xf32, 256x256xf32) + matmul_32 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x256xf32) <- (1x256xf32, 256xf32) + add_38 = paddle._C_ops.add(matmul_32, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x256xf32) <- (1x256xf32) + tanh_0 = paddle._C_ops.tanh(add_38) + del ( + add_0, + add_1, + add_10, + add_11, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_21, + add_22, + add_25, + add_26, + add_28, + add_29, + add_3, + add_30, + add_31, + add_34, + add_35, + add_37, + add_38, + add_4, + add_7, + add_8, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_2, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_3, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_3, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_2, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/weight_meta.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/weight_meta.py new file mode 100644 index 0000000000..06cdc4963f --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-mini/weight_meta.py @@ -0,0 +1,775 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [256] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.0907251") + max_val = float("0.0875061") + mean = float("-5.96928e-05") + std = float("0.0200079") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [256] + dtype = "float32" + min_val = float("-0.346091") + max_val = float("0.366991") + mean = float("-0.00751211") + std = float("0.14055") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [256] + dtype = "float32" + min_val = float("0.454174") + max_val = float("0.875035") + mean = float("0.7533") + std = float("0.0359947") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [256] + dtype = "float32" + min_val = float("-0.242796") + max_val = float("0.743989") + mean = float("0.0382512") + std = float("0.0874369") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [256] + dtype = "float32" + min_val = float("0.318259") + max_val = float("0.916219") + mean = float("0.776137") + std = float("0.0740203") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [256] + dtype = "float32" + min_val = float("-0.11026") + max_val = float("0.540864") + mean = float("0.000920438") + std = float("0.0554477") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [1024, 256] + dtype = "float32" + min_val = float("-0.573306") + max_val = float("0.647416") + mean = float("5.59266e-05") + std = float("0.0703795") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [1024] + dtype = "float32" + min_val = float("-0.56855") + max_val = float("0.228352") + mean = float("-0.0449916") + std = float("0.0724841") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [256, 1024] + dtype = "float32" + min_val = float("-0.727554") + max_val = float("0.342278") + mean = float("0.000632881") + std = float("0.0617691") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [256] + dtype = "float32" + min_val = float("-2.51802") + max_val = float("1.16162") + mean = float("-0.00619458") + std = float("0.266537") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.947441") + max_val = float("0.858325") + mean = float("-2.57656e-05") + std = float("0.0697183") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [256] + dtype = "float32" + min_val = float("-0.252419") + max_val = float("0.262458") + mean = float("0.0148338") + std = float("0.10797") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.276763") + max_val = float("0.287372") + mean = float("-0.000211909") + std = float("0.0641649") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [256] + dtype = "float32" + min_val = float("-0.0475237") + max_val = float("0.076911") + mean = float("4.94969e-07") + std = float("0.0206426") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.455405") + max_val = float("0.443721") + mean = float("9.84783e-05") + std = float("0.0781764") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [256] + dtype = "float32" + min_val = float("-0.634081") + max_val = float("0.419556") + mean = float("0.00500968") + std = float("0.198132") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.478933") + max_val = float("0.499138") + mean = float("-0.000336034") + std = float("0.115011") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [256] + dtype = "float32" + min_val = float("-0.370518") + max_val = float("3.02347") + mean = float("0.0215458") + std = float("0.200397") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [256] + dtype = "float32" + min_val = float("0.491558") + max_val = float("2.02724") + mean = float("1.10835") + std = float("0.0852634") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [256] + dtype = "float32" + min_val = float("-2.33427") + max_val = float("1.64468") + mean = float("0.0162817") + std = float("0.210813") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [256] + dtype = "float32" + min_val = float("0.629116") + max_val = float("1.20095") + mean = float("0.871526") + std = float("0.0521256") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [256] + dtype = "float32" + min_val = float("-0.245222") + max_val = float("0.215498") + mean = float("-0.000659989") + std = float("0.0596915") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [1024, 256] + dtype = "float32" + min_val = float("-4.64252") + max_val = float("2.47291") + mean = float("-2.14948e-05") + std = float("0.0674164") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [1024] + dtype = "float32" + min_val = float("-0.561501") + max_val = float("0.731614") + mean = float("-0.0427675") + std = float("0.0987152") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [256, 1024] + dtype = "float32" + min_val = float("-0.907093") + max_val = float("1.20052") + mean = float("0.000597294") + std = float("0.064224") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [256] + dtype = "float32" + min_val = float("-1.03489") + max_val = float("0.440366") + mean = float("-0.0021509") + std = float("0.146299") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.457894") + max_val = float("0.429091") + mean = float("-9.25861e-05") + std = float("0.0554389") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [256] + dtype = "float32" + min_val = float("-0.189862") + max_val = float("0.177647") + mean = float("0.00836675") + std = float("0.0618494") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.323284") + max_val = float("0.313852") + mean = float("-3.71741e-05") + std = float("0.0570936") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [256] + dtype = "float32" + min_val = float("-0.0526768") + max_val = float("0.0468413") + mean = float("-0.00209405") + std = float("0.0183979") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.483087") + max_val = float("0.522235") + mean = float("1.80394e-05") + std = float("0.0976302") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [256] + dtype = "float32" + min_val = float("-0.759844") + max_val = float("0.639634") + mean = float("0.00544476") + std = float("0.202035") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.734112") + max_val = float("0.742378") + mean = float("-0.000487844") + std = float("0.149528") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [256] + dtype = "float32" + min_val = float("-1.47991") + max_val = float("1.94992") + mean = float("0.013694") + std = float("0.162778") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [256] + dtype = "float32" + min_val = float("0.51939") + max_val = float("1.27295") + mean = float("1.1654") + std = float("0.0796264") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [256] + dtype = "float32" + min_val = float("-3.33998") + max_val = float("2.49223") + mean = float("0.018658") + std = float("0.289677") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [256] + dtype = "float32" + min_val = float("0.507337") + max_val = float("1.74735") + mean = float("0.826436") + std = float("0.0971245") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [256] + dtype = "float32" + min_val = float("-0.373964") + max_val = float("0.157682") + mean = float("-0.00257388") + std = float("0.0693645") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [1024, 256] + dtype = "float32" + min_val = float("-4.07357") + max_val = float("2.57924") + mean = float("0.00011761") + std = float("0.0637356") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [1024] + dtype = "float32" + min_val = float("-0.746446") + max_val = float("0.575511") + mean = float("-0.0403407") + std = float("0.15677") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [256, 1024] + dtype = "float32" + min_val = float("-0.545502") + max_val = float("0.463961") + mean = float("0.000164883") + std = float("0.0616475") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [256] + dtype = "float32" + min_val = float("-0.680705") + max_val = float("0.537495") + mean = float("-0.00277979") + std = float("0.149698") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.357575") + max_val = float("0.386625") + mean = float("6.78306e-06") + std = float("0.0616257") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [256] + dtype = "float32" + min_val = float("-0.1519") + max_val = float("0.148897") + mean = float("0.00250018") + std = float("0.0477027") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.292171") + max_val = float("0.344403") + mean = float("-0.000188921") + std = float("0.0664031") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [256] + dtype = "float32" + min_val = float("-0.0627332") + max_val = float("0.0515808") + mean = float("0.00129644") + std = float("0.0207155") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.589476") + max_val = float("0.710005") + mean = float("1.72193e-07") + std = float("0.0823623") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [256] + dtype = "float32" + min_val = float("-0.697335") + max_val = float("0.63728") + mean = float("0.0119348") + std = float("0.261417") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.525231") + max_val = float("0.453609") + mean = float("0.000208169") + std = float("0.0883425") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [256] + dtype = "float32" + min_val = float("-1.92857") + max_val = float("2.15951") + mean = float("0.0203414") + std = float("0.193426") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [256] + dtype = "float32" + min_val = float("0.278951") + max_val = float("1.26833") + mean = float("1.10568") + std = float("0.0825998") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [256] + dtype = "float32" + min_val = float("-2.27933") + max_val = float("1.95947") + mean = float("0.0303893") + std = float("0.324402") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [256] + dtype = "float32" + min_val = float("0.577497") + max_val = float("1.82611") + mean = float("0.729701") + std = float("0.0923633") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [256] + dtype = "float32" + min_val = float("-0.444449") + max_val = float("0.220128") + mean = float("-0.00160224") + std = float("0.0792059") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [1024, 256] + dtype = "float32" + min_val = float("-2.99913") + max_val = float("2.92008") + mean = float("-1.42614e-05") + std = float("0.0596977") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [1024] + dtype = "float32" + min_val = float("-0.872627") + max_val = float("0.48625") + mean = float("-0.0705293") + std = float("0.164167") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [256, 1024] + dtype = "float32" + min_val = float("-0.406232") + max_val = float("0.740022") + mean = float("-0.000428546") + std = float("0.0569094") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [256] + dtype = "float32" + min_val = float("-0.590512") + max_val = float("0.521076") + mean = float("-0.00328432") + std = float("0.119865") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.365564") + max_val = float("0.487767") + mean = float("-1.4016e-05") + std = float("0.0577936") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [256] + dtype = "float32" + min_val = float("-0.51323") + max_val = float("0.391566") + mean = float("0.00271643") + std = float("0.139631") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.344543") + max_val = float("0.36699") + mean = float("0.000111353") + std = float("0.0568619") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [256] + dtype = "float32" + min_val = float("-0.0605648") + max_val = float("0.0561462") + mean = float("-6.7685e-05") + std = float("0.0208619") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.827612") + max_val = float("0.784787") + mean = float("-0.000151497") + std = float("0.0871011") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [256] + dtype = "float32" + min_val = float("-1.02142") + max_val = float("1.02398") + mean = float("0.00691687") + std = float("0.355989") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [256, 256] + dtype = "float32" + min_val = float("-0.707436") + max_val = float("0.635756") + mean = float("-1.80106e-05") + std = float("0.084014") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [256] + dtype = "float32" + min_val = float("-1.49977") + max_val = float("1.08537") + mean = float("0.00142661") + std = float("0.195562") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [256] + dtype = "float32" + min_val = float("0.168487") + max_val = float("1.32994") + mean = float("1.07907") + std = float("0.146768") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [2, 256] + dtype = "float32" + min_val = float("-0.371457") + max_val = float("0.518628") + mean = float("0.00043708") + std = float("0.0400892") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [512, 256] + dtype = "float32" + min_val = float("-0.287385") + max_val = float("0.357764") + mean = float("-9.06711e-05") + std = float("0.0413978") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [21128, 256] + dtype = "float32" + min_val = float("-0.959517") + max_val = float("0.744417") + mean = float("0.00407568") + std = float("0.0760125") + data = None diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-small/graph_hash.txt b/paddle_samples/PaddleNLP/uer_chinese-roberta-small/graph_hash.txt new file mode 100644 index 0000000000..8f0bd95cbd --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-small/graph_hash.txt @@ -0,0 +1 @@ +410fe72f6e34c86109634efcbafa8aa4defe10c122dc61f0ee3030e588a65062 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-small/graph_net.json b/paddle_samples/PaddleNLP/uer_chinese-roberta-small/graph_net.json new file mode 100644 index 0000000000..cdecc83c8c --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-small/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "uer/chinese-roberta-small", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-small/input_meta.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-small/input_meta.py new file mode 100644 index 0000000000..26adb5b74e --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-small/input_meta.py @@ -0,0 +1,12 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 11] + dtype = "int64" + data = [101, 3614, 6816, 886, 4500, 4636, 2428, 7607, 3444, 106, 102] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 11] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-small/model.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-small/model.py new file mode 100644 index 0000000000..19d47997a2 --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-small/model.py @@ -0,0 +1,1005 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x11xb) <- (1x11xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x11xf32) <- (1x11xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x11xf32) <- (1x11xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x11xf32) <- (1x11xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.full: (1xf32) <- () + full_2 = paddle._C_ops.full( + [1], float("1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.full_like: (1x11xi64) <- (1x11xi64, 1xf32) + full_like_0 = paddle._C_ops.full_like( + data_0, full_2, paddle.int64, paddle.framework._current_expected_place() + ) + del full_2 + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("-1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x11xi64) <- (1x11xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_like_0, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x11xi64) <- (1x11xi64, 1x11xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_like_0) + del cumsum_0, full_like_0 + + # pd_op.embedding: (1x11x512xf32) <- (1x11xi64, 21128x512xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_70, -1, False) + del data_0, parameter_70 + + # pd_op.embedding: (1x11x512xf32) <- (1x11xi64, 512x512xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_69, -1, False) + del parameter_69 + + # pd_op.embedding: (1x11x512xf32) <- (1x11xi64, 2x512xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_68, -1, False) + del data_1, parameter_68 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_4 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_64) + del parameter_64 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 8, 64] + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_5 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 512] + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_20, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_21 = paddle._C_ops.add(matmul_17, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_22 = paddle._C_ops.add(matmul_18, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_8, full_5, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_3, transpose_9, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_23 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_2 = paddle._C_ops.softmax(add_23, -1) + del add_23 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_24 = paddle._C_ops.add(matmul_21, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_24, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_24 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_25 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_25, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_26 = paddle._C_ops.add(matmul_22, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_2 = paddle._C_ops.gelu(add_26, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_27 = paddle._C_ops.add(matmul_23, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_27, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_27 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_28 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_28, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_29 = paddle._C_ops.add(matmul_24, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_29, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_30 = paddle._C_ops.add(matmul_25, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_31 = paddle._C_ops.add(matmul_26, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x11x8x64xf32) <- (1x11x512xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_31, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x8x11x64xf32) <- (1x11x8x64xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x8x11x64xf32) <- (1x8x11x64xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_12, full_5, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x8x11x11xf32) <- (1x8x11x64xf32, 1x8x11x64xf32) + matmul_27 = paddle._C_ops.matmul(scale_4, transpose_13, False, True) + + # pd_op.add: (1x8x11x11xf32) <- (1x8x11x11xf32, 1x1x1x11xf32) + add_32 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x8x11x11xf32) <- (1x8x11x11xf32) + softmax_3 = paddle._C_ops.softmax(add_32, -1) + del add_32 + + # pd_op.dropout: (1x8x11x11xf32, 1x8x11x11xui8) <- (1x8x11x11xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x8x11x64xf32) <- (1x8x11x11xf32, 1x8x11x64xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x11x8x64xf32) <- (1x8x11x64xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x11x512xf32) <- (1x11x8x64xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x512xf32, 512x512xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_33 = paddle._C_ops.add(matmul_29, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_33, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_33 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_34 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_34, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x11x2048xf32) <- (1x11x512xf32, 512x2048xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x11x2048xf32) <- (1x11x2048xf32, 2048xf32) + add_35 = paddle._C_ops.add(matmul_30, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x11x2048xf32) <- (1x11x2048xf32) + gelu_3 = paddle._C_ops.gelu(add_35, False) + + # pd_op.matmul: (1x11x512xf32) <- (1x11x2048xf32, 2048x512xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_36 = paddle._C_ops.add(matmul_31, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x11x512xf32, 1x11x512xui8) <- (1x11x512xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_36, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_36 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 1x11x512xf32) + add_37 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x11x512xf32, 1x11xf32, 1x11xf32) <- (1x11x512xf32, 512xf32, 512xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_37, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x512xf32) <- (1x11x512xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_24, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x512xf32) <- (1x512xf32, 512x512xf32) + matmul_32 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x512xf32) <- (1x512xf32, 512xf32) + add_38 = paddle._C_ops.add(matmul_32, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x512xf32) <- (1x512xf32) + tanh_0 = paddle._C_ops.tanh(add_38) + del ( + add_0, + add_1, + add_10, + add_11, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_21, + add_22, + add_25, + add_26, + add_28, + add_29, + add_3, + add_30, + add_31, + add_34, + add_35, + add_37, + add_38, + add_4, + add_7, + add_8, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_2, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_3, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_3, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_2, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-small/weight_meta.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-small/weight_meta.py new file mode 100644 index 0000000000..3575a76667 --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-small/weight_meta.py @@ -0,0 +1,775 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [512] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.0853514") + max_val = float("0.0950647") + mean = float("5.9555e-05") + std = float("0.0200025") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [512] + dtype = "float32" + min_val = float("-0.285133") + max_val = float("0.295009") + mean = float("0.0131999") + std = float("0.0918136") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [512] + dtype = "float32" + min_val = float("0.308828") + max_val = float("0.851635") + mean = float("0.750939") + std = float("0.029551") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [512] + dtype = "float32" + min_val = float("-0.183279") + max_val = float("2.5826") + mean = float("0.0106127") + std = float("0.128723") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [512] + dtype = "float32" + min_val = float("0.060565") + max_val = float("0.934299") + mean = float("0.747429") + std = float("0.0456623") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [512] + dtype = "float32" + min_val = float("-0.389778") + max_val = float("0.981547") + mean = float("0.0013845") + std = float("0.067") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [2048, 512] + dtype = "float32" + min_val = float("-1.35703") + max_val = float("0.631788") + mean = float("1.1022e-05") + std = float("0.0525067") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [2048] + dtype = "float32" + min_val = float("-0.600269") + max_val = float("0.199222") + mean = float("-0.0405784") + std = float("0.0465654") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.322486") + max_val = float("0.500162") + mean = float("-0.00023012") + std = float("0.048437") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [512] + dtype = "float32" + min_val = float("-1.57453") + max_val = float("0.895715") + mean = float("-0.00135887") + std = float("0.206102") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [512, 512] + dtype = "float32" + min_val = float("-1.46469") + max_val = float("1.38967") + mean = float("-2.39241e-05") + std = float("0.0604957") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [512] + dtype = "float32" + min_val = float("-0.269414") + max_val = float("0.355979") + mean = float("0.00119801") + std = float("0.0883548") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.342485") + max_val = float("0.33106") + mean = float("-3.17287e-05") + std = float("0.0592665") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [512] + dtype = "float32" + min_val = float("-0.0677068") + max_val = float("0.0738035") + mean = float("0.000940104") + std = float("0.0199006") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.391174") + max_val = float("0.407587") + mean = float("0.000103735") + std = float("0.0641005") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [512] + dtype = "float32" + min_val = float("-0.478703") + max_val = float("0.583603") + mean = float("0.00311678") + std = float("0.149022") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.387281") + max_val = float("0.358092") + mean = float("-5.69617e-06") + std = float("0.0746507") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [512] + dtype = "float32" + min_val = float("-0.375975") + max_val = float("2.01503") + mean = float("-0.00958074") + std = float("0.103398") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [512] + dtype = "float32" + min_val = float("0.326465") + max_val = float("2.34237") + mean = float("0.967654") + std = float("0.0757283") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [512] + dtype = "float32" + min_val = float("-2.36482") + max_val = float("0.84853") + mean = float("-0.00806564") + std = float("0.147867") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [512] + dtype = "float32" + min_val = float("0.468206") + max_val = float("1.18603") + mean = float("0.759827") + std = float("0.0469544") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [512] + dtype = "float32" + min_val = float("-1.08295") + max_val = float("0.727912") + mean = float("-0.00141036") + std = float("0.0930161") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [2048, 512] + dtype = "float32" + min_val = float("-6.20887") + max_val = float("1.60519") + mean = float("-6.50345e-05") + std = float("0.0511081") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [2048] + dtype = "float32" + min_val = float("-0.456527") + max_val = float("0.309922") + mean = float("-0.0583104") + std = float("0.069133") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.988611") + max_val = float("1.14961") + mean = float("0.000551481") + std = float("0.048528") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [512] + dtype = "float32" + min_val = float("-1.49587") + max_val = float("0.881145") + mean = float("-0.000568827") + std = float("0.15503") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.397277") + max_val = float("0.311274") + mean = float("6.41769e-06") + std = float("0.0391068") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [512] + dtype = "float32" + min_val = float("-0.271999") + max_val = float("0.392983") + mean = float("0.000877071") + std = float("0.0798628") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.225559") + max_val = float("0.225098") + mean = float("-1.83833e-05") + std = float("0.0421453") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [512] + dtype = "float32" + min_val = float("-0.0593135") + max_val = float("0.055203") + mean = float("-0.000473231") + std = float("0.0208208") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.396359") + max_val = float("0.450657") + mean = float("1.53374e-05") + std = float("0.0631108") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [512] + dtype = "float32" + min_val = float("-0.526793") + max_val = float("0.564835") + mean = float("-0.00901267") + std = float("0.120404") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.370343") + max_val = float("0.454018") + mean = float("0.000166952") + std = float("0.0731587") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [512] + dtype = "float32" + min_val = float("-2.53347") + max_val = float("0.214631") + mean = float("0.00268089") + std = float("0.12869") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [512] + dtype = "float32" + min_val = float("0.52037") + max_val = float("1.08252") + mean = float("0.988191") + std = float("0.0486802") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [512] + dtype = "float32" + min_val = float("-4.28299") + max_val = float("2.11767") + mean = float("0.00631096") + std = float("0.250968") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [512] + dtype = "float32" + min_val = float("0.430946") + max_val = float("1.90497") + mean = float("0.71504") + std = float("0.0829984") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [512] + dtype = "float32" + min_val = float("-0.434947") + max_val = float("0.184985") + mean = float("-0.0012618") + std = float("0.0664156") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [2048, 512] + dtype = "float32" + min_val = float("-4.01021") + max_val = float("2.17637") + mean = float("-2.83783e-05") + std = float("0.0482471") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [2048] + dtype = "float32" + min_val = float("-0.62078") + max_val = float("0.366305") + mean = float("-0.0492464") + std = float("0.108634") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.44705") + max_val = float("0.571867") + mean = float("6.2045e-05") + std = float("0.0484605") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [512] + dtype = "float32" + min_val = float("-0.439777") + max_val = float("0.434547") + mean = float("-0.00154066") + std = float("0.112913") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.315007") + max_val = float("0.329597") + mean = float("3.2201e-06") + std = float("0.041194") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [512] + dtype = "float32" + min_val = float("-0.273715") + max_val = float("0.203961") + mean = float("-0.00258098") + std = float("0.051371") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.273594") + max_val = float("0.247069") + mean = float("0.000152529") + std = float("0.0437863") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [512] + dtype = "float32" + min_val = float("-0.057922") + max_val = float("0.0497662") + mean = float("-0.000233964") + std = float("0.0200562") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.460941") + max_val = float("0.385836") + mean = float("1.57751e-05") + std = float("0.0588128") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [512] + dtype = "float32" + min_val = float("-0.949092") + max_val = float("0.907451") + mean = float("0.00894412") + std = float("0.209014") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.303616") + max_val = float("0.317718") + mean = float("-6.95459e-05") + std = float("0.0598394") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [512] + dtype = "float32" + min_val = float("-3.06795") + max_val = float("1.38946") + mean = float("0.00767231") + std = float("0.16137") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [512] + dtype = "float32" + min_val = float("0.166465") + max_val = float("1.00247") + mean = float("0.916897") + std = float("0.0680055") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [512] + dtype = "float32" + min_val = float("-5.517") + max_val = float("3.66598") + mean = float("0.00772098") + std = float("0.340523") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [512] + dtype = "float32" + min_val = float("0.500708") + max_val = float("1.73878") + mean = float("0.711214") + std = float("0.065203") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [512] + dtype = "float32" + min_val = float("-0.407229") + max_val = float("0.224815") + mean = float("-0.00239871") + std = float("0.070309") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [2048, 512] + dtype = "float32" + min_val = float("-1.24924") + max_val = float("2.80134") + mean = float("-4.07727e-05") + std = float("0.0465667") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [2048] + dtype = "float32" + min_val = float("-0.67584") + max_val = float("0.29045") + mean = float("-0.0685763") + std = float("0.0951766") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [512, 2048] + dtype = "float32" + min_val = float("-0.739186") + max_val = float("0.311809") + mean = float("-0.000175311") + std = float("0.0463752") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [512] + dtype = "float32" + min_val = float("-0.583474") + max_val = float("0.349262") + mean = float("0.00177138") + std = float("0.100155") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.568401") + max_val = float("0.498897") + mean = float("1.74349e-05") + std = float("0.042578") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [512] + dtype = "float32" + min_val = float("-0.40007") + max_val = float("0.382327") + mean = float("-0.000636408") + std = float("0.100842") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.282576") + max_val = float("0.36214") + mean = float("-2.23894e-05") + std = float("0.040103") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [512] + dtype = "float32" + min_val = float("-0.0583618") + max_val = float("0.0776531") + mean = float("0.000636308") + std = float("0.0197227") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.426855") + max_val = float("0.367345") + mean = float("3.96919e-05") + std = float("0.0636377") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [512] + dtype = "float32" + min_val = float("-0.961696") + max_val = float("0.935042") + mean = float("-0.00530184") + std = float("0.32299") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.53319") + max_val = float("0.468279") + mean = float("1.24254e-05") + std = float("0.0622447") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [512] + dtype = "float32" + min_val = float("-0.563858") + max_val = float("1.62328") + mean = float("-0.0179776") + std = float("0.113391") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [512] + dtype = "float32" + min_val = float("0.109442") + max_val = float("1.20989") + mean = float("0.928801") + std = float("0.0843029") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [2, 512] + dtype = "float32" + min_val = float("-1.43248") + max_val = float("0.155856") + mean = float("0.000598596") + std = float("0.0480467") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [512, 512] + dtype = "float32" + min_val = float("-0.247809") + max_val = float("0.200772") + mean = float("2.58368e-05") + std = float("0.0287692") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [21128, 512] + dtype = "float32" + min_val = float("-1.28001") + max_val = float("1.19316") + mean = float("-0.000543955") + std = float("0.0633767") + data = None diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/graph_hash.txt b/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/graph_hash.txt new file mode 100644 index 0000000000..886537cf68 --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/graph_hash.txt @@ -0,0 +1 @@ +3dcb5ad9952ee31409fc1883741ea0f2c8db2b95ab84e583512e1a348420a7a9 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/graph_net.json b/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/graph_net.json new file mode 100644 index 0000000000..c7981cbdc3 --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "uer/chinese-roberta-tiny", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/input_meta.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/input_meta.py new file mode 100644 index 0000000000..26adb5b74e --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/input_meta.py @@ -0,0 +1,12 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 11] + dtype = "int64" + data = [101, 3614, 6816, 886, 4500, 4636, 2428, 7607, 3444, 106, 102] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 11] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/model.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/model.py new file mode 100644 index 0000000000..6cc07c498b --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/model.py @@ -0,0 +1,585 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x11xb) <- (1x11xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x11xf32) <- (1x11xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x11xf32) <- (1x11xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x11xf32) <- (1x11xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.full: (1xf32) <- () + full_2 = paddle._C_ops.full( + [1], float("1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.full_like: (1x11xi64) <- (1x11xi64, 1xf32) + full_like_0 = paddle._C_ops.full_like( + data_0, full_2, paddle.int64, paddle.framework._current_expected_place() + ) + del full_2 + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("-1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x11xi64) <- (1x11xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_like_0, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x11xi64) <- (1x11xi64, 1x11xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_like_0) + del cumsum_0, full_like_0 + + # pd_op.embedding: (1x11x128xf32) <- (1x11xi64, 21128x128xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_38, -1, False) + del data_0, parameter_38 + + # pd_op.embedding: (1x11x128xf32) <- (1x11xi64, 512x128xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_37, -1, False) + del parameter_37 + + # pd_op.embedding: (1x11x128xf32) <- (1x11xi64, 2x128xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_36, -1, False) + del data_1, parameter_36 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 1x11x128xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 1x11x128xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x11x128xf32, 1x11xf32, 1x11xf32) <- (1x11x128xf32, 128xf32, 128xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.dropout: (1x11x128xf32, 1x11x128xui8) <- (1x11x128xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x11x128xf32) <- (1x11x128xf32, 128x128xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 128xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_32) + del parameter_32 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 2, 64] + + # pd_op.reshape: (1x11x2x64xf32) <- (1x11x128xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x2x11x64xf32) <- (1x11x2x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x11x128xf32) <- (1x11x128xf32, 128x128xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 128xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x11x128xf32) <- (1x11x128xf32, 128x128xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 128xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x11x2x64xf32) <- (1x11x128xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x2x11x64xf32) <- (1x11x2x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x11x2x64xf32) <- (1x11x128xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x2x11x64xf32) <- (1x11x2x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_5 + + # pd_op.scale: (1x2x11x64xf32) <- (1x2x11x64xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x2x11x11xf32) <- (1x2x11x64xf32, 1x2x11x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x2x11x11xf32) <- (1x2x11x11xf32, 1x1x1x11xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x2x11x11xf32) <- (1x2x11x11xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x2x11x11xf32, 1x2x11x11xui8) <- (1x2x11x11xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x2x11x64xf32) <- (1x2x11x11xf32, 1x2x11x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x11x2x64xf32) <- (1x2x11x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 128] + + # pd_op.reshape: (1x11x128xf32) <- (1x11x2x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x11x128xf32) <- (1x11x128xf32, 128x128xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 128xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x11x128xf32, 1x11x128xui8) <- (1x11x128xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 1x11x128xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x11x128xf32, 1x11xf32, 1x11xf32) <- (1x11x128xf32, 128xf32, 128xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x128xf32, 128x512xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x11x512xf32) <- (1x11x512xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x11x128xf32) <- (1x11x512xf32, 512x128xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 128xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x11x128xf32, 1x11x128xui8) <- (1x11x128xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 1x11x128xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x11x128xf32, 1x11xf32, 1x11xf32) <- (1x11x128xf32, 128xf32, 128xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x11x128xf32) <- (1x11x128xf32, 128x128xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 128xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x11x2x64xf32) <- (1x11x128xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x2x11x64xf32) <- (1x11x2x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x11x128xf32) <- (1x11x128xf32, 128x128xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 128xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x11x128xf32) <- (1x11x128xf32, 128x128xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 128xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x11x2x64xf32) <- (1x11x128xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x2x11x64xf32) <- (1x11x2x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x11x2x64xf32) <- (1x11x128xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x2x11x64xf32) <- (1x11x2x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x2x11x64xf32) <- (1x2x11x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x2x11x11xf32) <- (1x2x11x64xf32, 1x2x11x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x2x11x11xf32) <- (1x2x11x11xf32, 1x1x1x11xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x2x11x11xf32) <- (1x2x11x11xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x2x11x11xf32, 1x2x11x11xui8) <- (1x2x11x11xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x2x11x64xf32) <- (1x2x11x11xf32, 1x2x11x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x11x2x64xf32) <- (1x2x11x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x11x128xf32) <- (1x11x2x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x11x128xf32) <- (1x11x128xf32, 128x128xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 128xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x11x128xf32, 1x11x128xui8) <- (1x11x128xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 1x11x128xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x11x128xf32, 1x11xf32, 1x11xf32) <- (1x11x128xf32, 128xf32, 128xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x11x512xf32) <- (1x11x128xf32, 128x512xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x11x512xf32) <- (1x11x512xf32, 512xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x11x512xf32) <- (1x11x512xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x11x128xf32) <- (1x11x512xf32, 512x128xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 128xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x11x128xf32, 1x11x128xui8) <- (1x11x128xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x11x128xf32) <- (1x11x128xf32, 1x11x128xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x11x128xf32, 1x11xf32, 1x11xf32) <- (1x11x128xf32, 128xf32, 128xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x128xf32) <- (1x11x128xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_12, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x128xf32) <- (1x128xf32, 128x128xf32) + matmul_16 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x128xf32) <- (1x128xf32, 128xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x128xf32) <- (1x128xf32) + tanh_0 = paddle._C_ops.tanh(add_20) + del ( + add_0, + add_1, + add_10, + add_11, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_3, + add_4, + add_7, + add_8, + assign_0, + assign_1, + assign_2, + assign_3, + assign_4, + assign_5, + assign_6, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_2, + dropout_3, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_2, + layer_norm_3, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_2, + matmul_3, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_3, + reshape_7, + scale_1, + scale_2, + slice_0, + softmax_0, + softmax_1, + subtract_0, + transpose_1, + transpose_2, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/weight_meta.py b/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/weight_meta.py new file mode 100644 index 0000000000..261dbf6a98 --- /dev/null +++ b/paddle_samples/PaddleNLP/uer_chinese-roberta-tiny/weight_meta.py @@ -0,0 +1,423 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [128] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.0738192") + max_val = float("0.0819443") + mean = float("0.000251481") + std = float("0.0200562") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [128] + dtype = "float32" + min_val = float("-0.345691") + max_val = float("0.240034") + mean = float("-0.0710259") + std = float("0.120129") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [128] + dtype = "float32" + min_val = float("0.617702") + max_val = float("1.12922") + mean = float("0.852454") + std = float("0.0684457") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [128] + dtype = "float32" + min_val = float("-0.789047") + max_val = float("0.826397") + mean = float("-0.0711189") + std = float("0.252549") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [128] + dtype = "float32" + min_val = float("0.288111") + max_val = float("0.897566") + mean = float("0.696056") + std = float("0.0869918") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [128] + dtype = "float32" + min_val = float("-0.194167") + max_val = float("0.238244") + mean = float("0.000157") + std = float("0.0768924") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [512, 128] + dtype = "float32" + min_val = float("-0.755347") + max_val = float("1.09846") + mean = float("-5.13306e-05") + std = float("0.106231") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [512] + dtype = "float32" + min_val = float("-1.23892") + max_val = float("0.517838") + mean = float("-0.0948955") + std = float("0.199168") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [128, 512] + dtype = "float32" + min_val = float("-0.570108") + max_val = float("0.738421") + mean = float("0.00317295") + std = float("0.0855643") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [128] + dtype = "float32" + min_val = float("-1.31958") + max_val = float("0.624054") + mean = float("-0.026416") + std = float("0.306631") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.601906") + max_val = float("0.700219") + mean = float("-0.000945331") + std = float("0.110952") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [128] + dtype = "float32" + min_val = float("-0.612542") + max_val = float("0.521447") + mean = float("-0.0243807") + std = float("0.212532") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.344016") + max_val = float("0.35199") + mean = float("0.000245042") + std = float("0.0936781") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [128] + dtype = "float32" + min_val = float("-0.0530814") + max_val = float("0.0489295") + mean = float("0.00120447") + std = float("0.0206514") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.506061") + max_val = float("0.487803") + mean = float("0.000604782") + std = float("0.0988145") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [128] + dtype = "float32" + min_val = float("-0.795635") + max_val = float("0.745104") + mean = float("0.0411912") + std = float("0.350912") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.641046") + max_val = float("0.722141") + mean = float("-0.00170756") + std = float("0.149604") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [128] + dtype = "float32" + min_val = float("-0.73837") + max_val = float("0.481136") + mean = float("-0.0592049") + std = float("0.179315") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [128] + dtype = "float32" + min_val = float("0.351513") + max_val = float("1.39197") + mean = float("1.17094") + std = float("0.138775") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [128] + dtype = "float32" + min_val = float("-5.68624") + max_val = float("2.35035") + mean = float("-0.1385") + std = float("0.707833") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [128] + dtype = "float32" + min_val = float("0.740039") + max_val = float("1.98419") + mean = float("0.910219") + std = float("0.1471") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [128] + dtype = "float32" + min_val = float("-0.597832") + max_val = float("0.162781") + mean = float("-0.000419887") + std = float("0.106246") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [512, 128] + dtype = "float32" + min_val = float("-1.52377") + max_val = float("1.33744") + mean = float("0.000233206") + std = float("0.0861777") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [512] + dtype = "float32" + min_val = float("-0.820698") + max_val = float("0.762649") + mean = float("-0.107814") + std = float("0.203442") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [128, 512] + dtype = "float32" + min_val = float("-0.526611") + max_val = float("0.86883") + mean = float("0.00488789") + std = float("0.0836277") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [128] + dtype = "float32" + min_val = float("-0.980047") + max_val = float("0.943843") + mean = float("-0.00407626") + std = float("0.262808") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.535228") + max_val = float("0.421807") + mean = float("0.000183214") + std = float("0.101228") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [128] + dtype = "float32" + min_val = float("-0.270218") + max_val = float("0.494839") + mean = float("0.0330678") + std = float("0.146544") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.467937") + max_val = float("0.557416") + mean = float("0.000165685") + std = float("0.101534") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [128] + dtype = "float32" + min_val = float("-0.041637") + max_val = float("0.0492047") + mean = float("0.00147209") + std = float("0.0191146") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.606251") + max_val = float("0.938362") + mean = float("8.58163e-05") + std = float("0.119068") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [128] + dtype = "float32" + min_val = float("-0.905912") + max_val = float("1.07461") + mean = float("0.0269997") + std = float("0.323691") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.610763") + max_val = float("0.490835") + mean = float("-0.000316243") + std = float("0.114291") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [128] + dtype = "float32" + min_val = float("-2.56582") + max_val = float("1.71321") + mean = float("-0.00513435") + std = float("0.375663") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [128] + dtype = "float32" + min_val = float("0.389855") + max_val = float("1.81183") + mean = float("1.15541") + std = float("0.130187") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [2, 128] + dtype = "float32" + min_val = float("-0.429982") + max_val = float("0.419346") + mean = float("-0.00133231") + std = float("0.0509446") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [512, 128] + dtype = "float32" + min_val = float("-0.34087") + max_val = float("0.322224") + mean = float("0.00026982") + std = float("0.0629161") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [21128, 128] + dtype = "float32" + min_val = float("-1.41583") + max_val = float("1.38687") + mean = float("0.011578") + std = float("0.0917692") + data = None diff --git a/paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/graph_hash.txt b/paddle_samples/PaddleNLP/utc-base/graph_hash.txt similarity index 100% rename from paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/graph_hash.txt rename to paddle_samples/PaddleNLP/utc-base/graph_hash.txt diff --git a/paddle_samples/PaddleNLP/utc-base/graph_net.json b/paddle_samples/PaddleNLP/utc-base/graph_net.json new file mode 100644 index 0000000000..e8061d2e16 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-base/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "utc-base", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-base/input_meta.py b/paddle_samples/PaddleNLP/utc-base/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-base/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/utc-base/model.py b/paddle_samples/PaddleNLP/utc-base/model.py new file mode 100644 index 0000000000..8a5cbad4e9 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-base/model.py @@ -0,0 +1,2682 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + parameter_72, + parameter_73, + parameter_74, + parameter_75, + parameter_76, + parameter_77, + parameter_78, + parameter_79, + parameter_80, + parameter_81, + parameter_82, + parameter_83, + parameter_84, + parameter_85, + parameter_86, + parameter_87, + parameter_88, + parameter_89, + parameter_90, + parameter_91, + parameter_92, + parameter_93, + parameter_94, + parameter_95, + parameter_96, + parameter_97, + parameter_98, + parameter_99, + parameter_100, + parameter_101, + parameter_102, + parameter_103, + parameter_104, + parameter_105, + parameter_106, + parameter_107, + parameter_108, + parameter_109, + parameter_110, + parameter_111, + parameter_112, + parameter_113, + parameter_114, + parameter_115, + parameter_116, + parameter_117, + parameter_118, + parameter_119, + parameter_120, + parameter_121, + parameter_122, + parameter_123, + parameter_124, + parameter_125, + parameter_126, + parameter_127, + parameter_128, + parameter_129, + parameter_130, + parameter_131, + parameter_132, + parameter_133, + parameter_134, + parameter_135, + parameter_136, + parameter_137, + parameter_138, + parameter_139, + parameter_140, + parameter_141, + parameter_142, + parameter_143, + parameter_144, + parameter_145, + parameter_146, + parameter_147, + parameter_148, + parameter_149, + parameter_150, + parameter_151, + parameter_152, + parameter_153, + parameter_154, + parameter_155, + parameter_156, + parameter_157, + parameter_158, + parameter_159, + parameter_160, + parameter_161, + parameter_162, + parameter_163, + parameter_164, + parameter_165, + parameter_166, + parameter_167, + parameter_168, + parameter_169, + parameter_170, + parameter_171, + parameter_172, + parameter_173, + parameter_174, + parameter_175, + parameter_176, + parameter_177, + parameter_178, + parameter_179, + parameter_180, + parameter_181, + parameter_182, + parameter_183, + parameter_184, + parameter_185, + parameter_186, + parameter_187, + parameter_188, + parameter_189, + parameter_190, + parameter_191, + parameter_192, + parameter_193, + parameter_194, + parameter_195, + parameter_196, + parameter_197, + parameter_198, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 39981x768xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_198, 0, False) + del data_0, parameter_198 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0, full_2 + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 2048x768xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_197, -1, False) + del parameter_197 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 4x768xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_196, -1, False) + del data_1, parameter_196 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_195, parameter_194, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_194, parameter_195 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_15 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_16 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_17 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_18 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_19 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_20 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_21 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_22 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_23 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_24 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_25 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_26 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_27 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_28 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_29 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_30 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_31 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_32 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_33 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_34 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_35 = full_4 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_193, False, False) + del parameter_193 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_192) + del parameter_192 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 64] + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_191, False, False) + del parameter_191 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_190) + del parameter_190 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_189, False, False) + del parameter_189 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_188) + del parameter_188 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_36 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_37 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_38 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_39 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_40 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_41 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_42 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_43 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_44 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_45 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_46 = full_5 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 768] + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_187, False, False) + del parameter_187 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_186) + del parameter_186 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_181, parameter_180, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_180, parameter_181 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_185, False, False) + del parameter_185 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_184) + del parameter_184 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_183, False, False) + del parameter_183 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_182) + del parameter_182 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_179, parameter_178, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_178, parameter_179 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_177, False, False) + del parameter_177 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_176) + del parameter_176 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_175, False, False) + del parameter_175 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_174) + del parameter_174 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_173, False, False) + del parameter_173 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_172) + del parameter_172 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_171, False, False) + del parameter_171 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_170) + del parameter_170 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_165, parameter_164, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_164, parameter_165 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_169, False, False) + del parameter_169 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_168) + del parameter_168 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_167, False, False) + del parameter_167 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_166) + del parameter_166 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_163, parameter_162, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_162, parameter_163 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_161, False, False) + del parameter_161 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_160) + del parameter_160 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_20, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_159, False, False) + del parameter_159 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_21 = paddle._C_ops.add(matmul_17, parameter_158) + del parameter_158 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_157, False, False) + del parameter_157 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_22 = paddle._C_ops.add(matmul_18, parameter_156) + del parameter_156 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_8, full_5, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_3, transpose_9, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_23 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_23, -1) + del add_23 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_155, False, False) + del parameter_155 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_24 = paddle._C_ops.add(matmul_21, parameter_154) + del parameter_154 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_24, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_24 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_25 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_25, parameter_149, parameter_148, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_148, parameter_149 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_153, False, False) + del parameter_153 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_26 = paddle._C_ops.add(matmul_22, parameter_152) + del parameter_152 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_2 = paddle._C_ops.gelu(add_26, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_151, False, False) + del parameter_151 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_27 = paddle._C_ops.add(matmul_23, parameter_150) + del parameter_150 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_27, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_27 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_28 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_28, parameter_147, parameter_146, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_146, parameter_147 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_145, False, False) + del parameter_145 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_29 = paddle._C_ops.add(matmul_24, parameter_144) + del parameter_144 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_29, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_143, False, False) + del parameter_143 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_30 = paddle._C_ops.add(matmul_25, parameter_142) + del parameter_142 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_141, False, False) + del parameter_141 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_31 = paddle._C_ops.add(matmul_26, parameter_140) + del parameter_140 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_12, full_5, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_27 = paddle._C_ops.matmul(scale_4, transpose_13, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_32 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_32, -1) + del add_32 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_139, False, False) + del parameter_139 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_33 = paddle._C_ops.add(matmul_29, parameter_138) + del parameter_138 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_33, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_33 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_34 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_34, parameter_133, parameter_132, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_132, parameter_133 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_137, False, False) + del parameter_137 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_35 = paddle._C_ops.add(matmul_30, parameter_136) + del parameter_136 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_3 = paddle._C_ops.gelu(add_35, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_135, False, False) + del parameter_135 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_36 = paddle._C_ops.add(matmul_31, parameter_134) + del parameter_134 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_36, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_36 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_37 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_37, parameter_131, parameter_130, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_130, parameter_131 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_32 = paddle._C_ops.matmul(layer_norm_24, parameter_129, False, False) + del parameter_129 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_38 = paddle._C_ops.add(matmul_32, parameter_128) + del parameter_128 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_16 = paddle._C_ops.reshape(add_38, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_16 = paddle._C_ops.transpose(reshape_16, [0, 2, 1, 3]) + del reshape_16 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_33 = paddle._C_ops.matmul(layer_norm_24, parameter_127, False, False) + del parameter_127 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_39 = paddle._C_ops.add(matmul_33, parameter_126) + del parameter_126 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_34 = paddle._C_ops.matmul(layer_norm_24, parameter_125, False, False) + del parameter_125 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_40 = paddle._C_ops.add(matmul_34, parameter_124) + del parameter_124 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_17 = paddle._C_ops.reshape(add_39, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_17 = paddle._C_ops.transpose(reshape_17, [0, 2, 1, 3]) + del reshape_17 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_18 = paddle._C_ops.reshape(add_40, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_18 = paddle._C_ops.transpose(reshape_18, [0, 2, 1, 3]) + del reshape_18 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_16, full_5, float("0"), True) + del transpose_16 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_35 = paddle._C_ops.matmul(scale_5, transpose_17, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_41 = paddle._C_ops.add(matmul_35, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_4 = paddle._C_ops.softmax(add_41, -1) + del add_41 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_26, dropout_27 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_4, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_36 = paddle._C_ops.matmul(dropout_26, transpose_18, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_19 = paddle._C_ops.transpose(matmul_36, [0, 2, 1, 3]) + del matmul_36 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_19 = paddle._C_ops.reshape(transpose_19, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_37 = paddle._C_ops.matmul(reshape_19, parameter_123, False, False) + del parameter_123 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_42 = paddle._C_ops.add(matmul_37, parameter_122) + del parameter_122 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_28, dropout_29 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_42, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_42 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_43 = paddle._C_ops.add(layer_norm_24, dropout_28) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_27, layer_norm_28, layer_norm_29 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_43, parameter_117, parameter_116, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_116, parameter_117 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_38 = paddle._C_ops.matmul(layer_norm_27, parameter_121, False, False) + del parameter_121 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_44 = paddle._C_ops.add(matmul_38, parameter_120) + del parameter_120 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_4 = paddle._C_ops.gelu(add_44, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_39 = paddle._C_ops.matmul(gelu_4, parameter_119, False, False) + del parameter_119 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_45 = paddle._C_ops.add(matmul_39, parameter_118) + del parameter_118 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_30, dropout_31 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_45, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_45 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_46 = paddle._C_ops.add(layer_norm_27, dropout_30) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_30, layer_norm_31, layer_norm_32 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_46, parameter_115, parameter_114, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_114, parameter_115 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_40 = paddle._C_ops.matmul(layer_norm_30, parameter_113, False, False) + del parameter_113 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_47 = paddle._C_ops.add(matmul_40, parameter_112) + del parameter_112 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_20 = paddle._C_ops.reshape(add_47, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_20 = paddle._C_ops.transpose(reshape_20, [0, 2, 1, 3]) + del reshape_20 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_41 = paddle._C_ops.matmul(layer_norm_30, parameter_111, False, False) + del parameter_111 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_48 = paddle._C_ops.add(matmul_41, parameter_110) + del parameter_110 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_42 = paddle._C_ops.matmul(layer_norm_30, parameter_109, False, False) + del parameter_109 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_49 = paddle._C_ops.add(matmul_42, parameter_108) + del parameter_108 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_21 = paddle._C_ops.reshape(add_48, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_21 = paddle._C_ops.transpose(reshape_21, [0, 2, 1, 3]) + del reshape_21 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_22 = paddle._C_ops.reshape(add_49, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_22 = paddle._C_ops.transpose(reshape_22, [0, 2, 1, 3]) + del reshape_22 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_6 = paddle._C_ops.scale(transpose_20, full_5, float("0"), True) + del transpose_20 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_43 = paddle._C_ops.matmul(scale_6, transpose_21, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_50 = paddle._C_ops.add(matmul_43, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_5 = paddle._C_ops.softmax(add_50, -1) + del add_50 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_32, dropout_33 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_5, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_44 = paddle._C_ops.matmul(dropout_32, transpose_22, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_23 = paddle._C_ops.transpose(matmul_44, [0, 2, 1, 3]) + del matmul_44 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_23 = paddle._C_ops.reshape(transpose_23, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_45 = paddle._C_ops.matmul(reshape_23, parameter_107, False, False) + del parameter_107 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_51 = paddle._C_ops.add(matmul_45, parameter_106) + del parameter_106 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_34, dropout_35 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_51, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_51 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_52 = paddle._C_ops.add(layer_norm_30, dropout_34) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_33, layer_norm_34, layer_norm_35 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_52, parameter_101, parameter_100, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_100, parameter_101 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_46 = paddle._C_ops.matmul(layer_norm_33, parameter_105, False, False) + del parameter_105 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_53 = paddle._C_ops.add(matmul_46, parameter_104) + del parameter_104 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_5 = paddle._C_ops.gelu(add_53, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_47 = paddle._C_ops.matmul(gelu_5, parameter_103, False, False) + del parameter_103 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_54 = paddle._C_ops.add(matmul_47, parameter_102) + del parameter_102 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_36, dropout_37 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_54, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_54 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_55 = paddle._C_ops.add(layer_norm_33, dropout_36) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_36, layer_norm_37, layer_norm_38 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_55, parameter_99, parameter_98, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_98, parameter_99 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_48 = paddle._C_ops.matmul(layer_norm_36, parameter_97, False, False) + del parameter_97 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_56 = paddle._C_ops.add(matmul_48, parameter_96) + del parameter_96 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_24 = paddle._C_ops.reshape(add_56, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_24 = paddle._C_ops.transpose(reshape_24, [0, 2, 1, 3]) + del reshape_24 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_49 = paddle._C_ops.matmul(layer_norm_36, parameter_95, False, False) + del parameter_95 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_57 = paddle._C_ops.add(matmul_49, parameter_94) + del parameter_94 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_50 = paddle._C_ops.matmul(layer_norm_36, parameter_93, False, False) + del parameter_93 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_58 = paddle._C_ops.add(matmul_50, parameter_92) + del parameter_92 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_25 = paddle._C_ops.reshape(add_57, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_25 = paddle._C_ops.transpose(reshape_25, [0, 2, 1, 3]) + del reshape_25 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_26 = paddle._C_ops.reshape(add_58, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_26 = paddle._C_ops.transpose(reshape_26, [0, 2, 1, 3]) + del reshape_26 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_7 = paddle._C_ops.scale(transpose_24, full_5, float("0"), True) + del transpose_24 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_51 = paddle._C_ops.matmul(scale_7, transpose_25, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_59 = paddle._C_ops.add(matmul_51, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_6 = paddle._C_ops.softmax(add_59, -1) + del add_59 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_38, dropout_39 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_52 = paddle._C_ops.matmul(dropout_38, transpose_26, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_27 = paddle._C_ops.transpose(matmul_52, [0, 2, 1, 3]) + del matmul_52 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_27 = paddle._C_ops.reshape(transpose_27, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_53 = paddle._C_ops.matmul(reshape_27, parameter_91, False, False) + del parameter_91 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_60 = paddle._C_ops.add(matmul_53, parameter_90) + del parameter_90 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_40, dropout_41 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_60, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_60 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_61 = paddle._C_ops.add(layer_norm_36, dropout_40) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_39, layer_norm_40, layer_norm_41 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_61, parameter_85, parameter_84, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_84, parameter_85 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_54 = paddle._C_ops.matmul(layer_norm_39, parameter_89, False, False) + del parameter_89 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_62 = paddle._C_ops.add(matmul_54, parameter_88) + del parameter_88 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_6 = paddle._C_ops.gelu(add_62, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_55 = paddle._C_ops.matmul(gelu_6, parameter_87, False, False) + del parameter_87 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_63 = paddle._C_ops.add(matmul_55, parameter_86) + del parameter_86 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_42, dropout_43 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_63, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_63 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_64 = paddle._C_ops.add(layer_norm_39, dropout_42) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_42, layer_norm_43, layer_norm_44 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_64, parameter_83, parameter_82, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_82, parameter_83 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_56 = paddle._C_ops.matmul(layer_norm_42, parameter_81, False, False) + del parameter_81 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_65 = paddle._C_ops.add(matmul_56, parameter_80) + del parameter_80 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_28 = paddle._C_ops.reshape(add_65, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_28 = paddle._C_ops.transpose(reshape_28, [0, 2, 1, 3]) + del reshape_28 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_57 = paddle._C_ops.matmul(layer_norm_42, parameter_79, False, False) + del parameter_79 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_66 = paddle._C_ops.add(matmul_57, parameter_78) + del parameter_78 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_58 = paddle._C_ops.matmul(layer_norm_42, parameter_77, False, False) + del parameter_77 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_67 = paddle._C_ops.add(matmul_58, parameter_76) + del parameter_76 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_29 = paddle._C_ops.reshape(add_66, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_29 = paddle._C_ops.transpose(reshape_29, [0, 2, 1, 3]) + del reshape_29 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_30 = paddle._C_ops.reshape(add_67, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_30 = paddle._C_ops.transpose(reshape_30, [0, 2, 1, 3]) + del reshape_30 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_8 = paddle._C_ops.scale(transpose_28, full_5, float("0"), True) + del transpose_28 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_59 = paddle._C_ops.matmul(scale_8, transpose_29, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_68 = paddle._C_ops.add(matmul_59, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_7 = paddle._C_ops.softmax(add_68, -1) + del add_68 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_44, dropout_45 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_7, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_60 = paddle._C_ops.matmul(dropout_44, transpose_30, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_31 = paddle._C_ops.transpose(matmul_60, [0, 2, 1, 3]) + del matmul_60 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_31 = paddle._C_ops.reshape(transpose_31, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_61 = paddle._C_ops.matmul(reshape_31, parameter_75, False, False) + del parameter_75 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_69 = paddle._C_ops.add(matmul_61, parameter_74) + del parameter_74 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_46, dropout_47 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_69, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_69 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_70 = paddle._C_ops.add(layer_norm_42, dropout_46) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_45, layer_norm_46, layer_norm_47 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_70, parameter_69, parameter_68, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_68, parameter_69 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_62 = paddle._C_ops.matmul(layer_norm_45, parameter_73, False, False) + del parameter_73 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_71 = paddle._C_ops.add(matmul_62, parameter_72) + del parameter_72 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_7 = paddle._C_ops.gelu(add_71, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_63 = paddle._C_ops.matmul(gelu_7, parameter_71, False, False) + del parameter_71 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_72 = paddle._C_ops.add(matmul_63, parameter_70) + del parameter_70 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_48, dropout_49 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_72, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_72 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_73 = paddle._C_ops.add(layer_norm_45, dropout_48) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_48, layer_norm_49, layer_norm_50 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_73, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_64 = paddle._C_ops.matmul(layer_norm_48, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_74 = paddle._C_ops.add(matmul_64, parameter_64) + del parameter_64 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_32 = paddle._C_ops.reshape(add_74, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_32 = paddle._C_ops.transpose(reshape_32, [0, 2, 1, 3]) + del reshape_32 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_65 = paddle._C_ops.matmul(layer_norm_48, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_75 = paddle._C_ops.add(matmul_65, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_66 = paddle._C_ops.matmul(layer_norm_48, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_76 = paddle._C_ops.add(matmul_66, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_33 = paddle._C_ops.reshape(add_75, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_33 = paddle._C_ops.transpose(reshape_33, [0, 2, 1, 3]) + del reshape_33 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_34 = paddle._C_ops.reshape(add_76, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_34 = paddle._C_ops.transpose(reshape_34, [0, 2, 1, 3]) + del reshape_34 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_9 = paddle._C_ops.scale(transpose_32, full_5, float("0"), True) + del transpose_32 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_67 = paddle._C_ops.matmul(scale_9, transpose_33, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_77 = paddle._C_ops.add(matmul_67, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_8 = paddle._C_ops.softmax(add_77, -1) + del add_77 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_50, dropout_51 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_8, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_68 = paddle._C_ops.matmul(dropout_50, transpose_34, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_35 = paddle._C_ops.transpose(matmul_68, [0, 2, 1, 3]) + del matmul_68 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_35 = paddle._C_ops.reshape(transpose_35, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_69 = paddle._C_ops.matmul(reshape_35, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_78 = paddle._C_ops.add(matmul_69, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_52, dropout_53 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_78, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_78 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_79 = paddle._C_ops.add(layer_norm_48, dropout_52) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_51, layer_norm_52, layer_norm_53 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_79, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_70 = paddle._C_ops.matmul(layer_norm_51, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_80 = paddle._C_ops.add(matmul_70, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_8 = paddle._C_ops.gelu(add_80, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_71 = paddle._C_ops.matmul(gelu_8, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_81 = paddle._C_ops.add(matmul_71, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_54, dropout_55 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_81, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_81 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_82 = paddle._C_ops.add(layer_norm_51, dropout_54) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_54, layer_norm_55, layer_norm_56 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_82, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_72 = paddle._C_ops.matmul(layer_norm_54, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_83 = paddle._C_ops.add(matmul_72, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_36 = paddle._C_ops.reshape(add_83, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_36 = paddle._C_ops.transpose(reshape_36, [0, 2, 1, 3]) + del reshape_36 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_73 = paddle._C_ops.matmul(layer_norm_54, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_84 = paddle._C_ops.add(matmul_73, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_74 = paddle._C_ops.matmul(layer_norm_54, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_85 = paddle._C_ops.add(matmul_74, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_37 = paddle._C_ops.reshape(add_84, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_37 = paddle._C_ops.transpose(reshape_37, [0, 2, 1, 3]) + del reshape_37 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_38 = paddle._C_ops.reshape(add_85, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_38 = paddle._C_ops.transpose(reshape_38, [0, 2, 1, 3]) + del reshape_38 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_10 = paddle._C_ops.scale(transpose_36, full_5, float("0"), True) + del transpose_36 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_75 = paddle._C_ops.matmul(scale_10, transpose_37, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_86 = paddle._C_ops.add(matmul_75, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_9 = paddle._C_ops.softmax(add_86, -1) + del add_86 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_56, dropout_57 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_76 = paddle._C_ops.matmul(dropout_56, transpose_38, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_39 = paddle._C_ops.transpose(matmul_76, [0, 2, 1, 3]) + del matmul_76 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_39 = paddle._C_ops.reshape(transpose_39, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_77 = paddle._C_ops.matmul(reshape_39, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_87 = paddle._C_ops.add(matmul_77, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_58, dropout_59 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_87, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_87 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_88 = paddle._C_ops.add(layer_norm_54, dropout_58) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_57, layer_norm_58, layer_norm_59 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_88, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_78 = paddle._C_ops.matmul(layer_norm_57, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_89 = paddle._C_ops.add(matmul_78, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_9 = paddle._C_ops.gelu(add_89, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_79 = paddle._C_ops.matmul(gelu_9, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_90 = paddle._C_ops.add(matmul_79, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_60, dropout_61 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_90, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_90 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_91 = paddle._C_ops.add(layer_norm_57, dropout_60) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_60, layer_norm_61, layer_norm_62 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_91, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_80 = paddle._C_ops.matmul(layer_norm_60, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_92 = paddle._C_ops.add(matmul_80, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_40 = paddle._C_ops.reshape(add_92, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_40 = paddle._C_ops.transpose(reshape_40, [0, 2, 1, 3]) + del reshape_40 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_81 = paddle._C_ops.matmul(layer_norm_60, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_93 = paddle._C_ops.add(matmul_81, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_82 = paddle._C_ops.matmul(layer_norm_60, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_94 = paddle._C_ops.add(matmul_82, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_41 = paddle._C_ops.reshape(add_93, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_41 = paddle._C_ops.transpose(reshape_41, [0, 2, 1, 3]) + del reshape_41 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_42 = paddle._C_ops.reshape(add_94, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_42 = paddle._C_ops.transpose(reshape_42, [0, 2, 1, 3]) + del reshape_42 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_11 = paddle._C_ops.scale(transpose_40, full_5, float("0"), True) + del transpose_40 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_83 = paddle._C_ops.matmul(scale_11, transpose_41, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_95 = paddle._C_ops.add(matmul_83, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_10 = paddle._C_ops.softmax(add_95, -1) + del add_95 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_62, dropout_63 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_10, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_84 = paddle._C_ops.matmul(dropout_62, transpose_42, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_43 = paddle._C_ops.transpose(matmul_84, [0, 2, 1, 3]) + del matmul_84 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_43 = paddle._C_ops.reshape(transpose_43, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_85 = paddle._C_ops.matmul(reshape_43, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_96 = paddle._C_ops.add(matmul_85, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_64, dropout_65 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_96, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_96 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_97 = paddle._C_ops.add(layer_norm_60, dropout_64) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_63, layer_norm_64, layer_norm_65 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_97, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_86 = paddle._C_ops.matmul(layer_norm_63, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_98 = paddle._C_ops.add(matmul_86, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_10 = paddle._C_ops.gelu(add_98, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_87 = paddle._C_ops.matmul(gelu_10, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_99 = paddle._C_ops.add(matmul_87, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_66, dropout_67 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_99, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_99 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_100 = paddle._C_ops.add(layer_norm_63, dropout_66) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_66, layer_norm_67, layer_norm_68 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_100, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_88 = paddle._C_ops.matmul(layer_norm_66, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_101 = paddle._C_ops.add(matmul_88, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_44 = paddle._C_ops.reshape(add_101, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_44 = paddle._C_ops.transpose(reshape_44, [0, 2, 1, 3]) + del reshape_44 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_89 = paddle._C_ops.matmul(layer_norm_66, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_102 = paddle._C_ops.add(matmul_89, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_90 = paddle._C_ops.matmul(layer_norm_66, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_103 = paddle._C_ops.add(matmul_90, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_45 = paddle._C_ops.reshape(add_102, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_45 = paddle._C_ops.transpose(reshape_45, [0, 2, 1, 3]) + del reshape_45 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_46 = paddle._C_ops.reshape(add_103, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_46 = paddle._C_ops.transpose(reshape_46, [0, 2, 1, 3]) + del reshape_46 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_12 = paddle._C_ops.scale(transpose_44, full_5, float("0"), True) + del transpose_44 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_91 = paddle._C_ops.matmul(scale_12, transpose_45, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_104 = paddle._C_ops.add(matmul_91, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_11 = paddle._C_ops.softmax(add_104, -1) + del add_104 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_68, dropout_69 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_11, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_92 = paddle._C_ops.matmul(dropout_68, transpose_46, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_47 = paddle._C_ops.transpose(matmul_92, [0, 2, 1, 3]) + del matmul_92 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_47 = paddle._C_ops.reshape(transpose_47, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_93 = paddle._C_ops.matmul(reshape_47, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_105 = paddle._C_ops.add(matmul_93, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_70, dropout_71 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_105, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_105 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_106 = paddle._C_ops.add(layer_norm_66, dropout_70) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_69, layer_norm_70, layer_norm_71 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_106, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_94 = paddle._C_ops.matmul(layer_norm_69, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_107 = paddle._C_ops.add(matmul_94, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_11 = paddle._C_ops.gelu(add_107, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_95 = paddle._C_ops.matmul(gelu_11, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_108 = paddle._C_ops.add(matmul_95, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_72, dropout_73 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_108, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_108 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_109 = paddle._C_ops.add(layer_norm_69, dropout_72) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_72, layer_norm_73, layer_norm_74 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_109, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x768xf32) <- (1x21x768xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_72, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x768xf32) <- (1x768xf32, 768x768xf32) + matmul_96 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x768xf32) <- (1x768xf32, 768xf32) + add_110 = paddle._C_ops.add(matmul_96, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x768xf32) <- (1x768xf32) + tanh_0 = paddle._C_ops.tanh(add_110) + del ( + add_0, + add_1, + add_10, + add_100, + add_101, + add_102, + add_103, + add_106, + add_107, + add_109, + add_11, + add_110, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_21, + add_22, + add_25, + add_26, + add_28, + add_29, + add_3, + add_30, + add_31, + add_34, + add_35, + add_37, + add_38, + add_39, + add_4, + add_40, + add_43, + add_44, + add_46, + add_47, + add_48, + add_49, + add_52, + add_53, + add_55, + add_56, + add_57, + add_58, + add_61, + add_62, + add_64, + add_65, + add_66, + add_67, + add_7, + add_70, + add_71, + add_73, + add_74, + add_75, + add_76, + add_79, + add_8, + add_80, + add_82, + add_83, + add_84, + add_85, + add_88, + add_89, + add_91, + add_92, + add_93, + add_94, + add_97, + add_98, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_15, + assign_16, + assign_17, + assign_18, + assign_19, + assign_2, + assign_20, + assign_21, + assign_22, + assign_23, + assign_24, + assign_25, + assign_26, + assign_27, + assign_28, + assign_29, + assign_3, + assign_30, + assign_31, + assign_32, + assign_33, + assign_34, + assign_35, + assign_36, + assign_37, + assign_38, + assign_39, + assign_4, + assign_40, + assign_41, + assign_42, + assign_43, + assign_44, + assign_45, + assign_46, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_26, + dropout_27, + dropout_28, + dropout_29, + dropout_3, + dropout_30, + dropout_31, + dropout_32, + dropout_33, + dropout_34, + dropout_35, + dropout_36, + dropout_37, + dropout_38, + dropout_39, + dropout_4, + dropout_40, + dropout_41, + dropout_42, + dropout_43, + dropout_44, + dropout_45, + dropout_46, + dropout_47, + dropout_48, + dropout_49, + dropout_5, + dropout_50, + dropout_51, + dropout_52, + dropout_53, + dropout_54, + dropout_55, + dropout_56, + dropout_57, + dropout_58, + dropout_59, + dropout_6, + dropout_60, + dropout_61, + dropout_62, + dropout_63, + dropout_64, + dropout_65, + dropout_66, + dropout_67, + dropout_68, + dropout_69, + dropout_7, + dropout_70, + dropout_71, + dropout_72, + dropout_73, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_10, + gelu_11, + gelu_2, + gelu_3, + gelu_4, + gelu_5, + gelu_6, + gelu_7, + gelu_8, + gelu_9, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_27, + layer_norm_28, + layer_norm_29, + layer_norm_3, + layer_norm_30, + layer_norm_31, + layer_norm_32, + layer_norm_33, + layer_norm_34, + layer_norm_35, + layer_norm_36, + layer_norm_37, + layer_norm_38, + layer_norm_39, + layer_norm_4, + layer_norm_40, + layer_norm_41, + layer_norm_42, + layer_norm_43, + layer_norm_44, + layer_norm_45, + layer_norm_46, + layer_norm_47, + layer_norm_48, + layer_norm_49, + layer_norm_5, + layer_norm_50, + layer_norm_51, + layer_norm_52, + layer_norm_53, + layer_norm_54, + layer_norm_55, + layer_norm_56, + layer_norm_57, + layer_norm_58, + layer_norm_59, + layer_norm_6, + layer_norm_60, + layer_norm_61, + layer_norm_62, + layer_norm_63, + layer_norm_64, + layer_norm_65, + layer_norm_66, + layer_norm_67, + layer_norm_68, + layer_norm_69, + layer_norm_7, + layer_norm_70, + layer_norm_71, + layer_norm_72, + layer_norm_73, + layer_norm_74, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_33, + matmul_34, + matmul_35, + matmul_37, + matmul_38, + matmul_39, + matmul_40, + matmul_41, + matmul_42, + matmul_43, + matmul_45, + matmul_46, + matmul_47, + matmul_48, + matmul_49, + matmul_5, + matmul_50, + matmul_51, + matmul_53, + matmul_54, + matmul_55, + matmul_56, + matmul_57, + matmul_58, + matmul_59, + matmul_6, + matmul_61, + matmul_62, + matmul_63, + matmul_64, + matmul_65, + matmul_66, + matmul_67, + matmul_69, + matmul_7, + matmul_70, + matmul_71, + matmul_72, + matmul_73, + matmul_74, + matmul_75, + matmul_77, + matmul_78, + matmul_79, + matmul_8, + matmul_80, + matmul_81, + matmul_82, + matmul_83, + matmul_85, + matmul_86, + matmul_87, + matmul_88, + matmul_89, + matmul_9, + matmul_90, + matmul_91, + matmul_93, + matmul_94, + matmul_95, + matmul_96, + reshape_11, + reshape_15, + reshape_19, + reshape_23, + reshape_27, + reshape_3, + reshape_31, + reshape_35, + reshape_39, + reshape_43, + reshape_47, + reshape_7, + scale_1, + scale_10, + scale_11, + scale_12, + scale_2, + scale_3, + scale_4, + scale_5, + scale_6, + scale_7, + scale_8, + scale_9, + slice_0, + softmax_0, + softmax_1, + softmax_10, + softmax_11, + softmax_2, + softmax_3, + softmax_4, + softmax_5, + softmax_6, + softmax_7, + softmax_8, + softmax_9, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_17, + transpose_18, + transpose_19, + transpose_2, + transpose_21, + transpose_22, + transpose_23, + transpose_25, + transpose_26, + transpose_27, + transpose_29, + transpose_3, + transpose_30, + transpose_31, + transpose_33, + transpose_34, + transpose_35, + transpose_37, + transpose_38, + transpose_39, + transpose_41, + transpose_42, + transpose_43, + transpose_45, + transpose_46, + transpose_47, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/input_meta.py b/paddle_samples/PaddleNLP/utc-base/shape_patches_ernie-search-base-dual-encoder-marco-en/input_meta.py similarity index 100% rename from paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/input_meta.py rename to paddle_samples/PaddleNLP/utc-base/shape_patches_ernie-search-base-dual-encoder-marco-en/input_meta.py diff --git a/paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/model.py b/paddle_samples/PaddleNLP/utc-base/shape_patches_ernie-search-base-dual-encoder-marco-en/model.py similarity index 100% rename from paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/model.py rename to paddle_samples/PaddleNLP/utc-base/shape_patches_ernie-search-base-dual-encoder-marco-en/model.py diff --git a/paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/weight_meta.py b/paddle_samples/PaddleNLP/utc-base/shape_patches_ernie-search-base-dual-encoder-marco-en/weight_meta.py similarity index 100% rename from paddle_samples/PaddleNLP/ernie-search-base-dual-encoder-marco-en/weight_meta.py rename to paddle_samples/PaddleNLP/utc-base/shape_patches_ernie-search-base-dual-encoder-marco-en/weight_meta.py diff --git a/paddle_samples/PaddleNLP/utc-base/weight_meta.py b/paddle_samples/PaddleNLP/utc-base/weight_meta.py new file mode 100644 index 0000000000..4e277f32c6 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-base/weight_meta.py @@ -0,0 +1,2183 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [768] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.1065") + max_val = float("0.0922678") + mean = float("8.24665e-06") + std = float("0.019995") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [768] + dtype = "float32" + min_val = float("-0.0845484") + max_val = float("0.155899") + mean = float("0.0178131") + std = float("0.0275594") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [768] + dtype = "float32" + min_val = float("0.377464") + max_val = float("1.04015") + mean = float("0.595913") + std = float("0.0508625") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [768] + dtype = "float32" + min_val = float("-0.685946") + max_val = float("1.91742") + mean = float("0.0262144") + std = float("0.0838899") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [768] + dtype = "float32" + min_val = float("0.626522") + max_val = float("2.09879") + mean = float("0.737392") + std = float("0.0891803") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [768] + dtype = "float32" + min_val = float("-0.381025") + max_val = float("0.503225") + mean = float("-0.00037413") + std = float("0.0753335") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.03383") + max_val = float("0.529496") + mean = float("1.85736e-05") + std = float("0.0273977") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [3072] + dtype = "float32" + min_val = float("-0.176078") + max_val = float("0.171767") + mean = float("-0.0351334") + std = float("0.032477") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.432098") + max_val = float("0.336225") + mean = float("6.31173e-06") + std = float("0.0339545") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [768] + dtype = "float32" + min_val = float("-0.374159") + max_val = float("0.313956") + mean = float("0.000214819") + std = float("0.0816351") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.423789") + max_val = float("0.526958") + mean = float("-1.31823e-05") + std = float("0.0355551") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [768] + dtype = "float32" + min_val = float("-0.0826052") + max_val = float("0.0566306") + mean = float("-0.00087928") + std = float("0.01809") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.333135") + max_val = float("0.2885") + mean = float("-1.31035e-05") + std = float("0.0431536") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [768] + dtype = "float32" + min_val = float("-0.0174004") + max_val = float("0.0582621") + mean = float("9.5714e-05") + std = float("0.00259645") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.374032") + max_val = float("0.330994") + mean = float("-5.51556e-05") + std = float("0.0463629") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [768] + dtype = "float32" + min_val = float("-0.362626") + max_val = float("0.351407") + mean = float("0.00362976") + std = float("0.0637792") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.299375") + max_val = float("0.335215") + mean = float("3.86657e-05") + std = float("0.0451107") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [768] + dtype = "float32" + min_val = float("-0.235755") + max_val = float("1.25727") + mean = float("0.0334201") + std = float("0.0606043") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [768] + dtype = "float32" + min_val = float("0.565362") + max_val = float("1.45983") + mean = float("0.830966") + std = float("0.047199") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [768] + dtype = "float32" + min_val = float("-0.227369") + max_val = float("1.0137") + mean = float("0.0268361") + std = float("0.0600411") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [768] + dtype = "float32" + min_val = float("0.659278") + max_val = float("1.63551") + mean = float("0.759094") + std = float("0.0600168") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [768] + dtype = "float32" + min_val = float("-0.365896") + max_val = float("0.658881") + mean = float("-0.000800643") + std = float("0.0803946") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [3072, 768] + dtype = "float32" + min_val = float("-0.74916") + max_val = float("3.36082") + mean = float("3.66904e-05") + std = float("0.0327055") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [3072] + dtype = "float32" + min_val = float("-0.338878") + max_val = float("0.382237") + mean = float("-0.0495248") + std = float("0.0414204") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.512666") + max_val = float("0.362106") + mean = float("0.000111125") + std = float("0.0360402") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [768] + dtype = "float32" + min_val = float("-0.151783") + max_val = float("0.184231") + mean = float("6.95218e-05") + std = float("0.0340278") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.339338") + max_val = float("0.392345") + mean = float("-2.96117e-06") + std = float("0.0333425") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [768] + dtype = "float32" + min_val = float("-0.085833") + max_val = float("0.0558208") + mean = float("-0.000952257") + std = float("0.0192683") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.263914") + max_val = float("0.215459") + mean = float("-5.32455e-06") + std = float("0.0387393") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [768] + dtype = "float32" + min_val = float("-0.00919289") + max_val = float("0.00455796") + mean = float("4.414e-06") + std = float("0.000582976") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.435929") + max_val = float("0.432565") + mean = float("-3.71486e-06") + std = float("0.0448768") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [768] + dtype = "float32" + min_val = float("-0.406748") + max_val = float("0.414465") + mean = float("0.00483244") + std = float("0.0786806") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.337752") + max_val = float("0.276401") + mean = float("8.60023e-05") + std = float("0.0446307") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [768] + dtype = "float32" + min_val = float("-0.0776171") + max_val = float("1.20767") + mean = float("0.0263562") + std = float("0.0522236") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [768] + dtype = "float32" + min_val = float("0.411988") + max_val = float("1.0657") + mean = float("0.817783") + std = float("0.0368473") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [768] + dtype = "float32" + min_val = float("-0.349001") + max_val = float("1.30559") + mean = float("0.0264718") + std = float("0.0680602") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [768] + dtype = "float32" + min_val = float("0.684313") + max_val = float("1.83209") + mean = float("0.800197") + std = float("0.0684792") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [768] + dtype = "float32" + min_val = float("-0.367342") + max_val = float("0.875722") + mean = float("-0.00043948") + std = float("0.102414") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [3072, 768] + dtype = "float32" + min_val = float("-0.743815") + max_val = float("3.99123") + mean = float("1.11766e-05") + std = float("0.0351486") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [3072] + dtype = "float32" + min_val = float("-0.33105") + max_val = float("0.333742") + mean = float("-0.052639") + std = float("0.045304") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.671245") + max_val = float("0.516387") + mean = float("-6.39696e-05") + std = float("0.0366048") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [768] + dtype = "float32" + min_val = float("-0.190935") + max_val = float("0.16144") + mean = float("-4.87594e-05") + std = float("0.0480926") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.428376") + max_val = float("0.656895") + mean = float("-2.72352e-06") + std = float("0.0360731") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [768] + dtype = "float32" + min_val = float("-0.0606967") + max_val = float("0.0713026") + mean = float("-0.000426222") + std = float("0.0219119") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.254362") + max_val = float("0.305259") + mean = float("1.11952e-05") + std = float("0.0398973") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [768] + dtype = "float32" + min_val = float("-0.00942498") + max_val = float("0.0133711") + mean = float("-3.26111e-06") + std = float("0.000930343") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.445104") + max_val = float("0.380892") + mean = float("4.78708e-05") + std = float("0.0441677") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [768] + dtype = "float32" + min_val = float("-0.471816") + max_val = float("0.566136") + mean = float("0.000252425") + std = float("0.0937658") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.334517") + max_val = float("0.243539") + mean = float("3.23647e-05") + std = float("0.043952") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [768] + dtype = "float32" + min_val = float("-0.26067") + max_val = float("1.08226") + mean = float("0.0245325") + std = float("0.0473701") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [768] + dtype = "float32" + min_val = float("0.325774") + max_val = float("1.05284") + mean = float("0.778599") + std = float("0.0496136") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [768] + dtype = "float32" + min_val = float("-0.301067") + max_val = float("1.40361") + mean = float("0.0268691") + std = float("0.0779368") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [768] + dtype = "float32" + min_val = float("0.672446") + max_val = float("1.43653") + mean = float("0.800758") + std = float("0.0789223") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [768] + dtype = "float32" + min_val = float("-0.353525") + max_val = float("0.93215") + mean = float("-0.000194615") + std = float("0.106436") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [3072, 768] + dtype = "float32" + min_val = float("-0.784186") + max_val = float("2.60259") + mean = float("-1.8173e-05") + std = float("0.0374797") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [3072] + dtype = "float32" + min_val = float("-0.301104") + max_val = float("0.252344") + mean = float("-0.0569073") + std = float("0.0516529") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.50531") + max_val = float("0.554438") + mean = float("-8.10467e-05") + std = float("0.0394447") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [768] + dtype = "float32" + min_val = float("-0.0898444") + max_val = float("0.10365") + mean = float("-0.000156883") + std = float("0.0222068") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.287443") + max_val = float("0.214974") + mean = float("2.34534e-06") + std = float("0.0392878") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [768] + dtype = "float32" + min_val = float("-0.0618473") + max_val = float("0.0593726") + mean = float("0.000408208") + std = float("0.0188991") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.224333") + max_val = float("0.218838") + mean = float("-2.05187e-05") + std = float("0.0428632") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [768] + dtype = "float32" + min_val = float("-0.00672444") + max_val = float("0.00544492") + mean = float("-3.32136e-05") + std = float("0.000754935") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.415917") + max_val = float("0.385409") + mean = float("-3.78393e-05") + std = float("0.0435653") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [768] + dtype = "float32" + min_val = float("-0.484036") + max_val = float("0.494368") + mean = float("-0.00209496") + std = float("0.101345") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.230731") + max_val = float("0.253395") + mean = float("3.51442e-05") + std = float("0.0432076") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [768] + dtype = "float32" + min_val = float("-0.39977") + max_val = float("0.792223") + mean = float("0.0262374") + std = float("0.0463769") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [768] + dtype = "float32" + min_val = float("0.232397") + max_val = float("0.999352") + mean = float("0.750435") + std = float("0.0584319") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [768] + dtype = "float32" + min_val = float("-0.439524") + max_val = float("1.52062") + mean = float("0.0232238") + std = float("0.0804645") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [768] + dtype = "float32" + min_val = float("0.709264") + max_val = float("1.43679") + mean = float("0.840638") + std = float("0.0800494") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [768] + dtype = "float32" + min_val = float("-0.287664") + max_val = float("0.745372") + mean = float("-0.000350468") + std = float("0.0948004") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [3072, 768] + dtype = "float32" + min_val = float("-0.546791") + max_val = float("2.63033") + mean = float("-2.51085e-05") + std = float("0.0388814") + data = None + + +class Program_weight_tensor_parameter_72: + name = "parameter_72" + shape = [3072] + dtype = "float32" + min_val = float("-0.268269") + max_val = float("0.345849") + mean = float("-0.0602895") + std = float("0.0493256") + data = None + + +class Program_weight_tensor_parameter_73: + name = "parameter_73" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.419707") + max_val = float("0.49964") + mean = float("2.99836e-05") + std = float("0.0425465") + data = None + + +class Program_weight_tensor_parameter_74: + name = "parameter_74" + shape = [768] + dtype = "float32" + min_val = float("-0.0725261") + max_val = float("0.0775178") + mean = float("0.00042004") + std = float("0.0236576") + data = None + + +class Program_weight_tensor_parameter_75: + name = "parameter_75" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.223706") + max_val = float("0.211861") + mean = float("2.0617e-05") + std = float("0.0389223") + data = None + + +class Program_weight_tensor_parameter_76: + name = "parameter_76" + shape = [768] + dtype = "float32" + min_val = float("-0.0925672") + max_val = float("0.0789856") + mean = float("-0.000736009") + std = float("0.0189581") + data = None + + +class Program_weight_tensor_parameter_77: + name = "parameter_77" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.20349") + max_val = float("0.242349") + mean = float("3.81706e-05") + std = float("0.0417824") + data = None + + +class Program_weight_tensor_parameter_78: + name = "parameter_78" + shape = [768] + dtype = "float32" + min_val = float("-0.00297525") + max_val = float("0.00265118") + mean = float("-9.50392e-06") + std = float("0.00044609") + data = None + + +class Program_weight_tensor_parameter_79: + name = "parameter_79" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.300472") + max_val = float("0.328086") + mean = float("8.83456e-06") + std = float("0.0439162") + data = None + + +class Program_weight_tensor_parameter_80: + name = "parameter_80" + shape = [768] + dtype = "float32" + min_val = float("-0.474993") + max_val = float("0.429117") + mean = float("0.000599342") + std = float("0.091709") + data = None + + +class Program_weight_tensor_parameter_81: + name = "parameter_81" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.245665") + max_val = float("0.268747") + mean = float("-6.61447e-06") + std = float("0.0438734") + data = None + + +class Program_weight_tensor_parameter_82: + name = "parameter_82" + shape = [768] + dtype = "float32" + min_val = float("-0.369597") + max_val = float("0.944352") + mean = float("0.0162809") + std = float("0.0491837") + data = None + + +class Program_weight_tensor_parameter_83: + name = "parameter_83" + shape = [768] + dtype = "float32" + min_val = float("0.223017") + max_val = float("1.0048") + mean = float("0.719827") + std = float("0.0540825") + data = None + + +class Program_weight_tensor_parameter_84: + name = "parameter_84" + shape = [768] + dtype = "float32" + min_val = float("-0.719728") + max_val = float("1.69436") + mean = float("0.0185926") + std = float("0.10686") + data = None + + +class Program_weight_tensor_parameter_85: + name = "parameter_85" + shape = [768] + dtype = "float32" + min_val = float("0.653691") + max_val = float("1.89803") + mean = float("0.809854") + std = float("0.083532") + data = None + + +class Program_weight_tensor_parameter_86: + name = "parameter_86" + shape = [768] + dtype = "float32" + min_val = float("-0.26567") + max_val = float("0.943275") + mean = float("-0.00120044") + std = float("0.0935089") + data = None + + +class Program_weight_tensor_parameter_87: + name = "parameter_87" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.02698") + max_val = float("3.05777") + mean = float("-5.01183e-05") + std = float("0.0416622") + data = None + + +class Program_weight_tensor_parameter_88: + name = "parameter_88" + shape = [3072] + dtype = "float32" + min_val = float("-0.318314") + max_val = float("0.169139") + mean = float("-0.0680917") + std = float("0.0565891") + data = None + + +class Program_weight_tensor_parameter_89: + name = "parameter_89" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.439895") + max_val = float("0.382371") + mean = float("6.67597e-05") + std = float("0.0436096") + data = None + + +class Program_weight_tensor_parameter_90: + name = "parameter_90" + shape = [768] + dtype = "float32" + min_val = float("-0.0513535") + max_val = float("0.1512") + mean = float("-0.000231") + std = float("0.0200321") + data = None + + +class Program_weight_tensor_parameter_91: + name = "parameter_91" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.215542") + max_val = float("0.218167") + mean = float("6.66037e-06") + std = float("0.0392615") + data = None + + +class Program_weight_tensor_parameter_92: + name = "parameter_92" + shape = [768] + dtype = "float32" + min_val = float("-0.0684312") + max_val = float("0.0929696") + mean = float("0.000355609") + std = float("0.0202666") + data = None + + +class Program_weight_tensor_parameter_93: + name = "parameter_93" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.214789") + max_val = float("0.220594") + mean = float("-1.27702e-05") + std = float("0.0413592") + data = None + + +class Program_weight_tensor_parameter_94: + name = "parameter_94" + shape = [768] + dtype = "float32" + min_val = float("-0.00215647") + max_val = float("0.00394406") + mean = float("1.28823e-05") + std = float("0.000516254") + data = None + + +class Program_weight_tensor_parameter_95: + name = "parameter_95" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.489124") + max_val = float("0.38227") + mean = float("6.25357e-05") + std = float("0.0435701") + data = None + + +class Program_weight_tensor_parameter_96: + name = "parameter_96" + shape = [768] + dtype = "float32" + min_val = float("-0.427679") + max_val = float("0.483311") + mean = float("0.000277565") + std = float("0.109786") + data = None + + +class Program_weight_tensor_parameter_97: + name = "parameter_97" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.249547") + max_val = float("0.223513") + mean = float("-2.53358e-05") + std = float("0.0428544") + data = None + + +class Program_weight_tensor_parameter_98: + name = "parameter_98" + shape = [768] + dtype = "float32" + min_val = float("-0.305967") + max_val = float("0.886291") + mean = float("0.0100715") + std = float("0.0580312") + data = None + + +class Program_weight_tensor_parameter_99: + name = "parameter_99" + shape = [768] + dtype = "float32" + min_val = float("0.268723") + max_val = float("0.887276") + mean = float("0.712442") + std = float("0.0464341") + data = None + + +class Program_weight_tensor_parameter_100: + name = "parameter_100" + shape = [768] + dtype = "float32" + min_val = float("-0.844481") + max_val = float("1.94696") + mean = float("0.0133893") + std = float("0.115305") + data = None + + +class Program_weight_tensor_parameter_101: + name = "parameter_101" + shape = [768] + dtype = "float32" + min_val = float("0.650432") + max_val = float("2.04298") + mean = float("0.808398") + std = float("0.0895828") + data = None + + +class Program_weight_tensor_parameter_102: + name = "parameter_102" + shape = [768] + dtype = "float32" + min_val = float("-0.262259") + max_val = float("0.621249") + mean = float("-0.000548557") + std = float("0.0711437") + data = None + + +class Program_weight_tensor_parameter_103: + name = "parameter_103" + shape = [3072, 768] + dtype = "float32" + min_val = float("-2.89756") + max_val = float("1.58263") + mean = float("-4.59277e-05") + std = float("0.042022") + data = None + + +class Program_weight_tensor_parameter_104: + name = "parameter_104" + shape = [3072] + dtype = "float32" + min_val = float("-0.262038") + max_val = float("0.144959") + mean = float("-0.0726601") + std = float("0.0497945") + data = None + + +class Program_weight_tensor_parameter_105: + name = "parameter_105" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.402376") + max_val = float("0.437228") + mean = float("0.000155773") + std = float("0.0447149") + data = None + + +class Program_weight_tensor_parameter_106: + name = "parameter_106" + shape = [768] + dtype = "float32" + min_val = float("-0.125213") + max_val = float("0.120978") + mean = float("0.000339941") + std = float("0.04058") + data = None + + +class Program_weight_tensor_parameter_107: + name = "parameter_107" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.24915") + max_val = float("0.243315") + mean = float("1.7316e-05") + std = float("0.0380759") + data = None + + +class Program_weight_tensor_parameter_108: + name = "parameter_108" + shape = [768] + dtype = "float32" + min_val = float("-0.182193") + max_val = float("0.109647") + mean = float("-0.0011862") + std = float("0.025455") + data = None + + +class Program_weight_tensor_parameter_109: + name = "parameter_109" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.196332") + max_val = float("0.217018") + mean = float("-5.58588e-06") + std = float("0.0397045") + data = None + + +class Program_weight_tensor_parameter_110: + name = "parameter_110" + shape = [768] + dtype = "float32" + min_val = float("-0.00428636") + max_val = float("0.00317077") + mean = float("1.81162e-06") + std = float("0.000636264") + data = None + + +class Program_weight_tensor_parameter_111: + name = "parameter_111" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.316876") + max_val = float("0.322471") + mean = float("-3.23014e-05") + std = float("0.0437725") + data = None + + +class Program_weight_tensor_parameter_112: + name = "parameter_112" + shape = [768] + dtype = "float32" + min_val = float("-0.544095") + max_val = float("0.507017") + mean = float("-0.00242187") + std = float("0.120375") + data = None + + +class Program_weight_tensor_parameter_113: + name = "parameter_113" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.254436") + max_val = float("0.224358") + mean = float("-2.32243e-05") + std = float("0.0430713") + data = None + + +class Program_weight_tensor_parameter_114: + name = "parameter_114" + shape = [768] + dtype = "float32" + min_val = float("-0.372594") + max_val = float("1.00153") + mean = float("0.00695299") + std = float("0.0639377") + data = None + + +class Program_weight_tensor_parameter_115: + name = "parameter_115" + shape = [768] + dtype = "float32" + min_val = float("0.279458") + max_val = float("0.988048") + mean = float("0.716557") + std = float("0.0510854") + data = None + + +class Program_weight_tensor_parameter_116: + name = "parameter_116" + shape = [768] + dtype = "float32" + min_val = float("-0.71155") + max_val = float("1.83976") + mean = float("0.0129537") + std = float("0.124448") + data = None + + +class Program_weight_tensor_parameter_117: + name = "parameter_117" + shape = [768] + dtype = "float32" + min_val = float("0.67233") + max_val = float("1.61983") + mean = float("0.819661") + std = float("0.0801844") + data = None + + +class Program_weight_tensor_parameter_118: + name = "parameter_118" + shape = [768] + dtype = "float32" + min_val = float("-0.286782") + max_val = float("0.614121") + mean = float("-0.000907821") + std = float("0.0670889") + data = None + + +class Program_weight_tensor_parameter_119: + name = "parameter_119" + shape = [3072, 768] + dtype = "float32" + min_val = float("-2.39274") + max_val = float("0.704797") + mean = float("-4.86527e-05") + std = float("0.0429611") + data = None + + +class Program_weight_tensor_parameter_120: + name = "parameter_120" + shape = [3072] + dtype = "float32" + min_val = float("-0.281766") + max_val = float("0.159708") + mean = float("-0.0766345") + std = float("0.0488862") + data = None + + +class Program_weight_tensor_parameter_121: + name = "parameter_121" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.425091") + max_val = float("0.350971") + mean = float("0.000145235") + std = float("0.0457306") + data = None + + +class Program_weight_tensor_parameter_122: + name = "parameter_122" + shape = [768] + dtype = "float32" + min_val = float("-0.224517") + max_val = float("0.245607") + mean = float("0.000790036") + std = float("0.0764891") + data = None + + +class Program_weight_tensor_parameter_123: + name = "parameter_123" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.199342") + max_val = float("0.251204") + mean = float("-7.35235e-07") + std = float("0.0347577") + data = None + + +class Program_weight_tensor_parameter_124: + name = "parameter_124" + shape = [768] + dtype = "float32" + min_val = float("-0.33063") + max_val = float("0.443574") + mean = float("-0.000909175") + std = float("0.0588384") + data = None + + +class Program_weight_tensor_parameter_125: + name = "parameter_125" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.196474") + max_val = float("0.188087") + mean = float("-5.10425e-05") + std = float("0.0355415") + data = None + + +class Program_weight_tensor_parameter_126: + name = "parameter_126" + shape = [768] + dtype = "float32" + min_val = float("-0.00315159") + max_val = float("0.00412954") + mean = float("-3.62594e-06") + std = float("0.000905222") + data = None + + +class Program_weight_tensor_parameter_127: + name = "parameter_127" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.311284") + max_val = float("0.324322") + mean = float("3.30809e-05") + std = float("0.0439301") + data = None + + +class Program_weight_tensor_parameter_128: + name = "parameter_128" + shape = [768] + dtype = "float32" + min_val = float("-0.462993") + max_val = float("0.474683") + mean = float("0.00546093") + std = float("0.113128") + data = None + + +class Program_weight_tensor_parameter_129: + name = "parameter_129" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.232685") + max_val = float("0.255545") + mean = float("8.17674e-05") + std = float("0.0428405") + data = None + + +class Program_weight_tensor_parameter_130: + name = "parameter_130" + shape = [768] + dtype = "float32" + min_val = float("-0.733145") + max_val = float("0.994599") + mean = float("0.0211788") + std = float("0.0714722") + data = None + + +class Program_weight_tensor_parameter_131: + name = "parameter_131" + shape = [768] + dtype = "float32" + min_val = float("0.383957") + max_val = float("1.00699") + mean = float("0.737641") + std = float("0.0436895") + data = None + + +class Program_weight_tensor_parameter_132: + name = "parameter_132" + shape = [768] + dtype = "float32" + min_val = float("-0.522491") + max_val = float("1.6562") + mean = float("0.0116847") + std = float("0.114082") + data = None + + +class Program_weight_tensor_parameter_133: + name = "parameter_133" + shape = [768] + dtype = "float32" + min_val = float("0.669282") + max_val = float("1.86999") + mean = float("0.835993") + std = float("0.0915802") + data = None + + +class Program_weight_tensor_parameter_134: + name = "parameter_134" + shape = [768] + dtype = "float32" + min_val = float("-0.26943") + max_val = float("0.437685") + mean = float("-0.000484871") + std = float("0.0562122") + data = None + + +class Program_weight_tensor_parameter_135: + name = "parameter_135" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.88319") + max_val = float("0.851814") + mean = float("-1.52019e-05") + std = float("0.042416") + data = None + + +class Program_weight_tensor_parameter_136: + name = "parameter_136" + shape = [3072] + dtype = "float32" + min_val = float("-0.299977") + max_val = float("0.162384") + mean = float("-0.0786727") + std = float("0.0400215") + data = None + + +class Program_weight_tensor_parameter_137: + name = "parameter_137" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.326238") + max_val = float("0.294017") + mean = float("0.00021724") + std = float("0.0458343") + data = None + + +class Program_weight_tensor_parameter_138: + name = "parameter_138" + shape = [768] + dtype = "float32" + min_val = float("-0.225039") + max_val = float("0.198398") + mean = float("-0.000476152") + std = float("0.0649474") + data = None + + +class Program_weight_tensor_parameter_139: + name = "parameter_139" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.420669") + max_val = float("0.224584") + mean = float("1.27052e-05") + std = float("0.029536") + data = None + + +class Program_weight_tensor_parameter_140: + name = "parameter_140" + shape = [768] + dtype = "float32" + min_val = float("-0.220649") + max_val = float("0.172905") + mean = float("0.00102378") + std = float("0.0311978") + data = None + + +class Program_weight_tensor_parameter_141: + name = "parameter_141" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.17906") + max_val = float("0.199352") + mean = float("-6.39039e-06") + std = float("0.0310355") + data = None + + +class Program_weight_tensor_parameter_142: + name = "parameter_142" + shape = [768] + dtype = "float32" + min_val = float("-0.00458602") + max_val = float("0.00282965") + mean = float("-1.57775e-05") + std = float("0.000529708") + data = None + + +class Program_weight_tensor_parameter_143: + name = "parameter_143" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.283267") + max_val = float("0.279253") + mean = float("2.21054e-05") + std = float("0.044129") + data = None + + +class Program_weight_tensor_parameter_144: + name = "parameter_144" + shape = [768] + dtype = "float32" + min_val = float("-0.390703") + max_val = float("0.363317") + mean = float("-0.00303278") + std = float("0.0906583") + data = None + + +class Program_weight_tensor_parameter_145: + name = "parameter_145" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.276816") + max_val = float("0.272385") + mean = float("4.44222e-05") + std = float("0.0435058") + data = None + + +class Program_weight_tensor_parameter_146: + name = "parameter_146" + shape = [768] + dtype = "float32" + min_val = float("-0.59483") + max_val = float("1.16863") + mean = float("0.0260831") + std = float("0.0765675") + data = None + + +class Program_weight_tensor_parameter_147: + name = "parameter_147" + shape = [768] + dtype = "float32" + min_val = float("0.3886") + max_val = float("1.02294") + mean = float("0.829941") + std = float("0.0393226") + data = None + + +class Program_weight_tensor_parameter_148: + name = "parameter_148" + shape = [768] + dtype = "float32" + min_val = float("-0.50725") + max_val = float("1.99372") + mean = float("0.0109888") + std = float("0.12832") + data = None + + +class Program_weight_tensor_parameter_149: + name = "parameter_149" + shape = [768] + dtype = "float32" + min_val = float("0.717564") + max_val = float("1.86481") + mean = float("0.846301") + std = float("0.0781042") + data = None + + +class Program_weight_tensor_parameter_150: + name = "parameter_150" + shape = [768] + dtype = "float32" + min_val = float("-0.109422") + max_val = float("0.069833") + mean = float("0.000118052") + std = float("0.0274056") + data = None + + +class Program_weight_tensor_parameter_151: + name = "parameter_151" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.87238") + max_val = float("1.66187") + mean = float("-7.58052e-06") + std = float("0.0412345") + data = None + + +class Program_weight_tensor_parameter_152: + name = "parameter_152" + shape = [3072] + dtype = "float32" + min_val = float("-0.287792") + max_val = float("0.207462") + mean = float("-0.0777882") + std = float("0.0446448") + data = None + + +class Program_weight_tensor_parameter_153: + name = "parameter_153" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.301378") + max_val = float("0.29458") + mean = float("0.000259743") + std = float("0.0436802") + data = None + + +class Program_weight_tensor_parameter_154: + name = "parameter_154" + shape = [768] + dtype = "float32" + min_val = float("-0.337069") + max_val = float("0.274469") + mean = float("-0.000661662") + std = float("0.0817593") + data = None + + +class Program_weight_tensor_parameter_155: + name = "parameter_155" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.236745") + max_val = float("0.471476") + mean = float("-8.90769e-06") + std = float("0.0291632") + data = None + + +class Program_weight_tensor_parameter_156: + name = "parameter_156" + shape = [768] + dtype = "float32" + min_val = float("-0.128076") + max_val = float("0.303404") + mean = float("0.000420296") + std = float("0.0337071") + data = None + + +class Program_weight_tensor_parameter_157: + name = "parameter_157" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.155677") + max_val = float("0.15745") + mean = float("-4.89601e-05") + std = float("0.0302903") + data = None + + +class Program_weight_tensor_parameter_158: + name = "parameter_158" + shape = [768] + dtype = "float32" + min_val = float("-0.00294593") + max_val = float("0.00214193") + mean = float("-5.07492e-06") + std = float("0.000403861") + data = None + + +class Program_weight_tensor_parameter_159: + name = "parameter_159" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.311744") + max_val = float("0.29382") + mean = float("-2.41582e-05") + std = float("0.0421222") + data = None + + +class Program_weight_tensor_parameter_160: + name = "parameter_160" + shape = [768] + dtype = "float32" + min_val = float("-0.606713") + max_val = float("0.646665") + mean = float("0.00407431") + std = float("0.134408") + data = None + + +class Program_weight_tensor_parameter_161: + name = "parameter_161" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.25002") + max_val = float("0.259562") + mean = float("7.25337e-05") + std = float("0.0412916") + data = None + + +class Program_weight_tensor_parameter_162: + name = "parameter_162" + shape = [768] + dtype = "float32" + min_val = float("-0.184622") + max_val = float("1.40149") + mean = float("0.0290464") + std = float("0.0789944") + data = None + + +class Program_weight_tensor_parameter_163: + name = "parameter_163" + shape = [768] + dtype = "float32" + min_val = float("0.507703") + max_val = float("0.909176") + mean = float("0.828888") + std = float("0.034072") + data = None + + +class Program_weight_tensor_parameter_164: + name = "parameter_164" + shape = [768] + dtype = "float32" + min_val = float("-0.30142") + max_val = float("1.86979") + mean = float("0.0100689") + std = float("0.134445") + data = None + + +class Program_weight_tensor_parameter_165: + name = "parameter_165" + shape = [768] + dtype = "float32" + min_val = float("0.804333") + max_val = float("1.68705") + mean = float("0.892053") + std = float("0.0651698") + data = None + + +class Program_weight_tensor_parameter_166: + name = "parameter_166" + shape = [768] + dtype = "float32" + min_val = float("-0.179127") + max_val = float("0.185464") + mean = float("-0.00022793") + std = float("0.0498916") + data = None + + +class Program_weight_tensor_parameter_167: + name = "parameter_167" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.61478") + max_val = float("1.50666") + mean = float("-1.95935e-05") + std = float("0.0397785") + data = None + + +class Program_weight_tensor_parameter_168: + name = "parameter_168" + shape = [3072] + dtype = "float32" + min_val = float("-0.258016") + max_val = float("0.294119") + mean = float("-0.0768509") + std = float("0.0507005") + data = None + + +class Program_weight_tensor_parameter_169: + name = "parameter_169" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.273244") + max_val = float("0.263496") + mean = float("0.000173589") + std = float("0.0399831") + data = None + + +class Program_weight_tensor_parameter_170: + name = "parameter_170" + shape = [768] + dtype = "float32" + min_val = float("-0.139886") + max_val = float("0.296256") + mean = float("-0.000614001") + std = float("0.052703") + data = None + + +class Program_weight_tensor_parameter_171: + name = "parameter_171" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.26473") + max_val = float("0.395099") + mean = float("-2.40757e-05") + std = float("0.0281872") + data = None + + +class Program_weight_tensor_parameter_172: + name = "parameter_172" + shape = [768] + dtype = "float32" + min_val = float("-0.190973") + max_val = float("0.112259") + mean = float("-0.000230932") + std = float("0.0258482") + data = None + + +class Program_weight_tensor_parameter_173: + name = "parameter_173" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.143491") + max_val = float("0.188257") + mean = float("-1.07368e-05") + std = float("0.028329") + data = None + + +class Program_weight_tensor_parameter_174: + name = "parameter_174" + shape = [768] + dtype = "float32" + min_val = float("-0.00131748") + max_val = float("0.00182613") + mean = float("1.32662e-05") + std = float("0.00024653") + data = None + + +class Program_weight_tensor_parameter_175: + name = "parameter_175" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.284014") + max_val = float("0.258503") + mean = float("-3.15554e-05") + std = float("0.0386832") + data = None + + +class Program_weight_tensor_parameter_176: + name = "parameter_176" + shape = [768] + dtype = "float32" + min_val = float("-0.561046") + max_val = float("0.570294") + mean = float("0.00575184") + std = float("0.155409") + data = None + + +class Program_weight_tensor_parameter_177: + name = "parameter_177" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.25043") + max_val = float("0.300188") + mean = float("7.02683e-05") + std = float("0.0378917") + data = None + + +class Program_weight_tensor_parameter_178: + name = "parameter_178" + shape = [768] + dtype = "float32" + min_val = float("-0.238834") + max_val = float("1.52968") + mean = float("0.0249598") + std = float("0.0907954") + data = None + + +class Program_weight_tensor_parameter_179: + name = "parameter_179" + shape = [768] + dtype = "float32" + min_val = float("0.463754") + max_val = float("0.814126") + mean = float("0.745653") + std = float("0.0294868") + data = None + + +class Program_weight_tensor_parameter_180: + name = "parameter_180" + shape = [768] + dtype = "float32" + min_val = float("-0.625165") + max_val = float("2.97432") + mean = float("0.00682295") + std = float("0.217064") + data = None + + +class Program_weight_tensor_parameter_181: + name = "parameter_181" + shape = [768] + dtype = "float32" + min_val = float("0.829756") + max_val = float("1.91696") + mean = float("0.925776") + std = float("0.0559565") + data = None + + +class Program_weight_tensor_parameter_182: + name = "parameter_182" + shape = [768] + dtype = "float32" + min_val = float("-0.363462") + max_val = float("0.256927") + mean = float("-3.28927e-05") + std = float("0.0764271") + data = None + + +class Program_weight_tensor_parameter_183: + name = "parameter_183" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.49323") + max_val = float("1.33631") + mean = float("-1.61552e-05") + std = float("0.0383947") + data = None + + +class Program_weight_tensor_parameter_184: + name = "parameter_184" + shape = [3072] + dtype = "float32" + min_val = float("-0.273331") + max_val = float("0.28233") + mean = float("-0.0883021") + std = float("0.0529674") + data = None + + +class Program_weight_tensor_parameter_185: + name = "parameter_185" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.235856") + max_val = float("0.345484") + mean = float("1.52492e-05") + std = float("0.0375467") + data = None + + +class Program_weight_tensor_parameter_186: + name = "parameter_186" + shape = [768] + dtype = "float32" + min_val = float("-0.125765") + max_val = float("0.607142") + mean = float("-0.000783164") + std = float("0.0478679") + data = None + + +class Program_weight_tensor_parameter_187: + name = "parameter_187" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.648178") + max_val = float("0.621116") + mean = float("8.84959e-06") + std = float("0.0282216") + data = None + + +class Program_weight_tensor_parameter_188: + name = "parameter_188" + shape = [768] + dtype = "float32" + min_val = float("-0.120514") + max_val = float("0.155895") + mean = float("-0.000755175") + std = float("0.0296187") + data = None + + +class Program_weight_tensor_parameter_189: + name = "parameter_189" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.158334") + max_val = float("0.143149") + mean = float("2.4057e-05") + std = float("0.028422") + data = None + + +class Program_weight_tensor_parameter_190: + name = "parameter_190" + shape = [768] + dtype = "float32" + min_val = float("-0.00178252") + max_val = float("0.00161304") + mean = float("4.40201e-06") + std = float("0.000317929") + data = None + + +class Program_weight_tensor_parameter_191: + name = "parameter_191" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.309188") + max_val = float("0.320937") + mean = float("1.40726e-05") + std = float("0.0350299") + data = None + + +class Program_weight_tensor_parameter_192: + name = "parameter_192" + shape = [768] + dtype = "float32" + min_val = float("-0.741569") + max_val = float("0.820539") + mean = float("-0.00633216") + std = float("0.229712") + data = None + + +class Program_weight_tensor_parameter_193: + name = "parameter_193" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.258221") + max_val = float("0.291726") + mean = float("1.71994e-05") + std = float("0.0347718") + data = None + + +class Program_weight_tensor_parameter_194: + name = "parameter_194" + shape = [768] + dtype = "float32" + min_val = float("-0.788621") + max_val = float("0.185216") + mean = float("0.00496836") + std = float("0.0682181") + data = None + + +class Program_weight_tensor_parameter_195: + name = "parameter_195" + shape = [768] + dtype = "float32" + min_val = float("0.228573") + max_val = float("1.09507") + mean = float("0.776205") + std = float("0.0450422") + data = None + + +class Program_weight_tensor_parameter_196: + name = "parameter_196" + shape = [4, 768] + dtype = "float32" + min_val = float("-0.0914656") + max_val = float("0.266143") + mean = float("-0.000126598") + std = float("0.0189813") + data = None + + +class Program_weight_tensor_parameter_197: + name = "parameter_197" + shape = [2048, 768] + dtype = "float32" + min_val = float("-0.946334") + max_val = float("0.781778") + mean = float("5.26716e-06") + std = float("0.0299833") + data = None + + +class Program_weight_tensor_parameter_198: + name = "parameter_198" + shape = [39981, 768] + dtype = "float32" + min_val = float("-0.952012") + max_val = float("0.852313") + mean = float("6.58805e-06") + std = float("0.0291563") + data = None diff --git a/paddle_samples/PaddleNLP/utc-large/graph_hash.txt b/paddle_samples/PaddleNLP/utc-large/graph_hash.txt new file mode 100644 index 0000000000..2326010dd6 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-large/graph_hash.txt @@ -0,0 +1 @@ +0a920b69eaadc770e1ae2bafbc230b5d197c88c5003421e77f162e7923d98d2f \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-large/graph_net.json b/paddle_samples/PaddleNLP/utc-large/graph_net.json new file mode 100644 index 0000000000..41d68e68ad --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-large/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "utc-large", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-large/input_meta.py b/paddle_samples/PaddleNLP/utc-large/input_meta.py new file mode 100644 index 0000000000..2ad3baf05b --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-large/input_meta.py @@ -0,0 +1,66 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 26] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 4793, + 10595, + 7476, + 6529, + 9478, + 1662, + 4968, + 6243, + 10493, + 9529, + 10849, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 26] + dtype = "int64" + data = [ + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + 0, + ] diff --git a/paddle_samples/PaddleNLP/utc-large/model.py b/paddle_samples/PaddleNLP/utc-large/model.py new file mode 100644 index 0000000000..59c876c769 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-large/model.py @@ -0,0 +1,5222 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + parameter_72, + parameter_73, + parameter_74, + parameter_75, + parameter_76, + parameter_77, + parameter_78, + parameter_79, + parameter_80, + parameter_81, + parameter_82, + parameter_83, + parameter_84, + parameter_85, + parameter_86, + parameter_87, + parameter_88, + parameter_89, + parameter_90, + parameter_91, + parameter_92, + parameter_93, + parameter_94, + parameter_95, + parameter_96, + parameter_97, + parameter_98, + parameter_99, + parameter_100, + parameter_101, + parameter_102, + parameter_103, + parameter_104, + parameter_105, + parameter_106, + parameter_107, + parameter_108, + parameter_109, + parameter_110, + parameter_111, + parameter_112, + parameter_113, + parameter_114, + parameter_115, + parameter_116, + parameter_117, + parameter_118, + parameter_119, + parameter_120, + parameter_121, + parameter_122, + parameter_123, + parameter_124, + parameter_125, + parameter_126, + parameter_127, + parameter_128, + parameter_129, + parameter_130, + parameter_131, + parameter_132, + parameter_133, + parameter_134, + parameter_135, + parameter_136, + parameter_137, + parameter_138, + parameter_139, + parameter_140, + parameter_141, + parameter_142, + parameter_143, + parameter_144, + parameter_145, + parameter_146, + parameter_147, + parameter_148, + parameter_149, + parameter_150, + parameter_151, + parameter_152, + parameter_153, + parameter_154, + parameter_155, + parameter_156, + parameter_157, + parameter_158, + parameter_159, + parameter_160, + parameter_161, + parameter_162, + parameter_163, + parameter_164, + parameter_165, + parameter_166, + parameter_167, + parameter_168, + parameter_169, + parameter_170, + parameter_171, + parameter_172, + parameter_173, + parameter_174, + parameter_175, + parameter_176, + parameter_177, + parameter_178, + parameter_179, + parameter_180, + parameter_181, + parameter_182, + parameter_183, + parameter_184, + parameter_185, + parameter_186, + parameter_187, + parameter_188, + parameter_189, + parameter_190, + parameter_191, + parameter_192, + parameter_193, + parameter_194, + parameter_195, + parameter_196, + parameter_197, + parameter_198, + parameter_199, + parameter_200, + parameter_201, + parameter_202, + parameter_203, + parameter_204, + parameter_205, + parameter_206, + parameter_207, + parameter_208, + parameter_209, + parameter_210, + parameter_211, + parameter_212, + parameter_213, + parameter_214, + parameter_215, + parameter_216, + parameter_217, + parameter_218, + parameter_219, + parameter_220, + parameter_221, + parameter_222, + parameter_223, + parameter_224, + parameter_225, + parameter_226, + parameter_227, + parameter_228, + parameter_229, + parameter_230, + parameter_231, + parameter_232, + parameter_233, + parameter_234, + parameter_235, + parameter_236, + parameter_237, + parameter_238, + parameter_239, + parameter_240, + parameter_241, + parameter_242, + parameter_243, + parameter_244, + parameter_245, + parameter_246, + parameter_247, + parameter_248, + parameter_249, + parameter_250, + parameter_251, + parameter_252, + parameter_253, + parameter_254, + parameter_255, + parameter_256, + parameter_257, + parameter_258, + parameter_259, + parameter_260, + parameter_261, + parameter_262, + parameter_263, + parameter_264, + parameter_265, + parameter_266, + parameter_267, + parameter_268, + parameter_269, + parameter_270, + parameter_271, + parameter_272, + parameter_273, + parameter_274, + parameter_275, + parameter_276, + parameter_277, + parameter_278, + parameter_279, + parameter_280, + parameter_281, + parameter_282, + parameter_283, + parameter_284, + parameter_285, + parameter_286, + parameter_287, + parameter_288, + parameter_289, + parameter_290, + parameter_291, + parameter_292, + parameter_293, + parameter_294, + parameter_295, + parameter_296, + parameter_297, + parameter_298, + parameter_299, + parameter_300, + parameter_301, + parameter_302, + parameter_303, + parameter_304, + parameter_305, + parameter_306, + parameter_307, + parameter_308, + parameter_309, + parameter_310, + parameter_311, + parameter_312, + parameter_313, + parameter_314, + parameter_315, + parameter_316, + parameter_317, + parameter_318, + parameter_319, + parameter_320, + parameter_321, + parameter_322, + parameter_323, + parameter_324, + parameter_325, + parameter_326, + parameter_327, + parameter_328, + parameter_329, + parameter_330, + parameter_331, + parameter_332, + parameter_333, + parameter_334, + parameter_335, + parameter_336, + parameter_337, + parameter_338, + parameter_339, + parameter_340, + parameter_341, + parameter_342, + parameter_343, + parameter_344, + parameter_345, + parameter_346, + parameter_347, + parameter_348, + parameter_349, + parameter_350, + parameter_351, + parameter_352, + parameter_353, + parameter_354, + parameter_355, + parameter_356, + parameter_357, + parameter_358, + parameter_359, + parameter_360, + parameter_361, + parameter_362, + parameter_363, + parameter_364, + parameter_365, + parameter_366, + parameter_367, + parameter_368, + parameter_369, + parameter_370, + parameter_371, + parameter_372, + parameter_373, + parameter_374, + parameter_375, + parameter_376, + parameter_377, + parameter_378, + parameter_379, + parameter_380, + parameter_381, + parameter_382, + parameter_383, + parameter_384, + parameter_385, + parameter_386, + parameter_387, + parameter_388, + parameter_389, + parameter_390, + parameter_391, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x26xb) <- (1x26xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x26xf32) <- (1x26xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x26xf32) <- (1x26xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x26xf32) <- (1x26xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x26x1024xf32) <- (1x26xi64, 17965x1024xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_391, 0, False) + del data_0, parameter_391 + + # pd_op.full: (1x26xi64) <- () + full_2 = paddle._C_ops.full( + [1, 26], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x26xi64) <- (1x26xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x26xi64) <- (1x26xi64, 1x26xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0 + + # pd_op.embedding: (1x26x1024xf32) <- (1x26xi64, 512x1024xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_390, -1, False) + del parameter_390 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x26x1024xf32) <- (1x26xi64, 2x1024xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_389, -1, False) + del data_1, parameter_389 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x26xi64) <- (1x26xi64, 1xf32) + scale_1 = paddle._C_ops.scale(full_2, full_4, float("0"), True) + del full_2, full_4 + + # pd_op.embedding: (1x26x1024xf32) <- (1x26xi64, 3x1024xf32) + embedding_3 = paddle._C_ops.embedding(scale_1, parameter_388, -1, False) + del parameter_388 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_2 = paddle._C_ops.add(add_1, embedding_3) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_2, parameter_387, parameter_386, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_386, parameter_387 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_15 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_16 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_17 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_18 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_19 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_20 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_21 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_22 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_23 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_24 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_25 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_26 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_27 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_28 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_29 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_30 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_31 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_32 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_33 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_34 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_35 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_36 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_37 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_38 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_39 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_40 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_41 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_42 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_43 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_44 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_45 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_46 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_47 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_48 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_49 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_50 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_51 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_52 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_53 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_54 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_55 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_56 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_57 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_58 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_59 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_60 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_61 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_62 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_63 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_64 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_65 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_66 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_67 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_68 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_69 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_70 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_71 = full_5 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_385, False, False) + del parameter_385 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_3 = paddle._C_ops.add(matmul_0, parameter_384) + del parameter_384 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 16, 64] + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_383, False, False) + del parameter_383 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_4 = paddle._C_ops.add(matmul_1, parameter_382) + del parameter_382 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_381, False, False) + del parameter_381 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_5 = paddle._C_ops.add(matmul_2, parameter_380) + del parameter_380 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_5, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_6 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_72 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_73 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_74 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_75 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_76 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_77 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_78 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_79 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_80 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_81 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_82 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_83 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_84 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_85 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_86 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_87 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_88 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_89 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_90 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_91 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_92 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_93 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_94 = full_6 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_0, full_6, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_2, transpose_1, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_6 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_0 = paddle._C_ops.softmax(add_6, -1) + del add_6 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 1024] + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_379, False, False) + del parameter_379 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_7 = paddle._C_ops.add(matmul_5, parameter_378) + del parameter_378 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_7, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_7 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_8 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_8, parameter_373, parameter_372, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_372, parameter_373 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_377, False, False) + del parameter_377 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_9 = paddle._C_ops.add(matmul_6, parameter_376) + del parameter_376 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_0 = paddle._C_ops.relu(add_9) + del add_9 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_7 = paddle._C_ops.matmul(relu_0, parameter_375, False, False) + del parameter_375 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_10 = paddle._C_ops.add(matmul_7, parameter_374) + del parameter_374 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_10, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_10 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_11 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_11, parameter_371, parameter_370, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_370, parameter_371 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_369, False, False) + del parameter_369 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_12 = paddle._C_ops.add(matmul_8, parameter_368) + del parameter_368 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_367, False, False) + del parameter_367 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_13 = paddle._C_ops.add(matmul_9, parameter_366) + del parameter_366 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_365, False, False) + del parameter_365 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_14 = paddle._C_ops.add(matmul_10, parameter_364) + del parameter_364 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_14, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_4, full_6, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_3, transpose_5, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_15 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_1 = paddle._C_ops.softmax(add_15, -1) + del add_15 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_363, False, False) + del parameter_363 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_16 = paddle._C_ops.add(matmul_13, parameter_362) + del parameter_362 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_16, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_16 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_17 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_17, parameter_357, parameter_356, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_356, parameter_357 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_361, False, False) + del parameter_361 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_18 = paddle._C_ops.add(matmul_14, parameter_360) + del parameter_360 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_1 = paddle._C_ops.relu(add_18) + del add_18 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_15 = paddle._C_ops.matmul(relu_1, parameter_359, False, False) + del parameter_359 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_19 = paddle._C_ops.add(matmul_15, parameter_358) + del parameter_358 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_19, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_19 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_20 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_20, parameter_355, parameter_354, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_354, parameter_355 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_353, False, False) + del parameter_353 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_21 = paddle._C_ops.add(matmul_16, parameter_352) + del parameter_352 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_351, False, False) + del parameter_351 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_22 = paddle._C_ops.add(matmul_17, parameter_350) + del parameter_350 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_349, False, False) + del parameter_349 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_23 = paddle._C_ops.add(matmul_18, parameter_348) + del parameter_348 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_23, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_8, full_6, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_4, transpose_9, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_24 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_2 = paddle._C_ops.softmax(add_24, -1) + del add_24 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_347, False, False) + del parameter_347 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_25 = paddle._C_ops.add(matmul_21, parameter_346) + del parameter_346 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_25, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_25 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_26 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_26, parameter_341, parameter_340, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_340, parameter_341 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_345, False, False) + del parameter_345 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_27 = paddle._C_ops.add(matmul_22, parameter_344) + del parameter_344 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_2 = paddle._C_ops.relu(add_27) + del add_27 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_23 = paddle._C_ops.matmul(relu_2, parameter_343, False, False) + del parameter_343 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_28 = paddle._C_ops.add(matmul_23, parameter_342) + del parameter_342 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_28, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_28 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_29 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_29, parameter_339, parameter_338, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_338, parameter_339 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_337, False, False) + del parameter_337 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_30 = paddle._C_ops.add(matmul_24, parameter_336) + del parameter_336 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_335, False, False) + del parameter_335 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_31 = paddle._C_ops.add(matmul_25, parameter_334) + del parameter_334 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_333, False, False) + del parameter_333 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_32 = paddle._C_ops.add(matmul_26, parameter_332) + del parameter_332 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_32, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_12, full_6, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_27 = paddle._C_ops.matmul(scale_5, transpose_13, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_33 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_3 = paddle._C_ops.softmax(add_33, -1) + del add_33 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_331, False, False) + del parameter_331 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_34 = paddle._C_ops.add(matmul_29, parameter_330) + del parameter_330 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_34, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_34 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_35 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_35, parameter_325, parameter_324, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_324, parameter_325 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_329, False, False) + del parameter_329 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_36 = paddle._C_ops.add(matmul_30, parameter_328) + del parameter_328 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_3 = paddle._C_ops.relu(add_36) + del add_36 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_31 = paddle._C_ops.matmul(relu_3, parameter_327, False, False) + del parameter_327 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_37 = paddle._C_ops.add(matmul_31, parameter_326) + del parameter_326 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_37, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_37 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_38 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_38, parameter_323, parameter_322, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_322, parameter_323 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_32 = paddle._C_ops.matmul(layer_norm_24, parameter_321, False, False) + del parameter_321 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_39 = paddle._C_ops.add(matmul_32, parameter_320) + del parameter_320 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_16 = paddle._C_ops.reshape(add_39, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_16 = paddle._C_ops.transpose(reshape_16, [0, 2, 1, 3]) + del reshape_16 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_33 = paddle._C_ops.matmul(layer_norm_24, parameter_319, False, False) + del parameter_319 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_40 = paddle._C_ops.add(matmul_33, parameter_318) + del parameter_318 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_34 = paddle._C_ops.matmul(layer_norm_24, parameter_317, False, False) + del parameter_317 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_41 = paddle._C_ops.add(matmul_34, parameter_316) + del parameter_316 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_17 = paddle._C_ops.reshape(add_40, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_17 = paddle._C_ops.transpose(reshape_17, [0, 2, 1, 3]) + del reshape_17 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_18 = paddle._C_ops.reshape(add_41, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_18 = paddle._C_ops.transpose(reshape_18, [0, 2, 1, 3]) + del reshape_18 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_6 = paddle._C_ops.scale(transpose_16, full_6, float("0"), True) + del transpose_16 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_35 = paddle._C_ops.matmul(scale_6, transpose_17, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_42 = paddle._C_ops.add(matmul_35, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_4 = paddle._C_ops.softmax(add_42, -1) + del add_42 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_26, dropout_27 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_4, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_36 = paddle._C_ops.matmul(dropout_26, transpose_18, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_19 = paddle._C_ops.transpose(matmul_36, [0, 2, 1, 3]) + del matmul_36 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_19 = paddle._C_ops.reshape(transpose_19, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_37 = paddle._C_ops.matmul(reshape_19, parameter_315, False, False) + del parameter_315 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_43 = paddle._C_ops.add(matmul_37, parameter_314) + del parameter_314 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_28, dropout_29 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_43, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_43 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_44 = paddle._C_ops.add(layer_norm_24, dropout_28) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_27, layer_norm_28, layer_norm_29 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_44, parameter_309, parameter_308, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_308, parameter_309 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_38 = paddle._C_ops.matmul(layer_norm_27, parameter_313, False, False) + del parameter_313 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_45 = paddle._C_ops.add(matmul_38, parameter_312) + del parameter_312 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_4 = paddle._C_ops.relu(add_45) + del add_45 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_39 = paddle._C_ops.matmul(relu_4, parameter_311, False, False) + del parameter_311 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_46 = paddle._C_ops.add(matmul_39, parameter_310) + del parameter_310 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_30, dropout_31 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_46, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_46 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_47 = paddle._C_ops.add(layer_norm_27, dropout_30) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_30, layer_norm_31, layer_norm_32 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_47, parameter_307, parameter_306, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_306, parameter_307 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_40 = paddle._C_ops.matmul(layer_norm_30, parameter_305, False, False) + del parameter_305 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_48 = paddle._C_ops.add(matmul_40, parameter_304) + del parameter_304 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_20 = paddle._C_ops.reshape(add_48, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_20 = paddle._C_ops.transpose(reshape_20, [0, 2, 1, 3]) + del reshape_20 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_41 = paddle._C_ops.matmul(layer_norm_30, parameter_303, False, False) + del parameter_303 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_49 = paddle._C_ops.add(matmul_41, parameter_302) + del parameter_302 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_42 = paddle._C_ops.matmul(layer_norm_30, parameter_301, False, False) + del parameter_301 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_50 = paddle._C_ops.add(matmul_42, parameter_300) + del parameter_300 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_21 = paddle._C_ops.reshape(add_49, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_21 = paddle._C_ops.transpose(reshape_21, [0, 2, 1, 3]) + del reshape_21 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_22 = paddle._C_ops.reshape(add_50, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_22 = paddle._C_ops.transpose(reshape_22, [0, 2, 1, 3]) + del reshape_22 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_7 = paddle._C_ops.scale(transpose_20, full_6, float("0"), True) + del transpose_20 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_43 = paddle._C_ops.matmul(scale_7, transpose_21, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_51 = paddle._C_ops.add(matmul_43, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_5 = paddle._C_ops.softmax(add_51, -1) + del add_51 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_32, dropout_33 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_5, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_44 = paddle._C_ops.matmul(dropout_32, transpose_22, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_23 = paddle._C_ops.transpose(matmul_44, [0, 2, 1, 3]) + del matmul_44 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_23 = paddle._C_ops.reshape(transpose_23, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_45 = paddle._C_ops.matmul(reshape_23, parameter_299, False, False) + del parameter_299 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_52 = paddle._C_ops.add(matmul_45, parameter_298) + del parameter_298 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_34, dropout_35 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_52, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_52 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_53 = paddle._C_ops.add(layer_norm_30, dropout_34) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_33, layer_norm_34, layer_norm_35 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_53, parameter_293, parameter_292, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_292, parameter_293 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_46 = paddle._C_ops.matmul(layer_norm_33, parameter_297, False, False) + del parameter_297 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_54 = paddle._C_ops.add(matmul_46, parameter_296) + del parameter_296 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_5 = paddle._C_ops.relu(add_54) + del add_54 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_47 = paddle._C_ops.matmul(relu_5, parameter_295, False, False) + del parameter_295 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_55 = paddle._C_ops.add(matmul_47, parameter_294) + del parameter_294 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_36, dropout_37 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_55, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_55 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_56 = paddle._C_ops.add(layer_norm_33, dropout_36) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_36, layer_norm_37, layer_norm_38 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_56, parameter_291, parameter_290, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_290, parameter_291 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_48 = paddle._C_ops.matmul(layer_norm_36, parameter_289, False, False) + del parameter_289 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_57 = paddle._C_ops.add(matmul_48, parameter_288) + del parameter_288 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_24 = paddle._C_ops.reshape(add_57, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_24 = paddle._C_ops.transpose(reshape_24, [0, 2, 1, 3]) + del reshape_24 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_49 = paddle._C_ops.matmul(layer_norm_36, parameter_287, False, False) + del parameter_287 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_58 = paddle._C_ops.add(matmul_49, parameter_286) + del parameter_286 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_50 = paddle._C_ops.matmul(layer_norm_36, parameter_285, False, False) + del parameter_285 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_59 = paddle._C_ops.add(matmul_50, parameter_284) + del parameter_284 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_25 = paddle._C_ops.reshape(add_58, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_25 = paddle._C_ops.transpose(reshape_25, [0, 2, 1, 3]) + del reshape_25 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_26 = paddle._C_ops.reshape(add_59, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_26 = paddle._C_ops.transpose(reshape_26, [0, 2, 1, 3]) + del reshape_26 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_8 = paddle._C_ops.scale(transpose_24, full_6, float("0"), True) + del transpose_24 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_51 = paddle._C_ops.matmul(scale_8, transpose_25, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_60 = paddle._C_ops.add(matmul_51, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_6 = paddle._C_ops.softmax(add_60, -1) + del add_60 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_38, dropout_39 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_6, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_52 = paddle._C_ops.matmul(dropout_38, transpose_26, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_27 = paddle._C_ops.transpose(matmul_52, [0, 2, 1, 3]) + del matmul_52 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_27 = paddle._C_ops.reshape(transpose_27, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_53 = paddle._C_ops.matmul(reshape_27, parameter_283, False, False) + del parameter_283 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_61 = paddle._C_ops.add(matmul_53, parameter_282) + del parameter_282 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_40, dropout_41 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_61, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_61 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_62 = paddle._C_ops.add(layer_norm_36, dropout_40) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_39, layer_norm_40, layer_norm_41 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_62, parameter_277, parameter_276, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_276, parameter_277 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_54 = paddle._C_ops.matmul(layer_norm_39, parameter_281, False, False) + del parameter_281 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_63 = paddle._C_ops.add(matmul_54, parameter_280) + del parameter_280 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_6 = paddle._C_ops.relu(add_63) + del add_63 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_55 = paddle._C_ops.matmul(relu_6, parameter_279, False, False) + del parameter_279 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_64 = paddle._C_ops.add(matmul_55, parameter_278) + del parameter_278 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_42, dropout_43 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_64, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_64 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_65 = paddle._C_ops.add(layer_norm_39, dropout_42) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_42, layer_norm_43, layer_norm_44 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_65, parameter_275, parameter_274, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_274, parameter_275 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_56 = paddle._C_ops.matmul(layer_norm_42, parameter_273, False, False) + del parameter_273 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_66 = paddle._C_ops.add(matmul_56, parameter_272) + del parameter_272 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_28 = paddle._C_ops.reshape(add_66, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_28 = paddle._C_ops.transpose(reshape_28, [0, 2, 1, 3]) + del reshape_28 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_57 = paddle._C_ops.matmul(layer_norm_42, parameter_271, False, False) + del parameter_271 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_67 = paddle._C_ops.add(matmul_57, parameter_270) + del parameter_270 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_58 = paddle._C_ops.matmul(layer_norm_42, parameter_269, False, False) + del parameter_269 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_68 = paddle._C_ops.add(matmul_58, parameter_268) + del parameter_268 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_29 = paddle._C_ops.reshape(add_67, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_29 = paddle._C_ops.transpose(reshape_29, [0, 2, 1, 3]) + del reshape_29 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_30 = paddle._C_ops.reshape(add_68, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_30 = paddle._C_ops.transpose(reshape_30, [0, 2, 1, 3]) + del reshape_30 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_9 = paddle._C_ops.scale(transpose_28, full_6, float("0"), True) + del transpose_28 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_59 = paddle._C_ops.matmul(scale_9, transpose_29, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_69 = paddle._C_ops.add(matmul_59, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_7 = paddle._C_ops.softmax(add_69, -1) + del add_69 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_44, dropout_45 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_7, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_60 = paddle._C_ops.matmul(dropout_44, transpose_30, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_31 = paddle._C_ops.transpose(matmul_60, [0, 2, 1, 3]) + del matmul_60 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_31 = paddle._C_ops.reshape(transpose_31, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_61 = paddle._C_ops.matmul(reshape_31, parameter_267, False, False) + del parameter_267 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_70 = paddle._C_ops.add(matmul_61, parameter_266) + del parameter_266 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_46, dropout_47 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_70, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_70 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_71 = paddle._C_ops.add(layer_norm_42, dropout_46) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_45, layer_norm_46, layer_norm_47 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_71, parameter_261, parameter_260, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_260, parameter_261 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_62 = paddle._C_ops.matmul(layer_norm_45, parameter_265, False, False) + del parameter_265 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_72 = paddle._C_ops.add(matmul_62, parameter_264) + del parameter_264 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_7 = paddle._C_ops.relu(add_72) + del add_72 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_63 = paddle._C_ops.matmul(relu_7, parameter_263, False, False) + del parameter_263 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_73 = paddle._C_ops.add(matmul_63, parameter_262) + del parameter_262 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_48, dropout_49 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_73, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_73 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_74 = paddle._C_ops.add(layer_norm_45, dropout_48) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_48, layer_norm_49, layer_norm_50 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_74, parameter_259, parameter_258, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_258, parameter_259 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_64 = paddle._C_ops.matmul(layer_norm_48, parameter_257, False, False) + del parameter_257 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_75 = paddle._C_ops.add(matmul_64, parameter_256) + del parameter_256 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_32 = paddle._C_ops.reshape(add_75, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_32 = paddle._C_ops.transpose(reshape_32, [0, 2, 1, 3]) + del reshape_32 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_65 = paddle._C_ops.matmul(layer_norm_48, parameter_255, False, False) + del parameter_255 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_76 = paddle._C_ops.add(matmul_65, parameter_254) + del parameter_254 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_66 = paddle._C_ops.matmul(layer_norm_48, parameter_253, False, False) + del parameter_253 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_77 = paddle._C_ops.add(matmul_66, parameter_252) + del parameter_252 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_33 = paddle._C_ops.reshape(add_76, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_33 = paddle._C_ops.transpose(reshape_33, [0, 2, 1, 3]) + del reshape_33 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_34 = paddle._C_ops.reshape(add_77, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_34 = paddle._C_ops.transpose(reshape_34, [0, 2, 1, 3]) + del reshape_34 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_10 = paddle._C_ops.scale(transpose_32, full_6, float("0"), True) + del transpose_32 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_67 = paddle._C_ops.matmul(scale_10, transpose_33, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_78 = paddle._C_ops.add(matmul_67, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_8 = paddle._C_ops.softmax(add_78, -1) + del add_78 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_50, dropout_51 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_8, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_68 = paddle._C_ops.matmul(dropout_50, transpose_34, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_35 = paddle._C_ops.transpose(matmul_68, [0, 2, 1, 3]) + del matmul_68 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_35 = paddle._C_ops.reshape(transpose_35, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_69 = paddle._C_ops.matmul(reshape_35, parameter_251, False, False) + del parameter_251 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_79 = paddle._C_ops.add(matmul_69, parameter_250) + del parameter_250 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_52, dropout_53 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_79, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_79 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_80 = paddle._C_ops.add(layer_norm_48, dropout_52) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_51, layer_norm_52, layer_norm_53 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_80, parameter_245, parameter_244, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_244, parameter_245 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_70 = paddle._C_ops.matmul(layer_norm_51, parameter_249, False, False) + del parameter_249 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_81 = paddle._C_ops.add(matmul_70, parameter_248) + del parameter_248 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_8 = paddle._C_ops.relu(add_81) + del add_81 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_71 = paddle._C_ops.matmul(relu_8, parameter_247, False, False) + del parameter_247 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_82 = paddle._C_ops.add(matmul_71, parameter_246) + del parameter_246 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_54, dropout_55 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_82, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_82 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_83 = paddle._C_ops.add(layer_norm_51, dropout_54) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_54, layer_norm_55, layer_norm_56 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_83, parameter_243, parameter_242, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_242, parameter_243 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_72 = paddle._C_ops.matmul(layer_norm_54, parameter_241, False, False) + del parameter_241 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_84 = paddle._C_ops.add(matmul_72, parameter_240) + del parameter_240 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_36 = paddle._C_ops.reshape(add_84, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_36 = paddle._C_ops.transpose(reshape_36, [0, 2, 1, 3]) + del reshape_36 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_73 = paddle._C_ops.matmul(layer_norm_54, parameter_239, False, False) + del parameter_239 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_85 = paddle._C_ops.add(matmul_73, parameter_238) + del parameter_238 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_74 = paddle._C_ops.matmul(layer_norm_54, parameter_237, False, False) + del parameter_237 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_86 = paddle._C_ops.add(matmul_74, parameter_236) + del parameter_236 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_37 = paddle._C_ops.reshape(add_85, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_37 = paddle._C_ops.transpose(reshape_37, [0, 2, 1, 3]) + del reshape_37 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_38 = paddle._C_ops.reshape(add_86, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_38 = paddle._C_ops.transpose(reshape_38, [0, 2, 1, 3]) + del reshape_38 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_11 = paddle._C_ops.scale(transpose_36, full_6, float("0"), True) + del transpose_36 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_75 = paddle._C_ops.matmul(scale_11, transpose_37, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_87 = paddle._C_ops.add(matmul_75, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_9 = paddle._C_ops.softmax(add_87, -1) + del add_87 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_56, dropout_57 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_9, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_76 = paddle._C_ops.matmul(dropout_56, transpose_38, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_39 = paddle._C_ops.transpose(matmul_76, [0, 2, 1, 3]) + del matmul_76 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_39 = paddle._C_ops.reshape(transpose_39, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_77 = paddle._C_ops.matmul(reshape_39, parameter_235, False, False) + del parameter_235 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_88 = paddle._C_ops.add(matmul_77, parameter_234) + del parameter_234 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_58, dropout_59 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_88, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_88 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_89 = paddle._C_ops.add(layer_norm_54, dropout_58) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_57, layer_norm_58, layer_norm_59 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_89, parameter_229, parameter_228, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_228, parameter_229 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_78 = paddle._C_ops.matmul(layer_norm_57, parameter_233, False, False) + del parameter_233 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_90 = paddle._C_ops.add(matmul_78, parameter_232) + del parameter_232 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_9 = paddle._C_ops.relu(add_90) + del add_90 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_79 = paddle._C_ops.matmul(relu_9, parameter_231, False, False) + del parameter_231 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_91 = paddle._C_ops.add(matmul_79, parameter_230) + del parameter_230 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_60, dropout_61 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_91, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_91 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_92 = paddle._C_ops.add(layer_norm_57, dropout_60) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_60, layer_norm_61, layer_norm_62 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_92, parameter_227, parameter_226, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_226, parameter_227 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_80 = paddle._C_ops.matmul(layer_norm_60, parameter_225, False, False) + del parameter_225 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_93 = paddle._C_ops.add(matmul_80, parameter_224) + del parameter_224 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_40 = paddle._C_ops.reshape(add_93, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_40 = paddle._C_ops.transpose(reshape_40, [0, 2, 1, 3]) + del reshape_40 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_81 = paddle._C_ops.matmul(layer_norm_60, parameter_223, False, False) + del parameter_223 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_94 = paddle._C_ops.add(matmul_81, parameter_222) + del parameter_222 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_82 = paddle._C_ops.matmul(layer_norm_60, parameter_221, False, False) + del parameter_221 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_95 = paddle._C_ops.add(matmul_82, parameter_220) + del parameter_220 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_41 = paddle._C_ops.reshape(add_94, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_41 = paddle._C_ops.transpose(reshape_41, [0, 2, 1, 3]) + del reshape_41 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_42 = paddle._C_ops.reshape(add_95, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_42 = paddle._C_ops.transpose(reshape_42, [0, 2, 1, 3]) + del reshape_42 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_12 = paddle._C_ops.scale(transpose_40, full_6, float("0"), True) + del transpose_40 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_83 = paddle._C_ops.matmul(scale_12, transpose_41, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_96 = paddle._C_ops.add(matmul_83, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_10 = paddle._C_ops.softmax(add_96, -1) + del add_96 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_62, dropout_63 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_10, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_84 = paddle._C_ops.matmul(dropout_62, transpose_42, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_43 = paddle._C_ops.transpose(matmul_84, [0, 2, 1, 3]) + del matmul_84 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_43 = paddle._C_ops.reshape(transpose_43, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_85 = paddle._C_ops.matmul(reshape_43, parameter_219, False, False) + del parameter_219 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_97 = paddle._C_ops.add(matmul_85, parameter_218) + del parameter_218 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_64, dropout_65 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_97, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_97 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_98 = paddle._C_ops.add(layer_norm_60, dropout_64) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_63, layer_norm_64, layer_norm_65 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_98, parameter_213, parameter_212, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_212, parameter_213 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_86 = paddle._C_ops.matmul(layer_norm_63, parameter_217, False, False) + del parameter_217 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_99 = paddle._C_ops.add(matmul_86, parameter_216) + del parameter_216 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_10 = paddle._C_ops.relu(add_99) + del add_99 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_87 = paddle._C_ops.matmul(relu_10, parameter_215, False, False) + del parameter_215 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_100 = paddle._C_ops.add(matmul_87, parameter_214) + del parameter_214 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_66, dropout_67 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_100, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_100 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_101 = paddle._C_ops.add(layer_norm_63, dropout_66) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_66, layer_norm_67, layer_norm_68 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_101, parameter_211, parameter_210, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_210, parameter_211 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_88 = paddle._C_ops.matmul(layer_norm_66, parameter_209, False, False) + del parameter_209 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_102 = paddle._C_ops.add(matmul_88, parameter_208) + del parameter_208 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_44 = paddle._C_ops.reshape(add_102, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_44 = paddle._C_ops.transpose(reshape_44, [0, 2, 1, 3]) + del reshape_44 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_89 = paddle._C_ops.matmul(layer_norm_66, parameter_207, False, False) + del parameter_207 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_103 = paddle._C_ops.add(matmul_89, parameter_206) + del parameter_206 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_90 = paddle._C_ops.matmul(layer_norm_66, parameter_205, False, False) + del parameter_205 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_104 = paddle._C_ops.add(matmul_90, parameter_204) + del parameter_204 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_45 = paddle._C_ops.reshape(add_103, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_45 = paddle._C_ops.transpose(reshape_45, [0, 2, 1, 3]) + del reshape_45 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_46 = paddle._C_ops.reshape(add_104, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_46 = paddle._C_ops.transpose(reshape_46, [0, 2, 1, 3]) + del reshape_46 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_13 = paddle._C_ops.scale(transpose_44, full_6, float("0"), True) + del transpose_44 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_91 = paddle._C_ops.matmul(scale_13, transpose_45, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_105 = paddle._C_ops.add(matmul_91, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_11 = paddle._C_ops.softmax(add_105, -1) + del add_105 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_68, dropout_69 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_11, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_92 = paddle._C_ops.matmul(dropout_68, transpose_46, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_47 = paddle._C_ops.transpose(matmul_92, [0, 2, 1, 3]) + del matmul_92 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_47 = paddle._C_ops.reshape(transpose_47, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_93 = paddle._C_ops.matmul(reshape_47, parameter_203, False, False) + del parameter_203 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_106 = paddle._C_ops.add(matmul_93, parameter_202) + del parameter_202 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_70, dropout_71 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_106, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_106 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_107 = paddle._C_ops.add(layer_norm_66, dropout_70) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_69, layer_norm_70, layer_norm_71 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_107, parameter_197, parameter_196, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_196, parameter_197 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_94 = paddle._C_ops.matmul(layer_norm_69, parameter_201, False, False) + del parameter_201 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_108 = paddle._C_ops.add(matmul_94, parameter_200) + del parameter_200 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_11 = paddle._C_ops.relu(add_108) + del add_108 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_95 = paddle._C_ops.matmul(relu_11, parameter_199, False, False) + del parameter_199 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_109 = paddle._C_ops.add(matmul_95, parameter_198) + del parameter_198 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_72, dropout_73 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_109, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_109 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_110 = paddle._C_ops.add(layer_norm_69, dropout_72) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_72, layer_norm_73, layer_norm_74 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_110, parameter_195, parameter_194, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_194, parameter_195 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_96 = paddle._C_ops.matmul(layer_norm_72, parameter_193, False, False) + del parameter_193 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_111 = paddle._C_ops.add(matmul_96, parameter_192) + del parameter_192 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_48 = paddle._C_ops.reshape(add_111, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_48 = paddle._C_ops.transpose(reshape_48, [0, 2, 1, 3]) + del reshape_48 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_97 = paddle._C_ops.matmul(layer_norm_72, parameter_191, False, False) + del parameter_191 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_112 = paddle._C_ops.add(matmul_97, parameter_190) + del parameter_190 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_98 = paddle._C_ops.matmul(layer_norm_72, parameter_189, False, False) + del parameter_189 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_113 = paddle._C_ops.add(matmul_98, parameter_188) + del parameter_188 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_49 = paddle._C_ops.reshape(add_112, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_49 = paddle._C_ops.transpose(reshape_49, [0, 2, 1, 3]) + del reshape_49 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_50 = paddle._C_ops.reshape(add_113, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_50 = paddle._C_ops.transpose(reshape_50, [0, 2, 1, 3]) + del reshape_50 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_14 = paddle._C_ops.scale(transpose_48, full_6, float("0"), True) + del transpose_48 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_99 = paddle._C_ops.matmul(scale_14, transpose_49, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_114 = paddle._C_ops.add(matmul_99, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_12 = paddle._C_ops.softmax(add_114, -1) + del add_114 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_74, dropout_75 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_12, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_100 = paddle._C_ops.matmul(dropout_74, transpose_50, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_51 = paddle._C_ops.transpose(matmul_100, [0, 2, 1, 3]) + del matmul_100 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_51 = paddle._C_ops.reshape(transpose_51, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_101 = paddle._C_ops.matmul(reshape_51, parameter_187, False, False) + del parameter_187 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_115 = paddle._C_ops.add(matmul_101, parameter_186) + del parameter_186 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_76, dropout_77 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_115, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_115 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_116 = paddle._C_ops.add(layer_norm_72, dropout_76) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_75, layer_norm_76, layer_norm_77 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_116, parameter_181, parameter_180, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_180, parameter_181 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_102 = paddle._C_ops.matmul(layer_norm_75, parameter_185, False, False) + del parameter_185 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_117 = paddle._C_ops.add(matmul_102, parameter_184) + del parameter_184 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_12 = paddle._C_ops.relu(add_117) + del add_117 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_103 = paddle._C_ops.matmul(relu_12, parameter_183, False, False) + del parameter_183 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_118 = paddle._C_ops.add(matmul_103, parameter_182) + del parameter_182 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_78, dropout_79 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_118, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_118 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_119 = paddle._C_ops.add(layer_norm_75, dropout_78) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_78, layer_norm_79, layer_norm_80 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_119, parameter_179, parameter_178, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_178, parameter_179 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_104 = paddle._C_ops.matmul(layer_norm_78, parameter_177, False, False) + del parameter_177 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_120 = paddle._C_ops.add(matmul_104, parameter_176) + del parameter_176 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_52 = paddle._C_ops.reshape(add_120, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_52 = paddle._C_ops.transpose(reshape_52, [0, 2, 1, 3]) + del reshape_52 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_105 = paddle._C_ops.matmul(layer_norm_78, parameter_175, False, False) + del parameter_175 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_121 = paddle._C_ops.add(matmul_105, parameter_174) + del parameter_174 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_106 = paddle._C_ops.matmul(layer_norm_78, parameter_173, False, False) + del parameter_173 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_122 = paddle._C_ops.add(matmul_106, parameter_172) + del parameter_172 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_53 = paddle._C_ops.reshape(add_121, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_53 = paddle._C_ops.transpose(reshape_53, [0, 2, 1, 3]) + del reshape_53 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_54 = paddle._C_ops.reshape(add_122, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_54 = paddle._C_ops.transpose(reshape_54, [0, 2, 1, 3]) + del reshape_54 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_15 = paddle._C_ops.scale(transpose_52, full_6, float("0"), True) + del transpose_52 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_107 = paddle._C_ops.matmul(scale_15, transpose_53, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_123 = paddle._C_ops.add(matmul_107, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_13 = paddle._C_ops.softmax(add_123, -1) + del add_123 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_80, dropout_81 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_13, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_108 = paddle._C_ops.matmul(dropout_80, transpose_54, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_55 = paddle._C_ops.transpose(matmul_108, [0, 2, 1, 3]) + del matmul_108 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_55 = paddle._C_ops.reshape(transpose_55, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_109 = paddle._C_ops.matmul(reshape_55, parameter_171, False, False) + del parameter_171 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_124 = paddle._C_ops.add(matmul_109, parameter_170) + del parameter_170 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_82, dropout_83 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_124, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_124 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_125 = paddle._C_ops.add(layer_norm_78, dropout_82) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_81, layer_norm_82, layer_norm_83 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_125, parameter_165, parameter_164, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_164, parameter_165 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_110 = paddle._C_ops.matmul(layer_norm_81, parameter_169, False, False) + del parameter_169 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_126 = paddle._C_ops.add(matmul_110, parameter_168) + del parameter_168 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_13 = paddle._C_ops.relu(add_126) + del add_126 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_111 = paddle._C_ops.matmul(relu_13, parameter_167, False, False) + del parameter_167 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_127 = paddle._C_ops.add(matmul_111, parameter_166) + del parameter_166 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_84, dropout_85 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_127, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_127 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_128 = paddle._C_ops.add(layer_norm_81, dropout_84) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_84, layer_norm_85, layer_norm_86 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_128, parameter_163, parameter_162, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_162, parameter_163 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_112 = paddle._C_ops.matmul(layer_norm_84, parameter_161, False, False) + del parameter_161 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_129 = paddle._C_ops.add(matmul_112, parameter_160) + del parameter_160 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_56 = paddle._C_ops.reshape(add_129, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_56 = paddle._C_ops.transpose(reshape_56, [0, 2, 1, 3]) + del reshape_56 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_113 = paddle._C_ops.matmul(layer_norm_84, parameter_159, False, False) + del parameter_159 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_130 = paddle._C_ops.add(matmul_113, parameter_158) + del parameter_158 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_114 = paddle._C_ops.matmul(layer_norm_84, parameter_157, False, False) + del parameter_157 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_131 = paddle._C_ops.add(matmul_114, parameter_156) + del parameter_156 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_57 = paddle._C_ops.reshape(add_130, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_57 = paddle._C_ops.transpose(reshape_57, [0, 2, 1, 3]) + del reshape_57 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_58 = paddle._C_ops.reshape(add_131, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_58 = paddle._C_ops.transpose(reshape_58, [0, 2, 1, 3]) + del reshape_58 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_16 = paddle._C_ops.scale(transpose_56, full_6, float("0"), True) + del transpose_56 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_115 = paddle._C_ops.matmul(scale_16, transpose_57, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_132 = paddle._C_ops.add(matmul_115, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_14 = paddle._C_ops.softmax(add_132, -1) + del add_132 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_86, dropout_87 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_14, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_116 = paddle._C_ops.matmul(dropout_86, transpose_58, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_59 = paddle._C_ops.transpose(matmul_116, [0, 2, 1, 3]) + del matmul_116 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_59 = paddle._C_ops.reshape(transpose_59, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_117 = paddle._C_ops.matmul(reshape_59, parameter_155, False, False) + del parameter_155 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_133 = paddle._C_ops.add(matmul_117, parameter_154) + del parameter_154 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_88, dropout_89 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_133, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_133 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_134 = paddle._C_ops.add(layer_norm_84, dropout_88) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_87, layer_norm_88, layer_norm_89 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_134, parameter_149, parameter_148, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_148, parameter_149 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_118 = paddle._C_ops.matmul(layer_norm_87, parameter_153, False, False) + del parameter_153 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_135 = paddle._C_ops.add(matmul_118, parameter_152) + del parameter_152 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_14 = paddle._C_ops.relu(add_135) + del add_135 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_119 = paddle._C_ops.matmul(relu_14, parameter_151, False, False) + del parameter_151 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_136 = paddle._C_ops.add(matmul_119, parameter_150) + del parameter_150 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_90, dropout_91 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_136, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_136 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_137 = paddle._C_ops.add(layer_norm_87, dropout_90) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_90, layer_norm_91, layer_norm_92 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_137, parameter_147, parameter_146, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_146, parameter_147 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_120 = paddle._C_ops.matmul(layer_norm_90, parameter_145, False, False) + del parameter_145 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_138 = paddle._C_ops.add(matmul_120, parameter_144) + del parameter_144 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_60 = paddle._C_ops.reshape(add_138, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_60 = paddle._C_ops.transpose(reshape_60, [0, 2, 1, 3]) + del reshape_60 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_121 = paddle._C_ops.matmul(layer_norm_90, parameter_143, False, False) + del parameter_143 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_139 = paddle._C_ops.add(matmul_121, parameter_142) + del parameter_142 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_122 = paddle._C_ops.matmul(layer_norm_90, parameter_141, False, False) + del parameter_141 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_140 = paddle._C_ops.add(matmul_122, parameter_140) + del parameter_140 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_61 = paddle._C_ops.reshape(add_139, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_61 = paddle._C_ops.transpose(reshape_61, [0, 2, 1, 3]) + del reshape_61 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_62 = paddle._C_ops.reshape(add_140, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_62 = paddle._C_ops.transpose(reshape_62, [0, 2, 1, 3]) + del reshape_62 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_17 = paddle._C_ops.scale(transpose_60, full_6, float("0"), True) + del transpose_60 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_123 = paddle._C_ops.matmul(scale_17, transpose_61, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_141 = paddle._C_ops.add(matmul_123, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_15 = paddle._C_ops.softmax(add_141, -1) + del add_141 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_92, dropout_93 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_15, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_124 = paddle._C_ops.matmul(dropout_92, transpose_62, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_63 = paddle._C_ops.transpose(matmul_124, [0, 2, 1, 3]) + del matmul_124 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_63 = paddle._C_ops.reshape(transpose_63, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_125 = paddle._C_ops.matmul(reshape_63, parameter_139, False, False) + del parameter_139 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_142 = paddle._C_ops.add(matmul_125, parameter_138) + del parameter_138 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_94, dropout_95 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_142, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_142 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_143 = paddle._C_ops.add(layer_norm_90, dropout_94) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_93, layer_norm_94, layer_norm_95 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_143, parameter_133, parameter_132, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_132, parameter_133 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_126 = paddle._C_ops.matmul(layer_norm_93, parameter_137, False, False) + del parameter_137 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_144 = paddle._C_ops.add(matmul_126, parameter_136) + del parameter_136 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_15 = paddle._C_ops.relu(add_144) + del add_144 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_127 = paddle._C_ops.matmul(relu_15, parameter_135, False, False) + del parameter_135 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_145 = paddle._C_ops.add(matmul_127, parameter_134) + del parameter_134 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_96, dropout_97 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_145, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_145 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_146 = paddle._C_ops.add(layer_norm_93, dropout_96) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_96, layer_norm_97, layer_norm_98 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_146, parameter_131, parameter_130, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_130, parameter_131 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_128 = paddle._C_ops.matmul(layer_norm_96, parameter_129, False, False) + del parameter_129 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_147 = paddle._C_ops.add(matmul_128, parameter_128) + del parameter_128 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_64 = paddle._C_ops.reshape(add_147, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_64 = paddle._C_ops.transpose(reshape_64, [0, 2, 1, 3]) + del reshape_64 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_129 = paddle._C_ops.matmul(layer_norm_96, parameter_127, False, False) + del parameter_127 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_148 = paddle._C_ops.add(matmul_129, parameter_126) + del parameter_126 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_130 = paddle._C_ops.matmul(layer_norm_96, parameter_125, False, False) + del parameter_125 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_149 = paddle._C_ops.add(matmul_130, parameter_124) + del parameter_124 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_65 = paddle._C_ops.reshape(add_148, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_65 = paddle._C_ops.transpose(reshape_65, [0, 2, 1, 3]) + del reshape_65 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_66 = paddle._C_ops.reshape(add_149, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_66 = paddle._C_ops.transpose(reshape_66, [0, 2, 1, 3]) + del reshape_66 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_18 = paddle._C_ops.scale(transpose_64, full_6, float("0"), True) + del transpose_64 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_131 = paddle._C_ops.matmul(scale_18, transpose_65, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_150 = paddle._C_ops.add(matmul_131, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_16 = paddle._C_ops.softmax(add_150, -1) + del add_150 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_98, dropout_99 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_16, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_132 = paddle._C_ops.matmul(dropout_98, transpose_66, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_67 = paddle._C_ops.transpose(matmul_132, [0, 2, 1, 3]) + del matmul_132 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_67 = paddle._C_ops.reshape(transpose_67, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_133 = paddle._C_ops.matmul(reshape_67, parameter_123, False, False) + del parameter_123 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_151 = paddle._C_ops.add(matmul_133, parameter_122) + del parameter_122 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_100, dropout_101 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_151, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_151 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_152 = paddle._C_ops.add(layer_norm_96, dropout_100) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_99, layer_norm_100, layer_norm_101 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_152, parameter_117, parameter_116, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_116, parameter_117 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_134 = paddle._C_ops.matmul(layer_norm_99, parameter_121, False, False) + del parameter_121 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_153 = paddle._C_ops.add(matmul_134, parameter_120) + del parameter_120 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_16 = paddle._C_ops.relu(add_153) + del add_153 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_135 = paddle._C_ops.matmul(relu_16, parameter_119, False, False) + del parameter_119 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_154 = paddle._C_ops.add(matmul_135, parameter_118) + del parameter_118 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_102, dropout_103 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_154, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_154 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_155 = paddle._C_ops.add(layer_norm_99, dropout_102) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_102, layer_norm_103, layer_norm_104 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_155, parameter_115, parameter_114, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_114, parameter_115 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_136 = paddle._C_ops.matmul(layer_norm_102, parameter_113, False, False) + del parameter_113 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_156 = paddle._C_ops.add(matmul_136, parameter_112) + del parameter_112 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_68 = paddle._C_ops.reshape(add_156, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_68 = paddle._C_ops.transpose(reshape_68, [0, 2, 1, 3]) + del reshape_68 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_137 = paddle._C_ops.matmul(layer_norm_102, parameter_111, False, False) + del parameter_111 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_157 = paddle._C_ops.add(matmul_137, parameter_110) + del parameter_110 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_138 = paddle._C_ops.matmul(layer_norm_102, parameter_109, False, False) + del parameter_109 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_158 = paddle._C_ops.add(matmul_138, parameter_108) + del parameter_108 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_69 = paddle._C_ops.reshape(add_157, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_69 = paddle._C_ops.transpose(reshape_69, [0, 2, 1, 3]) + del reshape_69 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_70 = paddle._C_ops.reshape(add_158, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_70 = paddle._C_ops.transpose(reshape_70, [0, 2, 1, 3]) + del reshape_70 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_19 = paddle._C_ops.scale(transpose_68, full_6, float("0"), True) + del transpose_68 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_139 = paddle._C_ops.matmul(scale_19, transpose_69, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_159 = paddle._C_ops.add(matmul_139, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_17 = paddle._C_ops.softmax(add_159, -1) + del add_159 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_104, dropout_105 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_17, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_140 = paddle._C_ops.matmul(dropout_104, transpose_70, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_71 = paddle._C_ops.transpose(matmul_140, [0, 2, 1, 3]) + del matmul_140 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_71 = paddle._C_ops.reshape(transpose_71, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_141 = paddle._C_ops.matmul(reshape_71, parameter_107, False, False) + del parameter_107 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_160 = paddle._C_ops.add(matmul_141, parameter_106) + del parameter_106 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_106, dropout_107 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_160, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_160 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_161 = paddle._C_ops.add(layer_norm_102, dropout_106) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_105, layer_norm_106, layer_norm_107 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_161, parameter_101, parameter_100, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_100, parameter_101 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_142 = paddle._C_ops.matmul(layer_norm_105, parameter_105, False, False) + del parameter_105 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_162 = paddle._C_ops.add(matmul_142, parameter_104) + del parameter_104 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_17 = paddle._C_ops.relu(add_162) + del add_162 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_143 = paddle._C_ops.matmul(relu_17, parameter_103, False, False) + del parameter_103 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_163 = paddle._C_ops.add(matmul_143, parameter_102) + del parameter_102 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_108, dropout_109 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_163, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_163 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_164 = paddle._C_ops.add(layer_norm_105, dropout_108) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_108, layer_norm_109, layer_norm_110 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_164, parameter_99, parameter_98, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_98, parameter_99 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_144 = paddle._C_ops.matmul(layer_norm_108, parameter_97, False, False) + del parameter_97 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_165 = paddle._C_ops.add(matmul_144, parameter_96) + del parameter_96 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_72 = paddle._C_ops.reshape(add_165, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_72 = paddle._C_ops.transpose(reshape_72, [0, 2, 1, 3]) + del reshape_72 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_145 = paddle._C_ops.matmul(layer_norm_108, parameter_95, False, False) + del parameter_95 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_166 = paddle._C_ops.add(matmul_145, parameter_94) + del parameter_94 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_146 = paddle._C_ops.matmul(layer_norm_108, parameter_93, False, False) + del parameter_93 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_167 = paddle._C_ops.add(matmul_146, parameter_92) + del parameter_92 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_73 = paddle._C_ops.reshape(add_166, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_73 = paddle._C_ops.transpose(reshape_73, [0, 2, 1, 3]) + del reshape_73 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_74 = paddle._C_ops.reshape(add_167, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_74 = paddle._C_ops.transpose(reshape_74, [0, 2, 1, 3]) + del reshape_74 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_20 = paddle._C_ops.scale(transpose_72, full_6, float("0"), True) + del transpose_72 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_147 = paddle._C_ops.matmul(scale_20, transpose_73, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_168 = paddle._C_ops.add(matmul_147, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_18 = paddle._C_ops.softmax(add_168, -1) + del add_168 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_110, dropout_111 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_18, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_148 = paddle._C_ops.matmul(dropout_110, transpose_74, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_75 = paddle._C_ops.transpose(matmul_148, [0, 2, 1, 3]) + del matmul_148 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_75 = paddle._C_ops.reshape(transpose_75, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_149 = paddle._C_ops.matmul(reshape_75, parameter_91, False, False) + del parameter_91 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_169 = paddle._C_ops.add(matmul_149, parameter_90) + del parameter_90 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_112, dropout_113 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_169, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_169 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_170 = paddle._C_ops.add(layer_norm_108, dropout_112) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_111, layer_norm_112, layer_norm_113 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_170, parameter_85, parameter_84, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_84, parameter_85 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_150 = paddle._C_ops.matmul(layer_norm_111, parameter_89, False, False) + del parameter_89 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_171 = paddle._C_ops.add(matmul_150, parameter_88) + del parameter_88 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_18 = paddle._C_ops.relu(add_171) + del add_171 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_151 = paddle._C_ops.matmul(relu_18, parameter_87, False, False) + del parameter_87 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_172 = paddle._C_ops.add(matmul_151, parameter_86) + del parameter_86 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_114, dropout_115 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_172, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_172 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_173 = paddle._C_ops.add(layer_norm_111, dropout_114) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_114, layer_norm_115, layer_norm_116 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_173, parameter_83, parameter_82, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_82, parameter_83 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_152 = paddle._C_ops.matmul(layer_norm_114, parameter_81, False, False) + del parameter_81 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_174 = paddle._C_ops.add(matmul_152, parameter_80) + del parameter_80 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_76 = paddle._C_ops.reshape(add_174, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_76 = paddle._C_ops.transpose(reshape_76, [0, 2, 1, 3]) + del reshape_76 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_153 = paddle._C_ops.matmul(layer_norm_114, parameter_79, False, False) + del parameter_79 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_175 = paddle._C_ops.add(matmul_153, parameter_78) + del parameter_78 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_154 = paddle._C_ops.matmul(layer_norm_114, parameter_77, False, False) + del parameter_77 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_176 = paddle._C_ops.add(matmul_154, parameter_76) + del parameter_76 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_77 = paddle._C_ops.reshape(add_175, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_77 = paddle._C_ops.transpose(reshape_77, [0, 2, 1, 3]) + del reshape_77 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_78 = paddle._C_ops.reshape(add_176, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_78 = paddle._C_ops.transpose(reshape_78, [0, 2, 1, 3]) + del reshape_78 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_21 = paddle._C_ops.scale(transpose_76, full_6, float("0"), True) + del transpose_76 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_155 = paddle._C_ops.matmul(scale_21, transpose_77, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_177 = paddle._C_ops.add(matmul_155, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_19 = paddle._C_ops.softmax(add_177, -1) + del add_177 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_116, dropout_117 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_19, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_156 = paddle._C_ops.matmul(dropout_116, transpose_78, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_79 = paddle._C_ops.transpose(matmul_156, [0, 2, 1, 3]) + del matmul_156 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_79 = paddle._C_ops.reshape(transpose_79, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_157 = paddle._C_ops.matmul(reshape_79, parameter_75, False, False) + del parameter_75 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_178 = paddle._C_ops.add(matmul_157, parameter_74) + del parameter_74 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_118, dropout_119 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_178, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_178 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_179 = paddle._C_ops.add(layer_norm_114, dropout_118) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_117, layer_norm_118, layer_norm_119 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_179, parameter_69, parameter_68, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_68, parameter_69 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_158 = paddle._C_ops.matmul(layer_norm_117, parameter_73, False, False) + del parameter_73 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_180 = paddle._C_ops.add(matmul_158, parameter_72) + del parameter_72 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_19 = paddle._C_ops.relu(add_180) + del add_180 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_159 = paddle._C_ops.matmul(relu_19, parameter_71, False, False) + del parameter_71 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_181 = paddle._C_ops.add(matmul_159, parameter_70) + del parameter_70 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_120, dropout_121 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_181, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_181 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_182 = paddle._C_ops.add(layer_norm_117, dropout_120) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_120, layer_norm_121, layer_norm_122 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_182, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_160 = paddle._C_ops.matmul(layer_norm_120, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_183 = paddle._C_ops.add(matmul_160, parameter_64) + del parameter_64 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_80 = paddle._C_ops.reshape(add_183, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_80 = paddle._C_ops.transpose(reshape_80, [0, 2, 1, 3]) + del reshape_80 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_161 = paddle._C_ops.matmul(layer_norm_120, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_184 = paddle._C_ops.add(matmul_161, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_162 = paddle._C_ops.matmul(layer_norm_120, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_185 = paddle._C_ops.add(matmul_162, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_81 = paddle._C_ops.reshape(add_184, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_81 = paddle._C_ops.transpose(reshape_81, [0, 2, 1, 3]) + del reshape_81 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_82 = paddle._C_ops.reshape(add_185, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_82 = paddle._C_ops.transpose(reshape_82, [0, 2, 1, 3]) + del reshape_82 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_22 = paddle._C_ops.scale(transpose_80, full_6, float("0"), True) + del transpose_80 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_163 = paddle._C_ops.matmul(scale_22, transpose_81, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_186 = paddle._C_ops.add(matmul_163, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_20 = paddle._C_ops.softmax(add_186, -1) + del add_186 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_122, dropout_123 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_20, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_164 = paddle._C_ops.matmul(dropout_122, transpose_82, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_83 = paddle._C_ops.transpose(matmul_164, [0, 2, 1, 3]) + del matmul_164 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_83 = paddle._C_ops.reshape(transpose_83, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_165 = paddle._C_ops.matmul(reshape_83, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_187 = paddle._C_ops.add(matmul_165, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_124, dropout_125 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_187, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_187 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_188 = paddle._C_ops.add(layer_norm_120, dropout_124) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_123, layer_norm_124, layer_norm_125 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_188, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_166 = paddle._C_ops.matmul(layer_norm_123, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_189 = paddle._C_ops.add(matmul_166, parameter_56) + del parameter_56 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_20 = paddle._C_ops.relu(add_189) + del add_189 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_167 = paddle._C_ops.matmul(relu_20, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_190 = paddle._C_ops.add(matmul_167, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_126, dropout_127 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_190, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_190 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_191 = paddle._C_ops.add(layer_norm_123, dropout_126) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_126, layer_norm_127, layer_norm_128 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_191, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_168 = paddle._C_ops.matmul(layer_norm_126, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_192 = paddle._C_ops.add(matmul_168, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_84 = paddle._C_ops.reshape(add_192, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_84 = paddle._C_ops.transpose(reshape_84, [0, 2, 1, 3]) + del reshape_84 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_169 = paddle._C_ops.matmul(layer_norm_126, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_193 = paddle._C_ops.add(matmul_169, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_170 = paddle._C_ops.matmul(layer_norm_126, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_194 = paddle._C_ops.add(matmul_170, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_85 = paddle._C_ops.reshape(add_193, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_85 = paddle._C_ops.transpose(reshape_85, [0, 2, 1, 3]) + del reshape_85 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_86 = paddle._C_ops.reshape(add_194, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_86 = paddle._C_ops.transpose(reshape_86, [0, 2, 1, 3]) + del reshape_86 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_23 = paddle._C_ops.scale(transpose_84, full_6, float("0"), True) + del transpose_84 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_171 = paddle._C_ops.matmul(scale_23, transpose_85, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_195 = paddle._C_ops.add(matmul_171, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_21 = paddle._C_ops.softmax(add_195, -1) + del add_195 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_128, dropout_129 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_21, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_172 = paddle._C_ops.matmul(dropout_128, transpose_86, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_87 = paddle._C_ops.transpose(matmul_172, [0, 2, 1, 3]) + del matmul_172 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_87 = paddle._C_ops.reshape(transpose_87, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_173 = paddle._C_ops.matmul(reshape_87, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_196 = paddle._C_ops.add(matmul_173, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_130, dropout_131 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_196, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_196 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_197 = paddle._C_ops.add(layer_norm_126, dropout_130) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_129, layer_norm_130, layer_norm_131 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_197, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_174 = paddle._C_ops.matmul(layer_norm_129, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_198 = paddle._C_ops.add(matmul_174, parameter_40) + del parameter_40 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_21 = paddle._C_ops.relu(add_198) + del add_198 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_175 = paddle._C_ops.matmul(relu_21, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_199 = paddle._C_ops.add(matmul_175, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_132, dropout_133 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_199, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_199 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_200 = paddle._C_ops.add(layer_norm_129, dropout_132) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_132, layer_norm_133, layer_norm_134 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_200, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_176 = paddle._C_ops.matmul(layer_norm_132, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_201 = paddle._C_ops.add(matmul_176, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_88 = paddle._C_ops.reshape(add_201, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_88 = paddle._C_ops.transpose(reshape_88, [0, 2, 1, 3]) + del reshape_88 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_177 = paddle._C_ops.matmul(layer_norm_132, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_202 = paddle._C_ops.add(matmul_177, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_178 = paddle._C_ops.matmul(layer_norm_132, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_203 = paddle._C_ops.add(matmul_178, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_89 = paddle._C_ops.reshape(add_202, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_89 = paddle._C_ops.transpose(reshape_89, [0, 2, 1, 3]) + del reshape_89 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_90 = paddle._C_ops.reshape(add_203, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_90 = paddle._C_ops.transpose(reshape_90, [0, 2, 1, 3]) + del reshape_90 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_24 = paddle._C_ops.scale(transpose_88, full_6, float("0"), True) + del transpose_88 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_179 = paddle._C_ops.matmul(scale_24, transpose_89, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_204 = paddle._C_ops.add(matmul_179, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_22 = paddle._C_ops.softmax(add_204, -1) + del add_204 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_134, dropout_135 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_22, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_180 = paddle._C_ops.matmul(dropout_134, transpose_90, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_91 = paddle._C_ops.transpose(matmul_180, [0, 2, 1, 3]) + del matmul_180 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_91 = paddle._C_ops.reshape(transpose_91, full_int_array_2) + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_181 = paddle._C_ops.matmul(reshape_91, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_205 = paddle._C_ops.add(matmul_181, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_136, dropout_137 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_205, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_205 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_206 = paddle._C_ops.add(layer_norm_132, dropout_136) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_135, layer_norm_136, layer_norm_137 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_206, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_182 = paddle._C_ops.matmul(layer_norm_135, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_207 = paddle._C_ops.add(matmul_182, parameter_24) + del parameter_24 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_22 = paddle._C_ops.relu(add_207) + del add_207 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_183 = paddle._C_ops.matmul(relu_22, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_208 = paddle._C_ops.add(matmul_183, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_138, dropout_139 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_208, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_208 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_209 = paddle._C_ops.add(layer_norm_135, dropout_138) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_138, layer_norm_139, layer_norm_140 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_209, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_184 = paddle._C_ops.matmul(layer_norm_138, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_210 = paddle._C_ops.add(matmul_184, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_92 = paddle._C_ops.reshape(add_210, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_92 = paddle._C_ops.transpose(reshape_92, [0, 2, 1, 3]) + del reshape_92 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_185 = paddle._C_ops.matmul(layer_norm_138, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_211 = paddle._C_ops.add(matmul_185, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_186 = paddle._C_ops.matmul(layer_norm_138, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_212 = paddle._C_ops.add(matmul_186, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_93 = paddle._C_ops.reshape(add_211, full_int_array_1) + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_93 = paddle._C_ops.transpose(reshape_93, [0, 2, 1, 3]) + del reshape_93 + + # pd_op.reshape: (1x26x16x64xf32) <- (1x26x1024xf32, 4xi64) + reshape_94 = paddle._C_ops.reshape(add_212, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x16x26x64xf32) <- (1x26x16x64xf32) + transpose_94 = paddle._C_ops.transpose(reshape_94, [0, 2, 1, 3]) + del reshape_94 + + # pd_op.scale: (1x16x26x64xf32) <- (1x16x26x64xf32, 1xf32) + scale_25 = paddle._C_ops.scale(transpose_92, full_6, float("0"), True) + del transpose_92 + + # pd_op.matmul: (1x16x26x26xf32) <- (1x16x26x64xf32, 1x16x26x64xf32) + matmul_187 = paddle._C_ops.matmul(scale_25, transpose_93, False, True) + + # pd_op.add: (1x16x26x26xf32) <- (1x16x26x26xf32, 1x1x1x26xf32) + add_213 = paddle._C_ops.add(matmul_187, unsqueeze_0) + + # pd_op.softmax: (1x16x26x26xf32) <- (1x16x26x26xf32) + softmax_23 = paddle._C_ops.softmax(add_213, -1) + del add_213 + + # pd_op.dropout: (1x16x26x26xf32, 1x16x26x26xui8) <- (1x16x26x26xf32, None, 1xf32) + dropout_140, dropout_141 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_23, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x26x64xf32) <- (1x16x26x26xf32, 1x16x26x64xf32) + matmul_188 = paddle._C_ops.matmul(dropout_140, transpose_94, False, False) + + # pd_op.transpose: (1x26x16x64xf32) <- (1x16x26x64xf32) + transpose_95 = paddle._C_ops.transpose(matmul_188, [0, 2, 1, 3]) + del matmul_188 + + # pd_op.reshape: (1x26x1024xf32) <- (1x26x16x64xf32, 3xi64) + reshape_95 = paddle._C_ops.reshape(transpose_95, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x1024xf32, 1024x1024xf32) + matmul_189 = paddle._C_ops.matmul(reshape_95, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_214 = paddle._C_ops.add(matmul_189, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_142, dropout_143 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_214, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_214 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_215 = paddle._C_ops.add(layer_norm_138, dropout_142) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_141, layer_norm_142, layer_norm_143 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_215, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x26x3072xf32) <- (1x26x1024xf32, 1024x3072xf32) + matmul_190 = paddle._C_ops.matmul(layer_norm_141, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x26x3072xf32) <- (1x26x3072xf32, 3072xf32) + add_216 = paddle._C_ops.add(matmul_190, parameter_8) + del parameter_8 + + # pd_op.relu: (1x26x3072xf32) <- (1x26x3072xf32) + relu_23 = paddle._C_ops.relu(add_216) + del add_216 + + # pd_op.matmul: (1x26x1024xf32) <- (1x26x3072xf32, 3072x1024xf32) + matmul_191 = paddle._C_ops.matmul(relu_23, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1024xf32) + add_217 = paddle._C_ops.add(matmul_191, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x26x1024xf32, 1x26x1024xui8) <- (1x26x1024xf32, None, 1xf32) + dropout_144, dropout_145 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_217, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_217 + + # pd_op.add: (1x26x1024xf32) <- (1x26x1024xf32, 1x26x1024xf32) + add_218 = paddle._C_ops.add(layer_norm_141, dropout_144) + + # pd_op.layer_norm: (1x26x1024xf32, 1x26xf32, 1x26xf32) <- (1x26x1024xf32, 1024xf32, 1024xf32) + layer_norm_144, layer_norm_145, layer_norm_146 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_218, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x1024xf32) <- (1x26x1024xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_144, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x1024xf32) <- (1x1024xf32, 1024x1024xf32) + matmul_192 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x1024xf32) <- (1x1024xf32, 1024xf32) + add_219 = paddle._C_ops.add(matmul_192, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x1024xf32) <- (1x1024xf32) + tanh_0 = paddle._C_ops.tanh(add_219) + del ( + add_0, + add_1, + add_101, + add_102, + add_103, + add_104, + add_107, + add_11, + add_110, + add_111, + add_112, + add_113, + add_116, + add_119, + add_12, + add_120, + add_121, + add_122, + add_125, + add_128, + add_129, + add_13, + add_130, + add_131, + add_134, + add_137, + add_138, + add_139, + add_14, + add_140, + add_143, + add_146, + add_147, + add_148, + add_149, + add_152, + add_155, + add_156, + add_157, + add_158, + add_161, + add_164, + add_165, + add_166, + add_167, + add_17, + add_170, + add_173, + add_174, + add_175, + add_176, + add_179, + add_182, + add_183, + add_184, + add_185, + add_188, + add_191, + add_192, + add_193, + add_194, + add_197, + add_2, + add_20, + add_200, + add_201, + add_202, + add_203, + add_206, + add_209, + add_21, + add_210, + add_211, + add_212, + add_215, + add_218, + add_219, + add_22, + add_23, + add_26, + add_29, + add_3, + add_30, + add_31, + add_32, + add_35, + add_38, + add_39, + add_4, + add_40, + add_41, + add_44, + add_47, + add_48, + add_49, + add_5, + add_50, + add_53, + add_56, + add_57, + add_58, + add_59, + add_62, + add_65, + add_66, + add_67, + add_68, + add_71, + add_74, + add_75, + add_76, + add_77, + add_8, + add_80, + add_83, + add_84, + add_85, + add_86, + add_89, + add_92, + add_93, + add_94, + add_95, + add_98, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_15, + assign_16, + assign_17, + assign_18, + assign_19, + assign_2, + assign_20, + assign_21, + assign_22, + assign_23, + assign_24, + assign_25, + assign_26, + assign_27, + assign_28, + assign_29, + assign_3, + assign_30, + assign_31, + assign_32, + assign_33, + assign_34, + assign_35, + assign_36, + assign_37, + assign_38, + assign_39, + assign_4, + assign_40, + assign_41, + assign_42, + assign_43, + assign_44, + assign_45, + assign_46, + assign_47, + assign_48, + assign_49, + assign_5, + assign_50, + assign_51, + assign_52, + assign_53, + assign_54, + assign_55, + assign_56, + assign_57, + assign_58, + assign_59, + assign_6, + assign_60, + assign_61, + assign_62, + assign_63, + assign_64, + assign_65, + assign_66, + assign_67, + assign_68, + assign_69, + assign_7, + assign_70, + assign_71, + assign_72, + assign_73, + assign_74, + assign_75, + assign_76, + assign_77, + assign_78, + assign_79, + assign_8, + assign_80, + assign_81, + assign_82, + assign_83, + assign_84, + assign_85, + assign_86, + assign_87, + assign_88, + assign_89, + assign_9, + assign_90, + assign_91, + assign_92, + assign_93, + assign_94, + dropout_0, + dropout_1, + dropout_10, + dropout_100, + dropout_101, + dropout_102, + dropout_103, + dropout_104, + dropout_105, + dropout_106, + dropout_107, + dropout_108, + dropout_109, + dropout_11, + dropout_110, + dropout_111, + dropout_112, + dropout_113, + dropout_114, + dropout_115, + dropout_116, + dropout_117, + dropout_118, + dropout_119, + dropout_12, + dropout_120, + dropout_121, + dropout_122, + dropout_123, + dropout_124, + dropout_125, + dropout_126, + dropout_127, + dropout_128, + dropout_129, + dropout_13, + dropout_130, + dropout_131, + dropout_132, + dropout_133, + dropout_134, + dropout_135, + dropout_136, + dropout_137, + dropout_138, + dropout_139, + dropout_14, + dropout_140, + dropout_141, + dropout_142, + dropout_143, + dropout_144, + dropout_145, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_26, + dropout_27, + dropout_28, + dropout_29, + dropout_3, + dropout_30, + dropout_31, + dropout_32, + dropout_33, + dropout_34, + dropout_35, + dropout_36, + dropout_37, + dropout_38, + dropout_39, + dropout_4, + dropout_40, + dropout_41, + dropout_42, + dropout_43, + dropout_44, + dropout_45, + dropout_46, + dropout_47, + dropout_48, + dropout_49, + dropout_5, + dropout_50, + dropout_51, + dropout_52, + dropout_53, + dropout_54, + dropout_55, + dropout_56, + dropout_57, + dropout_58, + dropout_59, + dropout_6, + dropout_60, + dropout_61, + dropout_62, + dropout_63, + dropout_64, + dropout_65, + dropout_66, + dropout_67, + dropout_68, + dropout_69, + dropout_7, + dropout_70, + dropout_71, + dropout_72, + dropout_73, + dropout_74, + dropout_75, + dropout_76, + dropout_77, + dropout_78, + dropout_79, + dropout_8, + dropout_80, + dropout_81, + dropout_82, + dropout_83, + dropout_84, + dropout_85, + dropout_86, + dropout_87, + dropout_88, + dropout_89, + dropout_9, + dropout_90, + dropout_91, + dropout_92, + dropout_93, + dropout_94, + dropout_95, + dropout_96, + dropout_97, + dropout_98, + dropout_99, + embedding_0, + embedding_1, + embedding_2, + embedding_3, + full_5, + full_6, + full_int_array_3, + full_int_array_4, + layer_norm_1, + layer_norm_10, + layer_norm_100, + layer_norm_101, + layer_norm_102, + layer_norm_103, + layer_norm_104, + layer_norm_105, + layer_norm_106, + layer_norm_107, + layer_norm_108, + layer_norm_109, + layer_norm_11, + layer_norm_110, + layer_norm_111, + layer_norm_112, + layer_norm_113, + layer_norm_114, + layer_norm_115, + layer_norm_116, + layer_norm_117, + layer_norm_118, + layer_norm_119, + layer_norm_12, + layer_norm_120, + layer_norm_121, + layer_norm_122, + layer_norm_123, + layer_norm_124, + layer_norm_125, + layer_norm_126, + layer_norm_127, + layer_norm_128, + layer_norm_129, + layer_norm_13, + layer_norm_130, + layer_norm_131, + layer_norm_132, + layer_norm_133, + layer_norm_134, + layer_norm_135, + layer_norm_136, + layer_norm_137, + layer_norm_138, + layer_norm_139, + layer_norm_14, + layer_norm_140, + layer_norm_141, + layer_norm_142, + layer_norm_143, + layer_norm_144, + layer_norm_145, + layer_norm_146, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_27, + layer_norm_28, + layer_norm_29, + layer_norm_3, + layer_norm_30, + layer_norm_31, + layer_norm_32, + layer_norm_33, + layer_norm_34, + layer_norm_35, + layer_norm_36, + layer_norm_37, + layer_norm_38, + layer_norm_39, + layer_norm_4, + layer_norm_40, + layer_norm_41, + layer_norm_42, + layer_norm_43, + layer_norm_44, + layer_norm_45, + layer_norm_46, + layer_norm_47, + layer_norm_48, + layer_norm_49, + layer_norm_5, + layer_norm_50, + layer_norm_51, + layer_norm_52, + layer_norm_53, + layer_norm_54, + layer_norm_55, + layer_norm_56, + layer_norm_57, + layer_norm_58, + layer_norm_59, + layer_norm_6, + layer_norm_60, + layer_norm_61, + layer_norm_62, + layer_norm_63, + layer_norm_64, + layer_norm_65, + layer_norm_66, + layer_norm_67, + layer_norm_68, + layer_norm_69, + layer_norm_7, + layer_norm_70, + layer_norm_71, + layer_norm_72, + layer_norm_73, + layer_norm_74, + layer_norm_75, + layer_norm_76, + layer_norm_77, + layer_norm_78, + layer_norm_79, + layer_norm_8, + layer_norm_80, + layer_norm_81, + layer_norm_82, + layer_norm_83, + layer_norm_84, + layer_norm_85, + layer_norm_86, + layer_norm_87, + layer_norm_88, + layer_norm_89, + layer_norm_9, + layer_norm_90, + layer_norm_91, + layer_norm_92, + layer_norm_93, + layer_norm_94, + layer_norm_95, + layer_norm_96, + layer_norm_97, + layer_norm_98, + layer_norm_99, + matmul_0, + matmul_1, + matmul_10, + matmul_101, + matmul_102, + matmul_103, + matmul_104, + matmul_105, + matmul_106, + matmul_107, + matmul_109, + matmul_11, + matmul_110, + matmul_111, + matmul_112, + matmul_113, + matmul_114, + matmul_115, + matmul_117, + matmul_118, + matmul_119, + matmul_120, + matmul_121, + matmul_122, + matmul_123, + matmul_125, + matmul_126, + matmul_127, + matmul_128, + matmul_129, + matmul_13, + matmul_130, + matmul_131, + matmul_133, + matmul_134, + matmul_135, + matmul_136, + matmul_137, + matmul_138, + matmul_139, + matmul_14, + matmul_141, + matmul_142, + matmul_143, + matmul_144, + matmul_145, + matmul_146, + matmul_147, + matmul_149, + matmul_15, + matmul_150, + matmul_151, + matmul_152, + matmul_153, + matmul_154, + matmul_155, + matmul_157, + matmul_158, + matmul_159, + matmul_16, + matmul_160, + matmul_161, + matmul_162, + matmul_163, + matmul_165, + matmul_166, + matmul_167, + matmul_168, + matmul_169, + matmul_17, + matmul_170, + matmul_171, + matmul_173, + matmul_174, + matmul_175, + matmul_176, + matmul_177, + matmul_178, + matmul_179, + matmul_18, + matmul_181, + matmul_182, + matmul_183, + matmul_184, + matmul_185, + matmul_186, + matmul_187, + matmul_189, + matmul_19, + matmul_190, + matmul_191, + matmul_192, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_33, + matmul_34, + matmul_35, + matmul_37, + matmul_38, + matmul_39, + matmul_40, + matmul_41, + matmul_42, + matmul_43, + matmul_45, + matmul_46, + matmul_47, + matmul_48, + matmul_49, + matmul_5, + matmul_50, + matmul_51, + matmul_53, + matmul_54, + matmul_55, + matmul_56, + matmul_57, + matmul_58, + matmul_59, + matmul_6, + matmul_61, + matmul_62, + matmul_63, + matmul_64, + matmul_65, + matmul_66, + matmul_67, + matmul_69, + matmul_7, + matmul_70, + matmul_71, + matmul_72, + matmul_73, + matmul_74, + matmul_75, + matmul_77, + matmul_78, + matmul_79, + matmul_8, + matmul_80, + matmul_81, + matmul_82, + matmul_83, + matmul_85, + matmul_86, + matmul_87, + matmul_88, + matmul_89, + matmul_9, + matmul_90, + matmul_91, + matmul_93, + matmul_94, + matmul_95, + matmul_96, + matmul_97, + matmul_98, + matmul_99, + relu_0, + relu_1, + relu_10, + relu_11, + relu_12, + relu_13, + relu_14, + relu_15, + relu_16, + relu_17, + relu_18, + relu_19, + relu_2, + relu_20, + relu_21, + relu_22, + relu_23, + relu_3, + relu_4, + relu_5, + relu_6, + relu_7, + relu_8, + relu_9, + reshape_11, + reshape_15, + reshape_19, + reshape_23, + reshape_27, + reshape_3, + reshape_31, + reshape_35, + reshape_39, + reshape_43, + reshape_47, + reshape_51, + reshape_55, + reshape_59, + reshape_63, + reshape_67, + reshape_7, + reshape_71, + reshape_75, + reshape_79, + reshape_83, + reshape_87, + reshape_91, + reshape_95, + scale_1, + scale_10, + scale_11, + scale_12, + scale_13, + scale_14, + scale_15, + scale_16, + scale_17, + scale_18, + scale_19, + scale_2, + scale_20, + scale_21, + scale_22, + scale_23, + scale_24, + scale_25, + scale_3, + scale_4, + scale_5, + scale_6, + scale_7, + scale_8, + scale_9, + slice_0, + softmax_0, + softmax_1, + softmax_10, + softmax_11, + softmax_12, + softmax_13, + softmax_14, + softmax_15, + softmax_16, + softmax_17, + softmax_18, + softmax_19, + softmax_2, + softmax_20, + softmax_21, + softmax_22, + softmax_23, + softmax_3, + softmax_4, + softmax_5, + softmax_6, + softmax_7, + softmax_8, + softmax_9, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_17, + transpose_18, + transpose_19, + transpose_2, + transpose_21, + transpose_22, + transpose_23, + transpose_25, + transpose_26, + transpose_27, + transpose_29, + transpose_3, + transpose_30, + transpose_31, + transpose_33, + transpose_34, + transpose_35, + transpose_37, + transpose_38, + transpose_39, + transpose_41, + transpose_42, + transpose_43, + transpose_45, + transpose_46, + transpose_47, + transpose_49, + transpose_5, + transpose_50, + transpose_51, + transpose_53, + transpose_54, + transpose_55, + transpose_57, + transpose_58, + transpose_59, + transpose_6, + transpose_61, + transpose_62, + transpose_63, + transpose_65, + transpose_66, + transpose_67, + transpose_69, + transpose_7, + transpose_70, + transpose_71, + transpose_73, + transpose_74, + transpose_75, + transpose_77, + transpose_78, + transpose_79, + transpose_81, + transpose_82, + transpose_83, + transpose_85, + transpose_86, + transpose_87, + transpose_89, + transpose_9, + transpose_90, + transpose_91, + transpose_93, + transpose_94, + transpose_95, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/utc-large/weight_meta.py b/paddle_samples/PaddleNLP/utc-large/weight_meta.py new file mode 100644 index 0000000000..f9cadfb489 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-large/weight_meta.py @@ -0,0 +1,4306 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [1024] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.0399998") + max_val = float("0.0399998") + mean = float("8.68877e-06") + std = float("0.0175972") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [1024] + dtype = "float32" + min_val = float("-0.256506") + max_val = float("0.253649") + mean = float("0.00899065") + std = float("0.0727925") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [1024] + dtype = "float32" + min_val = float("0.712868") + max_val = float("1.59163") + mean = float("0.991699") + std = float("0.0440881") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [1024] + dtype = "float32" + min_val = float("-0.531238") + max_val = float("0.757281") + mean = float("0.00832861") + std = float("0.156349") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [1024] + dtype = "float32" + min_val = float("0.447839") + max_val = float("1.40587") + mean = float("1.00126") + std = float("0.0422786") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [1024] + dtype = "float32" + min_val = float("-0.149872") + max_val = float("0.209696") + mean = float("0.000244329") + std = float("0.041173") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.489997") + max_val = float("0.783555") + mean = float("2.69915e-06") + std = float("0.0274907") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [3072] + dtype = "float32" + min_val = float("-0.480429") + max_val = float("0.518483") + mean = float("-0.0959499") + std = float("0.0522693") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.508755") + max_val = float("0.431364") + mean = float("1.98041e-05") + std = float("0.0324842") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [1024] + dtype = "float32" + min_val = float("-0.203547") + max_val = float("0.234372") + mean = float("0.000112087") + std = float("0.0416364") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.177663") + max_val = float("0.171356") + mean = float("-2.44012e-06") + std = float("0.0339304") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [1024] + dtype = "float32" + min_val = float("-0.0927633") + max_val = float("0.121643") + mean = float("2.14909e-05") + std = float("0.0205101") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.187578") + max_val = float("0.186112") + mean = float("-3.88112e-05") + std = float("0.035882") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [1024] + dtype = "float32" + min_val = float("-101.392") + max_val = float("104.227") + mean = float("1.09804") + std = float("32.8375") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.458621") + max_val = float("0.441239") + mean = float("2.39446e-05") + std = float("0.0396908") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [1024] + dtype = "float32" + min_val = float("-1.25096") + max_val = float("1.32017") + mean = float("0.0157629") + std = float("0.293714") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-1.34382") + max_val = float("1.35362") + mean = float("0.0001463") + std = float("0.0570911") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [1024] + dtype = "float32" + min_val = float("-0.92704") + max_val = float("0.251639") + mean = float("0.0316097") + std = float("0.0502503") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [1024] + dtype = "float32" + min_val = float("0.18595") + max_val = float("1.3347") + mean = float("0.951096") + std = float("0.0405194") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [1024] + dtype = "float32" + min_val = float("-0.49776") + max_val = float("1.33404") + mean = float("0.0155243") + std = float("0.106903") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [1024] + dtype = "float32" + min_val = float("0.783923") + max_val = float("3.71836") + mean = float("0.953389") + std = float("0.0891423") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [1024] + dtype = "float32" + min_val = float("-0.0793206") + max_val = float("0.483342") + mean = float("0.000196864") + std = float("0.031417") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-1.02188") + max_val = float("3.44778") + mean = float("3.88131e-07") + std = float("0.0328247") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [3072] + dtype = "float32" + min_val = float("-0.961136") + max_val = float("0.530325") + mean = float("-0.107403") + std = float("0.0548988") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.314021") + max_val = float("0.356264") + mean = float("2.04123e-05") + std = float("0.0343612") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [1024] + dtype = "float32" + min_val = float("-0.154093") + max_val = float("0.197221") + mean = float("-0.000574548") + std = float("0.0449435") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.227369") + max_val = float("0.185058") + mean = float("-1.22313e-06") + std = float("0.0327769") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [1024] + dtype = "float32" + min_val = float("-0.317023") + max_val = float("0.426135") + mean = float("0.000714719") + std = float("0.0496698") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.197659") + max_val = float("0.19739") + mean = float("-9.49788e-06") + std = float("0.0360291") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [1024] + dtype = "float32" + min_val = float("-114.681") + max_val = float("132.822") + mean = float("-1.27004") + std = float("34.4281") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.594027") + max_val = float("0.789014") + mean = float("-1.54016e-05") + std = float("0.0389066") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [1024] + dtype = "float32" + min_val = float("-0.820461") + max_val = float("0.807319") + mean = float("-0.000687207") + std = float("0.185195") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.355582") + max_val = float("0.343893") + mean = float("8.74063e-06") + std = float("0.0385612") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [1024] + dtype = "float32" + min_val = float("-0.939664") + max_val = float("0.475678") + mean = float("0.0306739") + std = float("0.057567") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [1024] + dtype = "float32" + min_val = float("0.351417") + max_val = float("1.17688") + mean = float("0.856126") + std = float("0.0294274") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [1024] + dtype = "float32" + min_val = float("-0.688187") + max_val = float("2.02775") + mean = float("0.0142883") + std = float("0.121521") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [1024] + dtype = "float32" + min_val = float("0.775434") + max_val = float("3.04579") + mean = float("0.94444") + std = float("0.0717606") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [1024] + dtype = "float32" + min_val = float("-0.334094") + max_val = float("0.161222") + mean = float("-0.000525818") + std = float("0.0639111") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.463523") + max_val = float("11.7088") + mean = float("1.00099e-06") + std = float("0.0368334") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [3072] + dtype = "float32" + min_val = float("-0.762178") + max_val = float("0.635909") + mean = float("-0.108085") + std = float("0.0526762") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-1.17341") + max_val = float("0.883269") + mean = float("8.73733e-05") + std = float("0.037095") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [1024] + dtype = "float32" + min_val = float("-0.357007") + max_val = float("0.280999") + mean = float("6.2737e-05") + std = float("0.0740641") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.186014") + max_val = float("0.170665") + mean = float("-5.04089e-06") + std = float("0.0324992") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [1024] + dtype = "float32" + min_val = float("-0.615173") + max_val = float("0.233155") + mean = float("-0.00199429") + std = float("0.0465309") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.220643") + max_val = float("0.227095") + mean = float("-4.33208e-05") + std = float("0.0355809") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [1024] + dtype = "float32" + min_val = float("-116.814") + max_val = float("131.876") + mean = float("-0.300993") + std = float("37.0714") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.491821") + max_val = float("0.459528") + mean = float("1.06332e-05") + std = float("0.0388688") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [1024] + dtype = "float32" + min_val = float("-0.826495") + max_val = float("0.74473") + mean = float("-0.00537592") + std = float("0.189987") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.349877") + max_val = float("0.364663") + mean = float("-9.3456e-05") + std = float("0.0392678") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [1024] + dtype = "float32" + min_val = float("-0.6453") + max_val = float("0.493355") + mean = float("0.0310157") + std = float("0.0515732") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [1024] + dtype = "float32" + min_val = float("0.32673") + max_val = float("1.12632") + mean = float("0.831048") + std = float("0.0298671") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [1024] + dtype = "float32" + min_val = float("-0.514739") + max_val = float("2.50111") + mean = float("0.0138953") + std = float("0.125394") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [1024] + dtype = "float32" + min_val = float("0.822808") + max_val = float("3.15292") + mean = float("0.93602") + std = float("0.0783587") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [1024] + dtype = "float32" + min_val = float("-0.247413") + max_val = float("0.221528") + mean = float("-0.00025189") + std = float("0.0826995") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.340775") + max_val = float("9.59018") + mean = float("5.04594e-06") + std = float("0.0402561") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [3072] + dtype = "float32" + min_val = float("-0.51657") + max_val = float("0.479227") + mean = float("-0.11117") + std = float("0.0548093") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.832333") + max_val = float("0.623431") + mean = float("8.64393e-05") + std = float("0.0400982") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [1024] + dtype = "float32" + min_val = float("-0.0847723") + max_val = float("0.0748818") + mean = float("0.000201557") + std = float("0.0215591") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.24998") + max_val = float("0.285022") + mean = float("-3.13246e-06") + std = float("0.0348497") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [1024] + dtype = "float32" + min_val = float("-0.052044") + max_val = float("0.0476641") + mean = float("-0.000289249") + std = float("0.0154729") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.212692") + max_val = float("0.199226") + mean = float("8.33902e-05") + std = float("0.0383704") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [1024] + dtype = "float32" + min_val = float("-97.8228") + max_val = float("105.194") + mean = float("0.250084") + std = float("22.2573") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.323862") + max_val = float("0.353618") + mean = float("2.9396e-05") + std = float("0.0398721") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [1024] + dtype = "float32" + min_val = float("-0.933782") + max_val = float("1.04979") + mean = float("0.00182188") + std = float("0.199998") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.395542") + max_val = float("0.366348") + mean = float("9.19524e-05") + std = float("0.0403437") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [1024] + dtype = "float32" + min_val = float("-0.605844") + max_val = float("0.402482") + mean = float("0.0282362") + std = float("0.0431253") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [1024] + dtype = "float32" + min_val = float("0.317898") + max_val = float("1.13589") + mean = float("0.83007") + std = float("0.0310948") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [1024] + dtype = "float32" + min_val = float("-0.537132") + max_val = float("2.89066") + mean = float("0.0109482") + std = float("0.157041") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [1024] + dtype = "float32" + min_val = float("0.832432") + max_val = float("3.60562") + mean = float("0.914498") + std = float("0.0949083") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [1024] + dtype = "float32" + min_val = float("-0.876172") + max_val = float("0.274395") + mean = float("0.00078501") + std = float("0.103017") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.527782") + max_val = float("9.77615") + mean = float("-1.02586e-05") + std = float("0.0420445") + data = None + + +class Program_weight_tensor_parameter_72: + name = "parameter_72" + shape = [3072] + dtype = "float32" + min_val = float("-0.33473") + max_val = float("0.464831") + mean = float("-0.118039") + std = float("0.0611599") + data = None + + +class Program_weight_tensor_parameter_73: + name = "parameter_73" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.646091") + max_val = float("0.50757") + mean = float("0.000139969") + std = float("0.0421758") + data = None + + +class Program_weight_tensor_parameter_74: + name = "parameter_74" + shape = [1024] + dtype = "float32" + min_val = float("-0.27059") + max_val = float("0.175835") + mean = float("0.00104628") + std = float("0.0488274") + data = None + + +class Program_weight_tensor_parameter_75: + name = "parameter_75" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.160108") + max_val = float("0.183412") + mean = float("-6.65966e-06") + std = float("0.0313813") + data = None + + +class Program_weight_tensor_parameter_76: + name = "parameter_76" + shape = [1024] + dtype = "float32" + min_val = float("-0.39612") + max_val = float("0.180893") + mean = float("-0.00132437") + std = float("0.0346535") + data = None + + +class Program_weight_tensor_parameter_77: + name = "parameter_77" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.173578") + max_val = float("0.17358") + mean = float("-7.61109e-05") + std = float("0.0341808") + data = None + + +class Program_weight_tensor_parameter_78: + name = "parameter_78" + shape = [1024] + dtype = "float32" + min_val = float("-120.37") + max_val = float("112.11") + mean = float("-0.0918769") + std = float("27.1924") + data = None + + +class Program_weight_tensor_parameter_79: + name = "parameter_79" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.372253") + max_val = float("0.373838") + mean = float("1.79611e-05") + std = float("0.0402669") + data = None + + +class Program_weight_tensor_parameter_80: + name = "parameter_80" + shape = [1024] + dtype = "float32" + min_val = float("-1.06998") + max_val = float("0.873947") + mean = float("-0.0076689") + std = float("0.202335") + data = None + + +class Program_weight_tensor_parameter_81: + name = "parameter_81" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.332408") + max_val = float("0.311987") + mean = float("-9.5367e-05") + std = float("0.0407043") + data = None + + +class Program_weight_tensor_parameter_82: + name = "parameter_82" + shape = [1024] + dtype = "float32" + min_val = float("-0.542002") + max_val = float("0.931399") + mean = float("0.0322379") + std = float("0.0646104") + data = None + + +class Program_weight_tensor_parameter_83: + name = "parameter_83" + shape = [1024] + dtype = "float32" + min_val = float("0.296532") + max_val = float("1.12498") + mean = float("0.821768") + std = float("0.0341598") + data = None + + +class Program_weight_tensor_parameter_84: + name = "parameter_84" + shape = [1024] + dtype = "float32" + min_val = float("-0.457177") + max_val = float("3.12446") + mean = float("0.0174798") + std = float("0.167321") + data = None + + +class Program_weight_tensor_parameter_85: + name = "parameter_85" + shape = [1024] + dtype = "float32" + min_val = float("0.840719") + max_val = float("2.89587") + mean = float("0.930641") + std = float("0.084718") + data = None + + +class Program_weight_tensor_parameter_86: + name = "parameter_86" + shape = [1024] + dtype = "float32" + min_val = float("-0.68468") + max_val = float("0.33049") + mean = float("0.000329759") + std = float("0.115676") + data = None + + +class Program_weight_tensor_parameter_87: + name = "parameter_87" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.324425") + max_val = float("8.31936") + mean = float("-5.41647e-06") + std = float("0.0435891") + data = None + + +class Program_weight_tensor_parameter_88: + name = "parameter_88" + shape = [3072] + dtype = "float32" + min_val = float("-0.601107") + max_val = float("0.327914") + mean = float("-0.117384") + std = float("0.0615914") + data = None + + +class Program_weight_tensor_parameter_89: + name = "parameter_89" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.889477") + max_val = float("0.926181") + mean = float("-8.41497e-05") + std = float("0.0443689") + data = None + + +class Program_weight_tensor_parameter_90: + name = "parameter_90" + shape = [1024] + dtype = "float32" + min_val = float("-0.1916") + max_val = float("0.130567") + mean = float("0.000406013") + std = float("0.0413362") + data = None + + +class Program_weight_tensor_parameter_91: + name = "parameter_91" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.184642") + max_val = float("0.163168") + mean = float("1.86529e-07") + std = float("0.0315125") + data = None + + +class Program_weight_tensor_parameter_92: + name = "parameter_92" + shape = [1024] + dtype = "float32" + min_val = float("-0.116997") + max_val = float("0.0728538") + mean = float("-7.34495e-05") + std = float("0.0186736") + data = None + + +class Program_weight_tensor_parameter_93: + name = "parameter_93" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.181015") + max_val = float("0.193082") + mean = float("2.29897e-05") + std = float("0.034074") + data = None + + +class Program_weight_tensor_parameter_94: + name = "parameter_94" + shape = [1024] + dtype = "float32" + min_val = float("-131.023") + max_val = float("107.263") + mean = float("-1.43169") + std = float("36.6539") + data = None + + +class Program_weight_tensor_parameter_95: + name = "parameter_95" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.400135") + max_val = float("0.45673") + mean = float("-5.88481e-05") + std = float("0.0396823") + data = None + + +class Program_weight_tensor_parameter_96: + name = "parameter_96" + shape = [1024] + dtype = "float32" + min_val = float("-1.93699") + max_val = float("2.09625") + mean = float("0.0100028") + std = float("0.284353") + data = None + + +class Program_weight_tensor_parameter_97: + name = "parameter_97" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-1.22943") + max_val = float("1.31247") + mean = float("4.1985e-05") + std = float("0.0508941") + data = None + + +class Program_weight_tensor_parameter_98: + name = "parameter_98" + shape = [1024] + dtype = "float32" + min_val = float("-0.278468") + max_val = float("0.884639") + mean = float("0.0320083") + std = float("0.0583522") + data = None + + +class Program_weight_tensor_parameter_99: + name = "parameter_99" + shape = [1024] + dtype = "float32" + min_val = float("0.285529") + max_val = float("1.10749") + mean = float("0.845807") + std = float("0.0299488") + data = None + + +class Program_weight_tensor_parameter_100: + name = "parameter_100" + shape = [1024] + dtype = "float32" + min_val = float("-0.993221") + max_val = float("2.77451") + mean = float("0.0162577") + std = float("0.169836") + data = None + + +class Program_weight_tensor_parameter_101: + name = "parameter_101" + shape = [1024] + dtype = "float32" + min_val = float("0.791543") + max_val = float("3.19234") + mean = float("0.913221") + std = float("0.101447") + data = None + + +class Program_weight_tensor_parameter_102: + name = "parameter_102" + shape = [1024] + dtype = "float32" + min_val = float("-1.80392") + max_val = float("0.375284") + mean = float("4.79061e-06") + std = float("0.127222") + data = None + + +class Program_weight_tensor_parameter_103: + name = "parameter_103" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.919148") + max_val = float("2.29775") + mean = float("-2.89261e-08") + std = float("0.0415365") + data = None + + +class Program_weight_tensor_parameter_104: + name = "parameter_104" + shape = [3072] + dtype = "float32" + min_val = float("-0.467576") + max_val = float("0.291616") + mean = float("-0.111122") + std = float("0.0584575") + data = None + + +class Program_weight_tensor_parameter_105: + name = "parameter_105" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.472305") + max_val = float("0.322311") + mean = float("-0.00013404") + std = float("0.0425094") + data = None + + +class Program_weight_tensor_parameter_106: + name = "parameter_106" + shape = [1024] + dtype = "float32" + min_val = float("-0.305707") + max_val = float("0.293404") + mean = float("0.000574676") + std = float("0.0604681") + data = None + + +class Program_weight_tensor_parameter_107: + name = "parameter_107" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.224886") + max_val = float("0.230854") + mean = float("1.02898e-05") + std = float("0.0302805") + data = None + + +class Program_weight_tensor_parameter_108: + name = "parameter_108" + shape = [1024] + dtype = "float32" + min_val = float("-0.172979") + max_val = float("0.289302") + mean = float("0.00123064") + std = float("0.0343024") + data = None + + +class Program_weight_tensor_parameter_109: + name = "parameter_109" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.178275") + max_val = float("0.190844") + mean = float("4.72238e-05") + std = float("0.0322086") + data = None + + +class Program_weight_tensor_parameter_110: + name = "parameter_110" + shape = [1024] + dtype = "float32" + min_val = float("-127.547") + max_val = float("140.559") + mean = float("-0.286341") + std = float("43.3056") + data = None + + +class Program_weight_tensor_parameter_111: + name = "parameter_111" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.376737") + max_val = float("0.458559") + mean = float("-1.52149e-05") + std = float("0.0404869") + data = None + + +class Program_weight_tensor_parameter_112: + name = "parameter_112" + shape = [1024] + dtype = "float32" + min_val = float("-0.929703") + max_val = float("0.790992") + mean = float("-0.00343773") + std = float("0.200032") + data = None + + +class Program_weight_tensor_parameter_113: + name = "parameter_113" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.336967") + max_val = float("0.330995") + mean = float("-2.38744e-05") + std = float("0.0426982") + data = None + + +class Program_weight_tensor_parameter_114: + name = "parameter_114" + shape = [1024] + dtype = "float32" + min_val = float("-0.867253") + max_val = float("0.846889") + mean = float("0.0344625") + std = float("0.0677235") + data = None + + +class Program_weight_tensor_parameter_115: + name = "parameter_115" + shape = [1024] + dtype = "float32" + min_val = float("0.352619") + max_val = float("1.0673") + mean = float("0.818715") + std = float("0.0311646") + data = None + + +class Program_weight_tensor_parameter_116: + name = "parameter_116" + shape = [1024] + dtype = "float32" + min_val = float("-1.25286") + max_val = float("2.65215") + mean = float("0.0187314") + std = float("0.171896") + data = None + + +class Program_weight_tensor_parameter_117: + name = "parameter_117" + shape = [1024] + dtype = "float32" + min_val = float("0.733411") + max_val = float("2.73759") + mean = float("0.89812") + std = float("0.117605") + data = None + + +class Program_weight_tensor_parameter_118: + name = "parameter_118" + shape = [1024] + dtype = "float32" + min_val = float("-2.69978") + max_val = float("0.702314") + mean = float("-0.00032361") + std = float("0.161905") + data = None + + +class Program_weight_tensor_parameter_119: + name = "parameter_119" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.432742") + max_val = float("4.53721") + mean = float("4.28267e-06") + std = float("0.0399124") + data = None + + +class Program_weight_tensor_parameter_120: + name = "parameter_120" + shape = [3072] + dtype = "float32" + min_val = float("-0.521763") + max_val = float("0.421466") + mean = float("-0.105444") + std = float("0.0658271") + data = None + + +class Program_weight_tensor_parameter_121: + name = "parameter_121" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.43709") + max_val = float("0.353538") + mean = float("-0.000152517") + std = float("0.0405134") + data = None + + +class Program_weight_tensor_parameter_122: + name = "parameter_122" + shape = [1024] + dtype = "float32" + min_val = float("-0.199") + max_val = float("0.25883") + mean = float("0.000299482") + std = float("0.0596262") + data = None + + +class Program_weight_tensor_parameter_123: + name = "parameter_123" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.317888") + max_val = float("0.253196") + mean = float("-8.95203e-06") + std = float("0.0320046") + data = None + + +class Program_weight_tensor_parameter_124: + name = "parameter_124" + shape = [1024] + dtype = "float32" + min_val = float("-0.152513") + max_val = float("0.181412") + mean = float("-0.000452342") + std = float("0.0273504") + data = None + + +class Program_weight_tensor_parameter_125: + name = "parameter_125" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.204415") + max_val = float("0.188626") + mean = float("-4.19358e-05") + std = float("0.0336447") + data = None + + +class Program_weight_tensor_parameter_126: + name = "parameter_126" + shape = [1024] + dtype = "float32" + min_val = float("-121.623") + max_val = float("119.082") + mean = float("1.90379") + std = float("39.0409") + data = None + + +class Program_weight_tensor_parameter_127: + name = "parameter_127" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.391908") + max_val = float("0.418676") + mean = float("0.000129927") + std = float("0.0404239") + data = None + + +class Program_weight_tensor_parameter_128: + name = "parameter_128" + shape = [1024] + dtype = "float32" + min_val = float("-0.902927") + max_val = float("1.00167") + mean = float("0.001643") + std = float("0.18763") + data = None + + +class Program_weight_tensor_parameter_129: + name = "parameter_129" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.284817") + max_val = float("0.278145") + mean = float("3.01961e-05") + std = float("0.0424874") + data = None + + +class Program_weight_tensor_parameter_130: + name = "parameter_130" + shape = [1024] + dtype = "float32" + min_val = float("-0.918519") + max_val = float("0.550648") + mean = float("0.0310743") + std = float("0.0586837") + data = None + + +class Program_weight_tensor_parameter_131: + name = "parameter_131" + shape = [1024] + dtype = "float32" + min_val = float("0.376512") + max_val = float("0.995968") + mean = float("0.796721") + std = float("0.0366931") + data = None + + +class Program_weight_tensor_parameter_132: + name = "parameter_132" + shape = [1024] + dtype = "float32" + min_val = float("-1.21496") + max_val = float("2.77707") + mean = float("0.0203447") + std = float("0.167739") + data = None + + +class Program_weight_tensor_parameter_133: + name = "parameter_133" + shape = [1024] + dtype = "float32" + min_val = float("0.496399") + max_val = float("3.05578") + mean = float("0.897001") + std = float("0.128991") + data = None + + +class Program_weight_tensor_parameter_134: + name = "parameter_134" + shape = [1024] + dtype = "float32" + min_val = float("-2.22335") + max_val = float("0.85102") + mean = float("0.000201625") + std = float("0.172516") + data = None + + +class Program_weight_tensor_parameter_135: + name = "parameter_135" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.816313") + max_val = float("10.2593") + mean = float("1.34185e-05") + std = float("0.038123") + data = None + + +class Program_weight_tensor_parameter_136: + name = "parameter_136" + shape = [3072] + dtype = "float32" + min_val = float("-0.522565") + max_val = float("0.434918") + mean = float("-0.099492") + std = float("0.0641287") + data = None + + +class Program_weight_tensor_parameter_137: + name = "parameter_137" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.510587") + max_val = float("0.932305") + mean = float("-0.000151125") + std = float("0.0382981") + data = None + + +class Program_weight_tensor_parameter_138: + name = "parameter_138" + shape = [1024] + dtype = "float32" + min_val = float("-0.382521") + max_val = float("0.283445") + mean = float("0.00043777") + std = float("0.0645412") + data = None + + +class Program_weight_tensor_parameter_139: + name = "parameter_139" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.256931") + max_val = float("0.252075") + mean = float("-1.38745e-05") + std = float("0.0311232") + data = None + + +class Program_weight_tensor_parameter_140: + name = "parameter_140" + shape = [1024] + dtype = "float32" + min_val = float("-0.210733") + max_val = float("0.200841") + mean = float("0.000199608") + std = float("0.0260896") + data = None + + +class Program_weight_tensor_parameter_141: + name = "parameter_141" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.208357") + max_val = float("0.184906") + mean = float("-4.30388e-06") + std = float("0.0331866") + data = None + + +class Program_weight_tensor_parameter_142: + name = "parameter_142" + shape = [1024] + dtype = "float32" + min_val = float("-123.908") + max_val = float("135.823") + mean = float("-0.652946") + std = float("39.1671") + data = None + + +class Program_weight_tensor_parameter_143: + name = "parameter_143" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.374401") + max_val = float("0.356399") + mean = float("1.96104e-07") + std = float("0.0406505") + data = None + + +class Program_weight_tensor_parameter_144: + name = "parameter_144" + shape = [1024] + dtype = "float32" + min_val = float("-0.899303") + max_val = float("0.985139") + mean = float("-0.00191543") + std = float("0.175663") + data = None + + +class Program_weight_tensor_parameter_145: + name = "parameter_145" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.343765") + max_val = float("0.3681") + mean = float("-3.05119e-05") + std = float("0.0422843") + data = None + + +class Program_weight_tensor_parameter_146: + name = "parameter_146" + shape = [1024] + dtype = "float32" + min_val = float("-0.439545") + max_val = float("0.77601") + mean = float("0.0352331") + std = float("0.065657") + data = None + + +class Program_weight_tensor_parameter_147: + name = "parameter_147" + shape = [1024] + dtype = "float32" + min_val = float("0.0902309") + max_val = float("1.04936") + mean = float("0.798599") + std = float("0.0463758") + data = None + + +class Program_weight_tensor_parameter_148: + name = "parameter_148" + shape = [1024] + dtype = "float32" + min_val = float("-1.5028") + max_val = float("3.27342") + mean = float("0.0144176") + std = float("0.197999") + data = None + + +class Program_weight_tensor_parameter_149: + name = "parameter_149" + shape = [1024] + dtype = "float32" + min_val = float("0.625404") + max_val = float("3.01705") + mean = float("0.896459") + std = float("0.125829") + data = None + + +class Program_weight_tensor_parameter_150: + name = "parameter_150" + shape = [1024] + dtype = "float32" + min_val = float("-1.6165") + max_val = float("0.93017") + mean = float("1.06776e-06") + std = float("0.153363") + data = None + + +class Program_weight_tensor_parameter_151: + name = "parameter_151" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-1.02025") + max_val = float("11.4295") + mean = float("2.37976e-05") + std = float("0.0381601") + data = None + + +class Program_weight_tensor_parameter_152: + name = "parameter_152" + shape = [3072] + dtype = "float32" + min_val = float("-0.540893") + max_val = float("0.210961") + mean = float("-0.0966911") + std = float("0.0634261") + data = None + + +class Program_weight_tensor_parameter_153: + name = "parameter_153" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.746763") + max_val = float("0.891061") + mean = float("-2.61631e-06") + std = float("0.0382511") + data = None + + +class Program_weight_tensor_parameter_154: + name = "parameter_154" + shape = [1024] + dtype = "float32" + min_val = float("-0.387763") + max_val = float("0.20534") + mean = float("0.000721074") + std = float("0.0586633") + data = None + + +class Program_weight_tensor_parameter_155: + name = "parameter_155" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.206834") + max_val = float("0.214265") + mean = float("-1.18879e-05") + std = float("0.0301784") + data = None + + +class Program_weight_tensor_parameter_156: + name = "parameter_156" + shape = [1024] + dtype = "float32" + min_val = float("-0.27606") + max_val = float("0.234023") + mean = float("-0.00053972") + std = float("0.02613") + data = None + + +class Program_weight_tensor_parameter_157: + name = "parameter_157" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.180364") + max_val = float("0.204128") + mean = float("-1.03283e-05") + std = float("0.0318398") + data = None + + +class Program_weight_tensor_parameter_158: + name = "parameter_158" + shape = [1024] + dtype = "float32" + min_val = float("-97.7678") + max_val = float("86.7741") + mean = float("0.622473") + std = float("19.1563") + data = None + + +class Program_weight_tensor_parameter_159: + name = "parameter_159" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.360995") + max_val = float("0.372451") + mean = float("8.18708e-06") + std = float("0.0411868") + data = None + + +class Program_weight_tensor_parameter_160: + name = "parameter_160" + shape = [1024] + dtype = "float32" + min_val = float("-0.97282") + max_val = float("0.966735") + mean = float("-0.000550465") + std = float("0.150002") + data = None + + +class Program_weight_tensor_parameter_161: + name = "parameter_161" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.329137") + max_val = float("0.321083") + mean = float("2.60601e-05") + std = float("0.0414863") + data = None + + +class Program_weight_tensor_parameter_162: + name = "parameter_162" + shape = [1024] + dtype = "float32" + min_val = float("-0.494129") + max_val = float("0.628203") + mean = float("0.0301649") + std = float("0.0736425") + data = None + + +class Program_weight_tensor_parameter_163: + name = "parameter_163" + shape = [1024] + dtype = "float32" + min_val = float("0.110627") + max_val = float("0.998528") + mean = float("0.821229") + std = float("0.0523675") + data = None + + +class Program_weight_tensor_parameter_164: + name = "parameter_164" + shape = [1024] + dtype = "float32" + min_val = float("-1.42636") + max_val = float("3.02788") + mean = float("0.0141976") + std = float("0.194228") + data = None + + +class Program_weight_tensor_parameter_165: + name = "parameter_165" + shape = [1024] + dtype = "float32" + min_val = float("0.711652") + max_val = float("2.78895") + mean = float("0.915172") + std = float("0.103271") + data = None + + +class Program_weight_tensor_parameter_166: + name = "parameter_166" + shape = [1024] + dtype = "float32" + min_val = float("-2.58251") + max_val = float("0.819375") + mean = float("-0.000413781") + std = float("0.166969") + data = None + + +class Program_weight_tensor_parameter_167: + name = "parameter_167" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.998045") + max_val = float("4.00281") + mean = float("4.91324e-05") + std = float("0.038297") + data = None + + +class Program_weight_tensor_parameter_168: + name = "parameter_168" + shape = [3072] + dtype = "float32" + min_val = float("-0.45786") + max_val = float("0.169054") + mean = float("-0.0991018") + std = float("0.0652834") + data = None + + +class Program_weight_tensor_parameter_169: + name = "parameter_169" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.482146") + max_val = float("0.42527") + mean = float("-7.43841e-06") + std = float("0.0388999") + data = None + + +class Program_weight_tensor_parameter_170: + name = "parameter_170" + shape = [1024] + dtype = "float32" + min_val = float("-0.318175") + max_val = float("0.225752") + mean = float("0.000258554") + std = float("0.0535065") + data = None + + +class Program_weight_tensor_parameter_171: + name = "parameter_171" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.301532") + max_val = float("0.283942") + mean = float("-5.12952e-06") + std = float("0.0311428") + data = None + + +class Program_weight_tensor_parameter_172: + name = "parameter_172" + shape = [1024] + dtype = "float32" + min_val = float("-0.244215") + max_val = float("0.228202") + mean = float("0.000623795") + std = float("0.02425") + data = None + + +class Program_weight_tensor_parameter_173: + name = "parameter_173" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.191551") + max_val = float("0.204686") + mean = float("3.59748e-05") + std = float("0.0329371") + data = None + + +class Program_weight_tensor_parameter_174: + name = "parameter_174" + shape = [1024] + dtype = "float32" + min_val = float("-88.9345") + max_val = float("76.0915") + mean = float("-0.331339") + std = float("13.3415") + data = None + + +class Program_weight_tensor_parameter_175: + name = "parameter_175" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.386082") + max_val = float("0.393777") + mean = float("-2.27341e-05") + std = float("0.0403943") + data = None + + +class Program_weight_tensor_parameter_176: + name = "parameter_176" + shape = [1024] + dtype = "float32" + min_val = float("-0.893027") + max_val = float("0.957733") + mean = float("-0.00216074") + std = float("0.150392") + data = None + + +class Program_weight_tensor_parameter_177: + name = "parameter_177" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.32864") + max_val = float("0.353179") + mean = float("-7.23502e-05") + std = float("0.0406003") + data = None + + +class Program_weight_tensor_parameter_178: + name = "parameter_178" + shape = [1024] + dtype = "float32" + min_val = float("-0.533644") + max_val = float("0.518115") + mean = float("0.0272807") + std = float("0.0807428") + data = None + + +class Program_weight_tensor_parameter_179: + name = "parameter_179" + shape = [1024] + dtype = "float32" + min_val = float("0.301428") + max_val = float("1.03079") + mean = float("0.853325") + std = float("0.0550114") + data = None + + +class Program_weight_tensor_parameter_180: + name = "parameter_180" + shape = [1024] + dtype = "float32" + min_val = float("-0.930415") + max_val = float("2.26378") + mean = float("0.0139702") + std = float("0.172308") + data = None + + +class Program_weight_tensor_parameter_181: + name = "parameter_181" + shape = [1024] + dtype = "float32" + min_val = float("0.754785") + max_val = float("2.97358") + mean = float("0.916975") + std = float("0.0999432") + data = None + + +class Program_weight_tensor_parameter_182: + name = "parameter_182" + shape = [1024] + dtype = "float32" + min_val = float("-2.96274") + max_val = float("0.792048") + mean = float("-0.000331411") + std = float("0.165254") + data = None + + +class Program_weight_tensor_parameter_183: + name = "parameter_183" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.811971") + max_val = float("1.38809") + mean = float("2.33224e-05") + std = float("0.0379516") + data = None + + +class Program_weight_tensor_parameter_184: + name = "parameter_184" + shape = [3072] + dtype = "float32" + min_val = float("-0.295419") + max_val = float("0.141418") + mean = float("-0.0917026") + std = float("0.0505368") + data = None + + +class Program_weight_tensor_parameter_185: + name = "parameter_185" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.423977") + max_val = float("0.357609") + mean = float("-2.18138e-05") + std = float("0.0392321") + data = None + + +class Program_weight_tensor_parameter_186: + name = "parameter_186" + shape = [1024] + dtype = "float32" + min_val = float("-0.165429") + max_val = float("0.119893") + mean = float("0.000167185") + std = float("0.0383032") + data = None + + +class Program_weight_tensor_parameter_187: + name = "parameter_187" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.181991") + max_val = float("0.193403") + mean = float("-5.23354e-06") + std = float("0.0311671") + data = None + + +class Program_weight_tensor_parameter_188: + name = "parameter_188" + shape = [1024] + dtype = "float32" + min_val = float("-0.0812541") + max_val = float("0.188788") + mean = float("-0.000575872") + std = float("0.0202331") + data = None + + +class Program_weight_tensor_parameter_189: + name = "parameter_189" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.185099") + max_val = float("0.187273") + mean = float("-5.22479e-05") + std = float("0.032931") + data = None + + +class Program_weight_tensor_parameter_190: + name = "parameter_190" + shape = [1024] + dtype = "float32" + min_val = float("-71.6475") + max_val = float("80.7671") + mean = float("-0.204506") + std = float("13.5887") + data = None + + +class Program_weight_tensor_parameter_191: + name = "parameter_191" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.360331") + max_val = float("0.350709") + mean = float("-4.30884e-05") + std = float("0.0393872") + data = None + + +class Program_weight_tensor_parameter_192: + name = "parameter_192" + shape = [1024] + dtype = "float32" + min_val = float("-0.835171") + max_val = float("0.861132") + mean = float("0.0113881") + std = float("0.137204") + data = None + + +class Program_weight_tensor_parameter_193: + name = "parameter_193" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.294538") + max_val = float("0.321801") + mean = float("0.000106003") + std = float("0.0396434") + data = None + + +class Program_weight_tensor_parameter_194: + name = "parameter_194" + shape = [1024] + dtype = "float32" + min_val = float("-0.514991") + max_val = float("0.425528") + mean = float("0.0242098") + std = float("0.0831984") + data = None + + +class Program_weight_tensor_parameter_195: + name = "parameter_195" + shape = [1024] + dtype = "float32" + min_val = float("0.371559") + max_val = float("0.980881") + mean = float("0.81909") + std = float("0.0457026") + data = None + + +class Program_weight_tensor_parameter_196: + name = "parameter_196" + shape = [1024] + dtype = "float32" + min_val = float("-0.959735") + max_val = float("2.45818") + mean = float("0.0149985") + std = float("0.186377") + data = None + + +class Program_weight_tensor_parameter_197: + name = "parameter_197" + shape = [1024] + dtype = "float32" + min_val = float("0.755497") + max_val = float("2.81146") + mean = float("0.923829") + std = float("0.0874565") + data = None + + +class Program_weight_tensor_parameter_198: + name = "parameter_198" + shape = [1024] + dtype = "float32" + min_val = float("-3.36073") + max_val = float("0.554675") + mean = float("-0.000129579") + std = float("0.159866") + data = None + + +class Program_weight_tensor_parameter_199: + name = "parameter_199" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.558442") + max_val = float("1.90443") + mean = float("1.88204e-05") + std = float("0.0396495") + data = None + + +class Program_weight_tensor_parameter_200: + name = "parameter_200" + shape = [3072] + dtype = "float32" + min_val = float("-0.302099") + max_val = float("0.228677") + mean = float("-0.091567") + std = float("0.0517443") + data = None + + +class Program_weight_tensor_parameter_201: + name = "parameter_201" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.371458") + max_val = float("0.319178") + mean = float("-8.55797e-05") + std = float("0.0401857") + data = None + + +class Program_weight_tensor_parameter_202: + name = "parameter_202" + shape = [1024] + dtype = "float32" + min_val = float("-0.34772") + max_val = float("0.171465") + mean = float("7.27678e-05") + std = float("0.0498481") + data = None + + +class Program_weight_tensor_parameter_203: + name = "parameter_203" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-1.40619") + max_val = float("0.36731") + mean = float("1.10649e-05") + std = float("0.0304895") + data = None + + +class Program_weight_tensor_parameter_204: + name = "parameter_204" + shape = [1024] + dtype = "float32" + min_val = float("-0.226983") + max_val = float("0.183964") + mean = float("0.000689111") + std = float("0.0224656") + data = None + + +class Program_weight_tensor_parameter_205: + name = "parameter_205" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.162785") + max_val = float("0.177357") + mean = float("2.89287e-05") + std = float("0.031528") + data = None + + +class Program_weight_tensor_parameter_206: + name = "parameter_206" + shape = [1024] + dtype = "float32" + min_val = float("-50.3207") + max_val = float("50.3649") + mean = float("0.180631") + std = float("8.81216") + data = None + + +class Program_weight_tensor_parameter_207: + name = "parameter_207" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.401029") + max_val = float("0.371112") + mean = float("8.64665e-06") + std = float("0.0400144") + data = None + + +class Program_weight_tensor_parameter_208: + name = "parameter_208" + shape = [1024] + dtype = "float32" + min_val = float("-0.791765") + max_val = float("1.07049") + mean = float("-0.00833622") + std = float("0.148489") + data = None + + +class Program_weight_tensor_parameter_209: + name = "parameter_209" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.31174") + max_val = float("0.346841") + mean = float("-8.074e-05") + std = float("0.040232") + data = None + + +class Program_weight_tensor_parameter_210: + name = "parameter_210" + shape = [1024] + dtype = "float32" + min_val = float("-0.386486") + max_val = float("0.328377") + mean = float("0.0252634") + std = float("0.0796501") + data = None + + +class Program_weight_tensor_parameter_211: + name = "parameter_211" + shape = [1024] + dtype = "float32" + min_val = float("0.355836") + max_val = float("1.06627") + mean = float("0.832351") + std = float("0.0520076") + data = None + + +class Program_weight_tensor_parameter_212: + name = "parameter_212" + shape = [1024] + dtype = "float32" + min_val = float("-1.15984") + max_val = float("2.84046") + mean = float("0.0141453") + std = float("0.194365") + data = None + + +class Program_weight_tensor_parameter_213: + name = "parameter_213" + shape = [1024] + dtype = "float32" + min_val = float("0.773986") + max_val = float("2.67493") + mean = float("0.929228") + std = float("0.082152") + data = None + + +class Program_weight_tensor_parameter_214: + name = "parameter_214" + shape = [1024] + dtype = "float32" + min_val = float("-3.11289") + max_val = float("0.685477") + mean = float("0.000497605") + std = float("0.164273") + data = None + + +class Program_weight_tensor_parameter_215: + name = "parameter_215" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.934539") + max_val = float("1.98808") + mean = float("1.85813e-05") + std = float("0.0399055") + data = None + + +class Program_weight_tensor_parameter_216: + name = "parameter_216" + shape = [3072] + dtype = "float32" + min_val = float("-0.386627") + max_val = float("0.163518") + mean = float("-0.0921591") + std = float("0.0483543") + data = None + + +class Program_weight_tensor_parameter_217: + name = "parameter_217" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.483042") + max_val = float("0.323325") + mean = float("-4.50543e-05") + std = float("0.0403389") + data = None + + +class Program_weight_tensor_parameter_218: + name = "parameter_218" + shape = [1024] + dtype = "float32" + min_val = float("-0.577972") + max_val = float("0.198992") + mean = float("-3.26465e-05") + std = float("0.0613843") + data = None + + +class Program_weight_tensor_parameter_219: + name = "parameter_219" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-2.08548") + max_val = float("0.430093") + mean = float("1.10718e-05") + std = float("0.0313504") + data = None + + +class Program_weight_tensor_parameter_220: + name = "parameter_220" + shape = [1024] + dtype = "float32" + min_val = float("-0.176819") + max_val = float("0.119068") + mean = float("-0.000835291") + std = float("0.0226843") + data = None + + +class Program_weight_tensor_parameter_221: + name = "parameter_221" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.411407") + max_val = float("0.184768") + mean = float("-2.76771e-05") + std = float("0.0325319") + data = None + + +class Program_weight_tensor_parameter_222: + name = "parameter_222" + shape = [1024] + dtype = "float32" + min_val = float("-30.3417") + max_val = float("27.9636") + mean = float("-0.202083") + std = float("5.51749") + data = None + + +class Program_weight_tensor_parameter_223: + name = "parameter_223" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.368319") + max_val = float("0.396614") + mean = float("2.02435e-05") + std = float("0.0395015") + data = None + + +class Program_weight_tensor_parameter_224: + name = "parameter_224" + shape = [1024] + dtype = "float32" + min_val = float("-0.859069") + max_val = float("0.845605") + mean = float("-0.00380847") + std = float("0.136624") + data = None + + +class Program_weight_tensor_parameter_225: + name = "parameter_225" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.397683") + max_val = float("0.36919") + mean = float("-2.36958e-05") + std = float("0.0395978") + data = None + + +class Program_weight_tensor_parameter_226: + name = "parameter_226" + shape = [1024] + dtype = "float32" + min_val = float("-0.442596") + max_val = float("0.634854") + mean = float("0.0238481") + std = float("0.076785") + data = None + + +class Program_weight_tensor_parameter_227: + name = "parameter_227" + shape = [1024] + dtype = "float32" + min_val = float("0.333406") + max_val = float("1.0303") + mean = float("0.826591") + std = float("0.0543946") + data = None + + +class Program_weight_tensor_parameter_228: + name = "parameter_228" + shape = [1024] + dtype = "float32" + min_val = float("-1.07107") + max_val = float("3.16482") + mean = float("0.0153198") + std = float("0.204216") + data = None + + +class Program_weight_tensor_parameter_229: + name = "parameter_229" + shape = [1024] + dtype = "float32" + min_val = float("0.757126") + max_val = float("3.32476") + mean = float("0.913286") + std = float("0.106061") + data = None + + +class Program_weight_tensor_parameter_230: + name = "parameter_230" + shape = [1024] + dtype = "float32" + min_val = float("-2.96934") + max_val = float("0.782593") + mean = float("0.000545974") + std = float("0.177225") + data = None + + +class Program_weight_tensor_parameter_231: + name = "parameter_231" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.585014") + max_val = float("1.82302") + mean = float("2.15116e-05") + std = float("0.0403429") + data = None + + +class Program_weight_tensor_parameter_232: + name = "parameter_232" + shape = [3072] + dtype = "float32" + min_val = float("-0.405719") + max_val = float("0.144944") + mean = float("-0.0907646") + std = float("0.0440837") + data = None + + +class Program_weight_tensor_parameter_233: + name = "parameter_233" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.443763") + max_val = float("0.310188") + mean = float("-9.6324e-05") + std = float("0.0409107") + data = None + + +class Program_weight_tensor_parameter_234: + name = "parameter_234" + shape = [1024] + dtype = "float32" + min_val = float("-0.384648") + max_val = float("0.23178") + mean = float("0.000445527") + std = float("0.0670153") + data = None + + +class Program_weight_tensor_parameter_235: + name = "parameter_235" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.46536") + max_val = float("0.361897") + mean = float("1.32428e-05") + std = float("0.0312124") + data = None + + +class Program_weight_tensor_parameter_236: + name = "parameter_236" + shape = [1024] + dtype = "float32" + min_val = float("-0.34696") + max_val = float("0.192433") + mean = float("-0.0010489") + std = float("0.0311333") + data = None + + +class Program_weight_tensor_parameter_237: + name = "parameter_237" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.203668") + max_val = float("0.199303") + mean = float("5.18752e-06") + std = float("0.0327582") + data = None + + +class Program_weight_tensor_parameter_238: + name = "parameter_238" + shape = [1024] + dtype = "float32" + min_val = float("-40.3062") + max_val = float("47.6622") + mean = float("-0.058899") + std = float("5.0446") + data = None + + +class Program_weight_tensor_parameter_239: + name = "parameter_239" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.433798") + max_val = float("0.372394") + mean = float("-1.59784e-05") + std = float("0.0421987") + data = None + + +class Program_weight_tensor_parameter_240: + name = "parameter_240" + shape = [1024] + dtype = "float32" + min_val = float("-0.71027") + max_val = float("0.954967") + mean = float("0.000614036") + std = float("0.125156") + data = None + + +class Program_weight_tensor_parameter_241: + name = "parameter_241" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.381372") + max_val = float("0.363732") + mean = float("-4.96525e-06") + std = float("0.042744") + data = None + + +class Program_weight_tensor_parameter_242: + name = "parameter_242" + shape = [1024] + dtype = "float32" + min_val = float("-0.763102") + max_val = float("1.36527") + mean = float("0.0139947") + std = float("0.0930429") + data = None + + +class Program_weight_tensor_parameter_243: + name = "parameter_243" + shape = [1024] + dtype = "float32" + min_val = float("0.161468") + max_val = float("1.01411") + mean = float("0.821103") + std = float("0.0619724") + data = None + + +class Program_weight_tensor_parameter_244: + name = "parameter_244" + shape = [1024] + dtype = "float32" + min_val = float("-3.19943") + max_val = float("2.88993") + mean = float("-0.000740846") + std = float("0.22922") + data = None + + +class Program_weight_tensor_parameter_245: + name = "parameter_245" + shape = [1024] + dtype = "float32" + min_val = float("0.784237") + max_val = float("3.4115") + mean = float("0.919288") + std = float("0.115308") + data = None + + +class Program_weight_tensor_parameter_246: + name = "parameter_246" + shape = [1024] + dtype = "float32" + min_val = float("-2.1066") + max_val = float("1.39051") + mean = float("0.00207336") + std = float("0.154755") + data = None + + +class Program_weight_tensor_parameter_247: + name = "parameter_247" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-1.10062") + max_val = float("6.21888") + mean = float("-2.24199e-05") + std = float("0.0418785") + data = None + + +class Program_weight_tensor_parameter_248: + name = "parameter_248" + shape = [3072] + dtype = "float32" + min_val = float("-0.286695") + max_val = float("0.130823") + mean = float("-0.0899609") + std = float("0.041661") + data = None + + +class Program_weight_tensor_parameter_249: + name = "parameter_249" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.349521") + max_val = float("0.377404") + mean = float("0.000143548") + std = float("0.0420247") + data = None + + +class Program_weight_tensor_parameter_250: + name = "parameter_250" + shape = [1024] + dtype = "float32" + min_val = float("-0.137614") + max_val = float("0.129908") + mean = float("0.00011517") + std = float("0.0377353") + data = None + + +class Program_weight_tensor_parameter_251: + name = "parameter_251" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.182414") + max_val = float("0.178834") + mean = float("8.35855e-06") + std = float("0.03213") + data = None + + +class Program_weight_tensor_parameter_252: + name = "parameter_252" + shape = [1024] + dtype = "float32" + min_val = float("-0.136658") + max_val = float("0.163228") + mean = float("-0.000272051") + std = float("0.0202439") + data = None + + +class Program_weight_tensor_parameter_253: + name = "parameter_253" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.311345") + max_val = float("0.230195") + mean = float("1.00827e-05") + std = float("0.0341369") + data = None + + +class Program_weight_tensor_parameter_254: + name = "parameter_254" + shape = [1024] + dtype = "float32" + min_val = float("-27.8905") + max_val = float("23.0534") + mean = float("-0.205126") + std = float("4.07321") + data = None + + +class Program_weight_tensor_parameter_255: + name = "parameter_255" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.425076") + max_val = float("0.440385") + mean = float("1.29672e-05") + std = float("0.0401302") + data = None + + +class Program_weight_tensor_parameter_256: + name = "parameter_256" + shape = [1024] + dtype = "float32" + min_val = float("-0.918921") + max_val = float("0.886883") + mean = float("-0.000599918") + std = float("0.127772") + data = None + + +class Program_weight_tensor_parameter_257: + name = "parameter_257" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.35422") + max_val = float("0.335888") + mean = float("-1.14376e-05") + std = float("0.0403637") + data = None + + +class Program_weight_tensor_parameter_258: + name = "parameter_258" + shape = [1024] + dtype = "float32" + min_val = float("-1.13853") + max_val = float("1.44565") + mean = float("-0.00609525") + std = float("0.0970009") + data = None + + +class Program_weight_tensor_parameter_259: + name = "parameter_259" + shape = [1024] + dtype = "float32" + min_val = float("0.243789") + max_val = float("1.01502") + mean = float("0.832628") + std = float("0.0584167") + data = None + + +class Program_weight_tensor_parameter_260: + name = "parameter_260" + shape = [1024] + dtype = "float32" + min_val = float("-2.54937") + max_val = float("1.59932") + mean = float("-0.00962391") + std = float("0.203612") + data = None + + +class Program_weight_tensor_parameter_261: + name = "parameter_261" + shape = [1024] + dtype = "float32" + min_val = float("0.796313") + max_val = float("3.08342") + mean = float("0.93179") + std = float("0.101842") + data = None + + +class Program_weight_tensor_parameter_262: + name = "parameter_262" + shape = [1024] + dtype = "float32" + min_val = float("-1.15776") + max_val = float("2.51675") + mean = float("0.00261812") + std = float("0.167197") + data = None + + +class Program_weight_tensor_parameter_263: + name = "parameter_263" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-1.56459") + max_val = float("3.40476") + mean = float("-2.58096e-05") + std = float("0.0421446") + data = None + + +class Program_weight_tensor_parameter_264: + name = "parameter_264" + shape = [3072] + dtype = "float32" + min_val = float("-0.243279") + max_val = float("0.137644") + mean = float("-0.0867306") + std = float("0.041289") + data = None + + +class Program_weight_tensor_parameter_265: + name = "parameter_265" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.506971") + max_val = float("0.350392") + mean = float("0.000259838") + std = float("0.0425169") + data = None + + +class Program_weight_tensor_parameter_266: + name = "parameter_266" + shape = [1024] + dtype = "float32" + min_val = float("-0.353443") + max_val = float("0.290814") + mean = float("-0.000263561") + std = float("0.0481148") + data = None + + +class Program_weight_tensor_parameter_267: + name = "parameter_267" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.380094") + max_val = float("0.440548") + mean = float("-6.13141e-06") + std = float("0.0326112") + data = None + + +class Program_weight_tensor_parameter_268: + name = "parameter_268" + shape = [1024] + dtype = "float32" + min_val = float("-0.0898818") + max_val = float("0.0987061") + mean = float("5.20187e-05") + std = float("0.0175395") + data = None + + +class Program_weight_tensor_parameter_269: + name = "parameter_269" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.186794") + max_val = float("0.179432") + mean = float("-4.17685e-05") + std = float("0.0346124") + data = None + + +class Program_weight_tensor_parameter_270: + name = "parameter_270" + shape = [1024] + dtype = "float32" + min_val = float("-29.5129") + max_val = float("30.5744") + mean = float("0.142529") + std = float("3.89504") + data = None + + +class Program_weight_tensor_parameter_271: + name = "parameter_271" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.347392") + max_val = float("0.402217") + mean = float("-3.12698e-05") + std = float("0.0398947") + data = None + + +class Program_weight_tensor_parameter_272: + name = "parameter_272" + shape = [1024] + dtype = "float32" + min_val = float("-0.906221") + max_val = float("0.785422") + mean = float("-0.000762525") + std = float("0.125668") + data = None + + +class Program_weight_tensor_parameter_273: + name = "parameter_273" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.319976") + max_val = float("0.366833") + mean = float("9.55682e-06") + std = float("0.0399679") + data = None + + +class Program_weight_tensor_parameter_274: + name = "parameter_274" + shape = [1024] + dtype = "float32" + min_val = float("-1.48846") + max_val = float("0.407507") + mean = float("-0.0163359") + std = float("0.0855264") + data = None + + +class Program_weight_tensor_parameter_275: + name = "parameter_275" + shape = [1024] + dtype = "float32" + min_val = float("0.365271") + max_val = float("0.970708") + mean = float("0.819245") + std = float("0.0532152") + data = None + + +class Program_weight_tensor_parameter_276: + name = "parameter_276" + shape = [1024] + dtype = "float32" + min_val = float("-2.58463") + max_val = float("1.69338") + mean = float("-0.00325459") + std = float("0.200922") + data = None + + +class Program_weight_tensor_parameter_277: + name = "parameter_277" + shape = [1024] + dtype = "float32" + min_val = float("0.756009") + max_val = float("3.22197") + mean = float("0.930472") + std = float("0.100982") + data = None + + +class Program_weight_tensor_parameter_278: + name = "parameter_278" + shape = [1024] + dtype = "float32" + min_val = float("-1.19347") + max_val = float("2.19415") + mean = float("0.00182381") + std = float("0.164039") + data = None + + +class Program_weight_tensor_parameter_279: + name = "parameter_279" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-3.40753") + max_val = float("1.72713") + mean = float("-2.93926e-05") + std = float("0.0425814") + data = None + + +class Program_weight_tensor_parameter_280: + name = "parameter_280" + shape = [3072] + dtype = "float32" + min_val = float("-0.222803") + max_val = float("0.11994") + mean = float("-0.0868511") + std = float("0.0372294") + data = None + + +class Program_weight_tensor_parameter_281: + name = "parameter_281" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.27603") + max_val = float("0.337476") + mean = float("0.000131762") + std = float("0.0428477") + data = None + + +class Program_weight_tensor_parameter_282: + name = "parameter_282" + shape = [1024] + dtype = "float32" + min_val = float("-0.2271") + max_val = float("0.230178") + mean = float("-5.44728e-05") + std = float("0.0332148") + data = None + + +class Program_weight_tensor_parameter_283: + name = "parameter_283" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.324873") + max_val = float("0.331267") + mean = float("7.85738e-06") + std = float("0.0325772") + data = None + + +class Program_weight_tensor_parameter_284: + name = "parameter_284" + shape = [1024] + dtype = "float32" + min_val = float("-0.0890741") + max_val = float("0.0708162") + mean = float("-0.000566579") + std = float("0.0150755") + data = None + + +class Program_weight_tensor_parameter_285: + name = "parameter_285" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.191792") + max_val = float("0.253189") + mean = float("-7.01819e-06") + std = float("0.0349937") + data = None + + +class Program_weight_tensor_parameter_286: + name = "parameter_286" + shape = [1024] + dtype = "float32" + min_val = float("-36.6444") + max_val = float("23.6616") + mean = float("-0.116394") + std = float("3.9199") + data = None + + +class Program_weight_tensor_parameter_287: + name = "parameter_287" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.347466") + max_val = float("0.339855") + mean = float("-2.34524e-05") + std = float("0.0400554") + data = None + + +class Program_weight_tensor_parameter_288: + name = "parameter_288" + shape = [1024] + dtype = "float32" + min_val = float("-0.79373") + max_val = float("0.689171") + mean = float("-0.00212446") + std = float("0.110241") + data = None + + +class Program_weight_tensor_parameter_289: + name = "parameter_289" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.388889") + max_val = float("0.377815") + mean = float("4.78475e-05") + std = float("0.0399652") + data = None + + +class Program_weight_tensor_parameter_290: + name = "parameter_290" + shape = [1024] + dtype = "float32" + min_val = float("-1.30698") + max_val = float("0.313886") + mean = float("-0.0163116") + std = float("0.0790144") + data = None + + +class Program_weight_tensor_parameter_291: + name = "parameter_291" + shape = [1024] + dtype = "float32" + min_val = float("0.398626") + max_val = float("0.94322") + mean = float("0.829831") + std = float("0.0505743") + data = None + + +class Program_weight_tensor_parameter_292: + name = "parameter_292" + shape = [1024] + dtype = "float32" + min_val = float("-2.13026") + max_val = float("2.12586") + mean = float("0.00562269") + std = float("0.204314") + data = None + + +class Program_weight_tensor_parameter_293: + name = "parameter_293" + shape = [1024] + dtype = "float32" + min_val = float("0.625952") + max_val = float("2.99458") + mean = float("0.931865") + std = float("0.0980494") + data = None + + +class Program_weight_tensor_parameter_294: + name = "parameter_294" + shape = [1024] + dtype = "float32" + min_val = float("-1.37661") + max_val = float("1.57624") + mean = float("0.00122169") + std = float("0.139907") + data = None + + +class Program_weight_tensor_parameter_295: + name = "parameter_295" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-6.29049") + max_val = float("0.665115") + mean = float("-4.01924e-05") + std = float("0.0425516") + data = None + + +class Program_weight_tensor_parameter_296: + name = "parameter_296" + shape = [3072] + dtype = "float32" + min_val = float("-0.234225") + max_val = float("0.109803") + mean = float("-0.0865576") + std = float("0.0354212") + data = None + + +class Program_weight_tensor_parameter_297: + name = "parameter_297" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.31839") + max_val = float("0.273426") + mean = float("6.51547e-06") + std = float("0.0428766") + data = None + + +class Program_weight_tensor_parameter_298: + name = "parameter_298" + shape = [1024] + dtype = "float32" + min_val = float("-0.232133") + max_val = float("0.131845") + mean = float("-0.00043737") + std = float("0.0262402") + data = None + + +class Program_weight_tensor_parameter_299: + name = "parameter_299" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.332377") + max_val = float("0.206296") + mean = float("1.52035e-06") + std = float("0.0312684") + data = None + + +class Program_weight_tensor_parameter_300: + name = "parameter_300" + shape = [1024] + dtype = "float32" + min_val = float("-0.0793155") + max_val = float("0.0583826") + mean = float("0.000411525") + std = float("0.0146337") + data = None + + +class Program_weight_tensor_parameter_301: + name = "parameter_301" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.199237") + max_val = float("0.427816") + mean = float("2.05072e-05") + std = float("0.0337897") + data = None + + +class Program_weight_tensor_parameter_302: + name = "parameter_302" + shape = [1024] + dtype = "float32" + min_val = float("-32.3963") + max_val = float("33.4242") + mean = float("0.0018388") + std = float("3.56863") + data = None + + +class Program_weight_tensor_parameter_303: + name = "parameter_303" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.328859") + max_val = float("0.502383") + mean = float("-0.000137592") + std = float("0.0394146") + data = None + + +class Program_weight_tensor_parameter_304: + name = "parameter_304" + shape = [1024] + dtype = "float32" + min_val = float("-0.811503") + max_val = float("0.645461") + mean = float("-0.00643536") + std = float("0.100532") + data = None + + +class Program_weight_tensor_parameter_305: + name = "parameter_305" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.34011") + max_val = float("0.3456") + mean = float("4.96559e-05") + std = float("0.0393594") + data = None + + +class Program_weight_tensor_parameter_306: + name = "parameter_306" + shape = [1024] + dtype = "float32" + min_val = float("-1.12317") + max_val = float("0.371242") + mean = float("-0.0126462") + std = float("0.0830007") + data = None + + +class Program_weight_tensor_parameter_307: + name = "parameter_307" + shape = [1024] + dtype = "float32" + min_val = float("0.438732") + max_val = float("0.917225") + mean = float("0.809974") + std = float("0.0469536") + data = None + + +class Program_weight_tensor_parameter_308: + name = "parameter_308" + shape = [1024] + dtype = "float32" + min_val = float("-1.58939") + max_val = float("2.62295") + mean = float("0.00416375") + std = float("0.209004") + data = None + + +class Program_weight_tensor_parameter_309: + name = "parameter_309" + shape = [1024] + dtype = "float32" + min_val = float("0.692015") + max_val = float("2.94876") + mean = float("0.935278") + std = float("0.0964679") + data = None + + +class Program_weight_tensor_parameter_310: + name = "parameter_310" + shape = [1024] + dtype = "float32" + min_val = float("-1.54001") + max_val = float("0.775799") + mean = float("0.00113884") + std = float("0.13636") + data = None + + +class Program_weight_tensor_parameter_311: + name = "parameter_311" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-7.07342") + max_val = float("0.627892") + mean = float("-3.67828e-05") + std = float("0.0427111") + data = None + + +class Program_weight_tensor_parameter_312: + name = "parameter_312" + shape = [3072] + dtype = "float32" + min_val = float("-0.235678") + max_val = float("0.0953726") + mean = float("-0.0889987") + std = float("0.0299768") + data = None + + +class Program_weight_tensor_parameter_313: + name = "parameter_313" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.543783") + max_val = float("0.41379") + mean = float("0.000107299") + std = float("0.0428701") + data = None + + +class Program_weight_tensor_parameter_314: + name = "parameter_314" + shape = [1024] + dtype = "float32" + min_val = float("-0.340475") + max_val = float("0.132232") + mean = float("-0.000494747") + std = float("0.0278906") + data = None + + +class Program_weight_tensor_parameter_315: + name = "parameter_315" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.429231") + max_val = float("0.43487") + mean = float("-4.30509e-06") + std = float("0.0302787") + data = None + + +class Program_weight_tensor_parameter_316: + name = "parameter_316" + shape = [1024] + dtype = "float32" + min_val = float("-0.0870212") + max_val = float("0.0622774") + mean = float("-0.00063958") + std = float("0.014353") + data = None + + +class Program_weight_tensor_parameter_317: + name = "parameter_317" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.225329") + max_val = float("0.406379") + mean = float("2.8372e-05") + std = float("0.0325952") + data = None + + +class Program_weight_tensor_parameter_318: + name = "parameter_318" + shape = [1024] + dtype = "float32" + min_val = float("-23.2692") + max_val = float("22.9121") + mean = float("0.107217") + std = float("3.14582") + data = None + + +class Program_weight_tensor_parameter_319: + name = "parameter_319" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.330439") + max_val = float("0.347383") + mean = float("8.21647e-06") + std = float("0.0384313") + data = None + + +class Program_weight_tensor_parameter_320: + name = "parameter_320" + shape = [1024] + dtype = "float32" + min_val = float("-0.937012") + max_val = float("0.688112") + mean = float("0.00172075") + std = float("0.0960153") + data = None + + +class Program_weight_tensor_parameter_321: + name = "parameter_321" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.384069") + max_val = float("0.426263") + mean = float("-1.34655e-05") + std = float("0.0383985") + data = None + + +class Program_weight_tensor_parameter_322: + name = "parameter_322" + shape = [1024] + dtype = "float32" + min_val = float("-0.47526") + max_val = float("0.336773") + mean = float("-0.0120649") + std = float("0.07508") + data = None + + +class Program_weight_tensor_parameter_323: + name = "parameter_323" + shape = [1024] + dtype = "float32" + min_val = float("0.0914798") + max_val = float("0.93619") + mean = float("0.814356") + std = float("0.0508642") + data = None + + +class Program_weight_tensor_parameter_324: + name = "parameter_324" + shape = [1024] + dtype = "float32" + min_val = float("-1.84961") + max_val = float("3.32661") + mean = float("0.00567492") + std = float("0.228744") + data = None + + +class Program_weight_tensor_parameter_325: + name = "parameter_325" + shape = [1024] + dtype = "float32" + min_val = float("0.650388") + max_val = float("3.24804") + mean = float("0.924711") + std = float("0.109819") + data = None + + +class Program_weight_tensor_parameter_326: + name = "parameter_326" + shape = [1024] + dtype = "float32" + min_val = float("-1.98624") + max_val = float("0.541917") + mean = float("0.00107701") + std = float("0.149786") + data = None + + +class Program_weight_tensor_parameter_327: + name = "parameter_327" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-9.09443") + max_val = float("0.871579") + mean = float("-6.05094e-05") + std = float("0.0429943") + data = None + + +class Program_weight_tensor_parameter_328: + name = "parameter_328" + shape = [3072] + dtype = "float32" + min_val = float("-0.247981") + max_val = float("0.0766914") + mean = float("-0.0917239") + std = float("0.0278865") + data = None + + +class Program_weight_tensor_parameter_329: + name = "parameter_329" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.587541") + max_val = float("0.544341") + mean = float("5.14897e-05") + std = float("0.0428287") + data = None + + +class Program_weight_tensor_parameter_330: + name = "parameter_330" + shape = [1024] + dtype = "float32" + min_val = float("-0.518518") + max_val = float("0.278722") + mean = float("-0.000538118") + std = float("0.0513197") + data = None + + +class Program_weight_tensor_parameter_331: + name = "parameter_331" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.234722") + max_val = float("0.252242") + mean = float("-4.52886e-06") + std = float("0.029637") + data = None + + +class Program_weight_tensor_parameter_332: + name = "parameter_332" + shape = [1024] + dtype = "float32" + min_val = float("-0.212552") + max_val = float("0.295235") + mean = float("1.90364e-05") + std = float("0.0192168") + data = None + + +class Program_weight_tensor_parameter_333: + name = "parameter_333" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.441802") + max_val = float("0.229556") + mean = float("-2.36617e-06") + std = float("0.0312761") + data = None + + +class Program_weight_tensor_parameter_334: + name = "parameter_334" + shape = [1024] + dtype = "float32" + min_val = float("-26.561") + max_val = float("26.7339") + mean = float("-0.0362964") + std = float("3.68371") + data = None + + +class Program_weight_tensor_parameter_335: + name = "parameter_335" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.723539") + max_val = float("0.523171") + mean = float("-4.74482e-05") + std = float("0.0384351") + data = None + + +class Program_weight_tensor_parameter_336: + name = "parameter_336" + shape = [1024] + dtype = "float32" + min_val = float("-0.756511") + max_val = float("0.766542") + mean = float("-0.00440805") + std = float("0.113286") + data = None + + +class Program_weight_tensor_parameter_337: + name = "parameter_337" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.544746") + max_val = float("0.738531") + mean = float("-5.58386e-07") + std = float("0.038332") + data = None + + +class Program_weight_tensor_parameter_338: + name = "parameter_338" + shape = [1024] + dtype = "float32" + min_val = float("-0.273104") + max_val = float("1.04782") + mean = float("-0.00737023") + std = float("0.0878183") + data = None + + +class Program_weight_tensor_parameter_339: + name = "parameter_339" + shape = [1024] + dtype = "float32" + min_val = float("0.195772") + max_val = float("0.91745") + mean = float("0.784176") + std = float("0.0493516") + data = None + + +class Program_weight_tensor_parameter_340: + name = "parameter_340" + shape = [1024] + dtype = "float32" + min_val = float("-2.37565") + max_val = float("4.04201") + mean = float("0.00680882") + std = float("0.267159") + data = None + + +class Program_weight_tensor_parameter_341: + name = "parameter_341" + shape = [1024] + dtype = "float32" + min_val = float("0.391391") + max_val = float("2.55078") + mean = float("0.917922") + std = float("0.0861557") + data = None + + +class Program_weight_tensor_parameter_342: + name = "parameter_342" + shape = [1024] + dtype = "float32" + min_val = float("-2.53376") + max_val = float("0.940549") + mean = float("0.00250216") + std = float("0.172123") + data = None + + +class Program_weight_tensor_parameter_343: + name = "parameter_343" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-5.22465") + max_val = float("0.654989") + mean = float("-0.000107658") + std = float("0.0420318") + data = None + + +class Program_weight_tensor_parameter_344: + name = "parameter_344" + shape = [3072] + dtype = "float32" + min_val = float("-0.239292") + max_val = float("0.064599") + mean = float("-0.0940526") + std = float("0.0322718") + data = None + + +class Program_weight_tensor_parameter_345: + name = "parameter_345" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.574736") + max_val = float("0.766607") + mean = float("1.65029e-05") + std = float("0.0427119") + data = None + + +class Program_weight_tensor_parameter_346: + name = "parameter_346" + shape = [1024] + dtype = "float32" + min_val = float("-0.469969") + max_val = float("0.22763") + mean = float("2.9635e-05") + std = float("0.0804007") + data = None + + +class Program_weight_tensor_parameter_347: + name = "parameter_347" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.441307") + max_val = float("0.493492") + mean = float("-2.97237e-06") + std = float("0.027309") + data = None + + +class Program_weight_tensor_parameter_348: + name = "parameter_348" + shape = [1024] + dtype = "float32" + min_val = float("-0.36476") + max_val = float("0.263362") + mean = float("0.0017675") + std = float("0.0322038") + data = None + + +class Program_weight_tensor_parameter_349: + name = "parameter_349" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.34401") + max_val = float("0.253849") + mean = float("-1.14307e-06") + std = float("0.027871") + data = None + + +class Program_weight_tensor_parameter_350: + name = "parameter_350" + shape = [1024] + dtype = "float32" + min_val = float("-14.3712") + max_val = float("13.198") + mean = float("-0.0200594") + std = float("1.78912") + data = None + + +class Program_weight_tensor_parameter_351: + name = "parameter_351" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.441406") + max_val = float("0.392539") + mean = float("1.20488e-05") + std = float("0.0390802") + data = None + + +class Program_weight_tensor_parameter_352: + name = "parameter_352" + shape = [1024] + dtype = "float32" + min_val = float("-0.732734") + max_val = float("0.89676") + mean = float("-0.00451577") + std = float("0.124549") + data = None + + +class Program_weight_tensor_parameter_353: + name = "parameter_353" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.305703") + max_val = float("0.341518") + mean = float("-7.44948e-05") + std = float("0.0388249") + data = None + + +class Program_weight_tensor_parameter_354: + name = "parameter_354" + shape = [1024] + dtype = "float32" + min_val = float("-0.392564") + max_val = float("0.862147") + mean = float("0.010822") + std = float("0.11769") + data = None + + +class Program_weight_tensor_parameter_355: + name = "parameter_355" + shape = [1024] + dtype = "float32" + min_val = float("0.1122") + max_val = float("0.890576") + mean = float("0.768032") + std = float("0.0621383") + data = None + + +class Program_weight_tensor_parameter_356: + name = "parameter_356" + shape = [1024] + dtype = "float32" + min_val = float("-3.07715") + max_val = float("4.01419") + mean = float("0.00658594") + std = float("0.323994") + data = None + + +class Program_weight_tensor_parameter_357: + name = "parameter_357" + shape = [1024] + dtype = "float32" + min_val = float("0.727013") + max_val = float("2.92129") + mean = float("0.902457") + std = float("0.0915191") + data = None + + +class Program_weight_tensor_parameter_358: + name = "parameter_358" + shape = [1024] + dtype = "float32" + min_val = float("-2.24168") + max_val = float("0.584714") + mean = float("0.00107733") + std = float("0.143042") + data = None + + +class Program_weight_tensor_parameter_359: + name = "parameter_359" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-1.75203") + max_val = float("1.04303") + mean = float("-8.46585e-05") + std = float("0.0415855") + data = None + + +class Program_weight_tensor_parameter_360: + name = "parameter_360" + shape = [3072] + dtype = "float32" + min_val = float("-0.307765") + max_val = float("0.0822907") + mean = float("-0.0923558") + std = float("0.0350785") + data = None + + +class Program_weight_tensor_parameter_361: + name = "parameter_361" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.316847") + max_val = float("0.288738") + mean = float("3.89156e-06") + std = float("0.0421069") + data = None + + +class Program_weight_tensor_parameter_362: + name = "parameter_362" + shape = [1024] + dtype = "float32" + min_val = float("-0.359781") + max_val = float("0.362052") + mean = float("-0.000547") + std = float("0.117229") + data = None + + +class Program_weight_tensor_parameter_363: + name = "parameter_363" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.353609") + max_val = float("0.369208") + mean = float("-4.81624e-06") + std = float("0.028725") + data = None + + +class Program_weight_tensor_parameter_364: + name = "parameter_364" + shape = [1024] + dtype = "float32" + min_val = float("-0.8217") + max_val = float("0.505968") + mean = float("-0.000317355") + std = float("0.0551285") + data = None + + +class Program_weight_tensor_parameter_365: + name = "parameter_365" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.191421") + max_val = float("0.271066") + mean = float("-4.63742e-06") + std = float("0.0289635") + data = None + + +class Program_weight_tensor_parameter_366: + name = "parameter_366" + shape = [1024] + dtype = "float32" + min_val = float("-7.61407") + max_val = float("8.22344") + mean = float("0.082331") + std = float("1.17997") + data = None + + +class Program_weight_tensor_parameter_367: + name = "parameter_367" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.388772") + max_val = float("0.405482") + mean = float("-7.8484e-06") + std = float("0.040125") + data = None + + +class Program_weight_tensor_parameter_368: + name = "parameter_368" + shape = [1024] + dtype = "float32" + min_val = float("-1.3901") + max_val = float("0.946909") + mean = float("-0.00719961") + std = float("0.182723") + data = None + + +class Program_weight_tensor_parameter_369: + name = "parameter_369" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.286249") + max_val = float("0.324407") + mean = float("-5.20534e-05") + std = float("0.0402369") + data = None + + +class Program_weight_tensor_parameter_370: + name = "parameter_370" + shape = [1024] + dtype = "float32" + min_val = float("-1.06177") + max_val = float("1.45683") + mean = float("0.0127926") + std = float("0.123918") + data = None + + +class Program_weight_tensor_parameter_371: + name = "parameter_371" + shape = [1024] + dtype = "float32" + min_val = float("0.124651") + max_val = float("0.852215") + mean = float("0.736683") + std = float("0.060745") + data = None + + +class Program_weight_tensor_parameter_372: + name = "parameter_372" + shape = [1024] + dtype = "float32" + min_val = float("-3.64256") + max_val = float("5.30272") + mean = float("0.00202874") + std = float("0.398373") + data = None + + +class Program_weight_tensor_parameter_373: + name = "parameter_373" + shape = [1024] + dtype = "float32" + min_val = float("0.75281") + max_val = float("3.59224") + mean = float("0.888554") + std = float("0.112329") + data = None + + +class Program_weight_tensor_parameter_374: + name = "parameter_374" + shape = [1024] + dtype = "float32" + min_val = float("-1.76359") + max_val = float("0.678165") + mean = float("0.0022492") + std = float("0.122453") + data = None + + +class Program_weight_tensor_parameter_375: + name = "parameter_375" + shape = [3072, 1024] + dtype = "float32" + min_val = float("-0.984892") + max_val = float("2.09968") + mean = float("-2.4032e-05") + std = float("0.0409049") + data = None + + +class Program_weight_tensor_parameter_376: + name = "parameter_376" + shape = [3072] + dtype = "float32" + min_val = float("-0.394219") + max_val = float("0.340756") + mean = float("-0.103743") + std = float("0.0398755") + data = None + + +class Program_weight_tensor_parameter_377: + name = "parameter_377" + shape = [1024, 3072] + dtype = "float32" + min_val = float("-0.329957") + max_val = float("0.404802") + mean = float("2.6939e-05") + std = float("0.0411044") + data = None + + +class Program_weight_tensor_parameter_378: + name = "parameter_378" + shape = [1024] + dtype = "float32" + min_val = float("-0.470717") + max_val = float("0.406585") + mean = float("-0.00160047") + std = float("0.124823") + data = None + + +class Program_weight_tensor_parameter_379: + name = "parameter_379" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.517553") + max_val = float("0.748218") + mean = float("9.65724e-06") + std = float("0.0291331") + data = None + + +class Program_weight_tensor_parameter_380: + name = "parameter_380" + shape = [1024] + dtype = "float32" + min_val = float("-0.843538") + max_val = float("1.10086") + mean = float("0.00294669") + std = float("0.0937106") + data = None + + +class Program_weight_tensor_parameter_381: + name = "parameter_381" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.418397") + max_val = float("0.336119") + mean = float("-1.02146e-05") + std = float("0.0288568") + data = None + + +class Program_weight_tensor_parameter_382: + name = "parameter_382" + shape = [1024] + dtype = "float32" + min_val = float("-4.2017") + max_val = float("4.14468") + mean = float("-0.00137494") + std = float("0.701278") + data = None + + +class Program_weight_tensor_parameter_383: + name = "parameter_383" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.27631") + max_val = float("0.313198") + mean = float("7.34807e-06") + std = float("0.0413087") + data = None + + +class Program_weight_tensor_parameter_384: + name = "parameter_384" + shape = [1024] + dtype = "float32" + min_val = float("-1.67318") + max_val = float("1.81146") + mean = float("0.00136211") + std = float("0.239798") + data = None + + +class Program_weight_tensor_parameter_385: + name = "parameter_385" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.487252") + max_val = float("0.483562") + mean = float("1.8843e-06") + std = float("0.0410951") + data = None + + +class Program_weight_tensor_parameter_386: + name = "parameter_386" + shape = [1024] + dtype = "float32" + min_val = float("-1.10377") + max_val = float("1.24901") + mean = float("-0.00654411") + std = float("0.0785123") + data = None + + +class Program_weight_tensor_parameter_387: + name = "parameter_387" + shape = [1024] + dtype = "float32" + min_val = float("0.085907") + max_val = float("0.954764") + mean = float("0.740615") + std = float("0.0858303") + data = None + + +class Program_weight_tensor_parameter_388: + name = "parameter_388" + shape = [3, 1024] + dtype = "float32" + min_val = float("-0.0631576") + max_val = float("0.0602673") + mean = float("-2.82064e-05") + std = float("0.0194793") + data = None + + +class Program_weight_tensor_parameter_389: + name = "parameter_389" + shape = [2, 1024] + dtype = "float32" + min_val = float("-0.736974") + max_val = float("0.427723") + mean = float("-4.40706e-05") + std = float("0.0276371") + data = None + + +class Program_weight_tensor_parameter_390: + name = "parameter_390" + shape = [512, 1024] + dtype = "float32" + min_val = float("-0.401593") + max_val = float("0.596155") + mean = float("-4.62166e-05") + std = float("0.0192381") + data = None + + +class Program_weight_tensor_parameter_391: + name = "parameter_391" + shape = [17965, 1024] + dtype = "float32" + min_val = float("-4.10967") + max_val = float("1.58686") + mean = float("0.00241863") + std = float("0.0420049") + data = None diff --git a/paddle_samples/PaddleNLP/utc-medium/graph_hash.txt b/paddle_samples/PaddleNLP/utc-medium/graph_hash.txt new file mode 100644 index 0000000000..c17c294df1 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-medium/graph_hash.txt @@ -0,0 +1 @@ +85b1adf22cbd5287447ba0bcd6a9ce65756fb45e60481fb1c45dc0c953719d3b \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-medium/graph_net.json b/paddle_samples/PaddleNLP/utc-medium/graph_net.json new file mode 100644 index 0000000000..bcd95b26a0 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-medium/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "utc-medium", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-medium/input_meta.py b/paddle_samples/PaddleNLP/utc-medium/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-medium/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/utc-medium/model.py b/paddle_samples/PaddleNLP/utc-medium/model.py new file mode 100644 index 0000000000..8eea07f829 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-medium/model.py @@ -0,0 +1,1422 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + parameter_72, + parameter_73, + parameter_74, + parameter_75, + parameter_76, + parameter_77, + parameter_78, + parameter_79, + parameter_80, + parameter_81, + parameter_82, + parameter_83, + parameter_84, + parameter_85, + parameter_86, + parameter_87, + parameter_88, + parameter_89, + parameter_90, + parameter_91, + parameter_92, + parameter_93, + parameter_94, + parameter_95, + parameter_96, + parameter_97, + parameter_98, + parameter_99, + parameter_100, + parameter_101, + parameter_102, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 39981x768xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_102, 0, False) + del data_0, parameter_102 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0, full_2 + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 2048x768xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_101, -1, False) + del parameter_101 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x768xf32) <- (1x21xi64, 4x768xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_100, -1, False) + del data_1, parameter_100 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_99, parameter_98, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_98, parameter_99 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_15 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_16 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_17 = full_4 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_97, False, False) + del parameter_97 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_96) + del parameter_96 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 64] + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_95, False, False) + del parameter_95 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_94) + del parameter_94 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_93, False, False) + del parameter_93 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_92) + del parameter_92 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_18 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_19 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_20 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_21 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_22 = full_5 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 768] + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_91, False, False) + del parameter_91 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_90) + del parameter_90 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_85, parameter_84, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_84, parameter_85 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_89, False, False) + del parameter_89 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_88) + del parameter_88 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_87, False, False) + del parameter_87 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_86) + del parameter_86 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_83, parameter_82, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_82, parameter_83 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_81, False, False) + del parameter_81 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_80) + del parameter_80 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_79, False, False) + del parameter_79 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_78) + del parameter_78 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_77, False, False) + del parameter_77 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_76) + del parameter_76 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_75, False, False) + del parameter_75 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_74) + del parameter_74 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_69, parameter_68, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_68, parameter_69 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_73, False, False) + del parameter_73 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_72) + del parameter_72 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_71, False, False) + del parameter_71 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_70) + del parameter_70 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_64) + del parameter_64 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_20, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_21 = paddle._C_ops.add(matmul_17, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_22 = paddle._C_ops.add(matmul_18, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_8, full_5, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_3, transpose_9, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_23 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_23, -1) + del add_23 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_24 = paddle._C_ops.add(matmul_21, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_24, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_24 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_25 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_25, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_26 = paddle._C_ops.add(matmul_22, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_2 = paddle._C_ops.gelu(add_26, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_27 = paddle._C_ops.add(matmul_23, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_27, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_27 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_28 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_28, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_29 = paddle._C_ops.add(matmul_24, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_29, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_30 = paddle._C_ops.add(matmul_25, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_31 = paddle._C_ops.add(matmul_26, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_12, full_5, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_27 = paddle._C_ops.matmul(scale_4, transpose_13, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_32 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_32, -1) + del add_32 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_33 = paddle._C_ops.add(matmul_29, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_33, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_33 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_34 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_34, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_35 = paddle._C_ops.add(matmul_30, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_3 = paddle._C_ops.gelu(add_35, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_36 = paddle._C_ops.add(matmul_31, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_36, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_36 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_37 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_37, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_32 = paddle._C_ops.matmul(layer_norm_24, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_38 = paddle._C_ops.add(matmul_32, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_16 = paddle._C_ops.reshape(add_38, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_16 = paddle._C_ops.transpose(reshape_16, [0, 2, 1, 3]) + del reshape_16 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_33 = paddle._C_ops.matmul(layer_norm_24, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_39 = paddle._C_ops.add(matmul_33, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_34 = paddle._C_ops.matmul(layer_norm_24, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_40 = paddle._C_ops.add(matmul_34, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_17 = paddle._C_ops.reshape(add_39, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_17 = paddle._C_ops.transpose(reshape_17, [0, 2, 1, 3]) + del reshape_17 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_18 = paddle._C_ops.reshape(add_40, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_18 = paddle._C_ops.transpose(reshape_18, [0, 2, 1, 3]) + del reshape_18 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_16, full_5, float("0"), True) + del transpose_16 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_35 = paddle._C_ops.matmul(scale_5, transpose_17, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_41 = paddle._C_ops.add(matmul_35, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_4 = paddle._C_ops.softmax(add_41, -1) + del add_41 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_26, dropout_27 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_4, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_36 = paddle._C_ops.matmul(dropout_26, transpose_18, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_19 = paddle._C_ops.transpose(matmul_36, [0, 2, 1, 3]) + del matmul_36 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_19 = paddle._C_ops.reshape(transpose_19, full_int_array_2) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_37 = paddle._C_ops.matmul(reshape_19, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_42 = paddle._C_ops.add(matmul_37, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_28, dropout_29 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_42, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_42 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_43 = paddle._C_ops.add(layer_norm_24, dropout_28) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_27, layer_norm_28, layer_norm_29 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_43, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_38 = paddle._C_ops.matmul(layer_norm_27, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_44 = paddle._C_ops.add(matmul_38, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_4 = paddle._C_ops.gelu(add_44, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_39 = paddle._C_ops.matmul(gelu_4, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_45 = paddle._C_ops.add(matmul_39, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_30, dropout_31 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_45, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_45 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_46 = paddle._C_ops.add(layer_norm_27, dropout_30) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_30, layer_norm_31, layer_norm_32 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_46, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_40 = paddle._C_ops.matmul(layer_norm_30, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_47 = paddle._C_ops.add(matmul_40, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_20 = paddle._C_ops.reshape(add_47, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_20 = paddle._C_ops.transpose(reshape_20, [0, 2, 1, 3]) + del reshape_20 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_41 = paddle._C_ops.matmul(layer_norm_30, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_48 = paddle._C_ops.add(matmul_41, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_42 = paddle._C_ops.matmul(layer_norm_30, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_49 = paddle._C_ops.add(matmul_42, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_21 = paddle._C_ops.reshape(add_48, full_int_array_1) + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_21 = paddle._C_ops.transpose(reshape_21, [0, 2, 1, 3]) + del reshape_21 + + # pd_op.reshape: (1x21x12x64xf32) <- (1x21x768xf32, 4xi64) + reshape_22 = paddle._C_ops.reshape(add_49, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x21x64xf32) <- (1x21x12x64xf32) + transpose_22 = paddle._C_ops.transpose(reshape_22, [0, 2, 1, 3]) + del reshape_22 + + # pd_op.scale: (1x12x21x64xf32) <- (1x12x21x64xf32, 1xf32) + scale_6 = paddle._C_ops.scale(transpose_20, full_5, float("0"), True) + del transpose_20 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x64xf32, 1x12x21x64xf32) + matmul_43 = paddle._C_ops.matmul(scale_6, transpose_21, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_50 = paddle._C_ops.add(matmul_43, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_5 = paddle._C_ops.softmax(add_50, -1) + del add_50 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_32, dropout_33 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_5, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x64xf32) <- (1x12x21x21xf32, 1x12x21x64xf32) + matmul_44 = paddle._C_ops.matmul(dropout_32, transpose_22, False, False) + + # pd_op.transpose: (1x21x12x64xf32) <- (1x12x21x64xf32) + transpose_23 = paddle._C_ops.transpose(matmul_44, [0, 2, 1, 3]) + del matmul_44 + + # pd_op.reshape: (1x21x768xf32) <- (1x21x12x64xf32, 3xi64) + reshape_23 = paddle._C_ops.reshape(transpose_23, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x768xf32) <- (1x21x768xf32, 768x768xf32) + matmul_45 = paddle._C_ops.matmul(reshape_23, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_51 = paddle._C_ops.add(matmul_45, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_34, dropout_35 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_51, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_51 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_52 = paddle._C_ops.add(layer_norm_30, dropout_34) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_33, layer_norm_34, layer_norm_35 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_52, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x3072xf32) <- (1x21x768xf32, 768x3072xf32) + matmul_46 = paddle._C_ops.matmul(layer_norm_33, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x3072xf32) <- (1x21x3072xf32, 3072xf32) + add_53 = paddle._C_ops.add(matmul_46, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x3072xf32) <- (1x21x3072xf32) + gelu_5 = paddle._C_ops.gelu(add_53, False) + + # pd_op.matmul: (1x21x768xf32) <- (1x21x3072xf32, 3072x768xf32) + matmul_47 = paddle._C_ops.matmul(gelu_5, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 768xf32) + add_54 = paddle._C_ops.add(matmul_47, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x768xf32, 1x21x768xui8) <- (1x21x768xf32, None, 1xf32) + dropout_36, dropout_37 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_54, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_54 + + # pd_op.add: (1x21x768xf32) <- (1x21x768xf32, 1x21x768xf32) + add_55 = paddle._C_ops.add(layer_norm_33, dropout_36) + + # pd_op.layer_norm: (1x21x768xf32, 1x21xf32, 1x21xf32) <- (1x21x768xf32, 768xf32, 768xf32) + layer_norm_36, layer_norm_37, layer_norm_38 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_55, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x768xf32) <- (1x21x768xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_36, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x768xf32) <- (1x768xf32, 768x768xf32) + matmul_48 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x768xf32) <- (1x768xf32, 768xf32) + add_56 = paddle._C_ops.add(matmul_48, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x768xf32) <- (1x768xf32) + tanh_0 = paddle._C_ops.tanh(add_56) + del ( + add_0, + add_1, + add_10, + add_11, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_21, + add_22, + add_25, + add_26, + add_28, + add_29, + add_3, + add_30, + add_31, + add_34, + add_35, + add_37, + add_38, + add_39, + add_4, + add_40, + add_43, + add_44, + add_46, + add_47, + add_48, + add_49, + add_52, + add_53, + add_55, + add_56, + add_7, + add_8, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_15, + assign_16, + assign_17, + assign_18, + assign_19, + assign_2, + assign_20, + assign_21, + assign_22, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_26, + dropout_27, + dropout_28, + dropout_29, + dropout_3, + dropout_30, + dropout_31, + dropout_32, + dropout_33, + dropout_34, + dropout_35, + dropout_36, + dropout_37, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + gelu_4, + gelu_5, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_27, + layer_norm_28, + layer_norm_29, + layer_norm_3, + layer_norm_30, + layer_norm_31, + layer_norm_32, + layer_norm_33, + layer_norm_34, + layer_norm_35, + layer_norm_36, + layer_norm_37, + layer_norm_38, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_33, + matmul_34, + matmul_35, + matmul_37, + matmul_38, + matmul_39, + matmul_40, + matmul_41, + matmul_42, + matmul_43, + matmul_45, + matmul_46, + matmul_47, + matmul_48, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_19, + reshape_23, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + scale_5, + scale_6, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + softmax_4, + softmax_5, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_17, + transpose_18, + transpose_19, + transpose_2, + transpose_21, + transpose_22, + transpose_23, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/utc-medium/weight_meta.py b/paddle_samples/PaddleNLP/utc-medium/weight_meta.py new file mode 100644 index 0000000000..0f554b93b7 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-medium/weight_meta.py @@ -0,0 +1,1127 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [768] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.100408") + max_val = float("0.099764") + mean = float("2.97483e-05") + std = float("0.0200269") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [768] + dtype = "float32" + min_val = float("-0.250038") + max_val = float("0.106982") + mean = float("-0.0339555") + std = float("0.0328745") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [768] + dtype = "float32" + min_val = float("0.125577") + max_val = float("1.02727") + mean = float("0.536906") + std = float("0.0531425") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [768] + dtype = "float32" + min_val = float("-2.57639") + max_val = float("0.582816") + mean = float("-0.0275082") + std = float("0.120935") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [768] + dtype = "float32" + min_val = float("0.416737") + max_val = float("2.00019") + mean = float("0.554987") + std = float("0.101544") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [768] + dtype = "float32" + min_val = float("-0.626342") + max_val = float("0.386492") + mean = float("-0.000998509") + std = float("0.0782111") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [3072, 768] + dtype = "float32" + min_val = float("-0.638687") + max_val = float("1.00828") + mean = float("-2.10327e-06") + std = float("0.0317892") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [3072] + dtype = "float32" + min_val = float("-0.275408") + max_val = float("0.212095") + mean = float("-0.0424984") + std = float("0.0486571") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.289652") + max_val = float("0.460425") + mean = float("0.000130389") + std = float("0.0376235") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [768] + dtype = "float32" + min_val = float("-0.33675") + max_val = float("0.498886") + mean = float("0.00175966") + std = float("0.0714768") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.529125") + max_val = float("0.48352") + mean = float("2.19582e-06") + std = float("0.0451644") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [768] + dtype = "float32" + min_val = float("-0.0713303") + max_val = float("0.0667423") + mean = float("-0.000156122") + std = float("0.0200351") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.323711") + max_val = float("0.250977") + mean = float("-9.2318e-06") + std = float("0.0516578") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [768] + dtype = "float32" + min_val = float("-0.0500643") + max_val = float("0.0186042") + mean = float("-0.000117225") + std = float("0.00298214") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.305625") + max_val = float("0.389552") + mean = float("-1.52695e-05") + std = float("0.0456661") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [768] + dtype = "float32" + min_val = float("-0.521126") + max_val = float("0.549456") + mean = float("-0.00141218") + std = float("0.10909") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.442079") + max_val = float("0.426449") + mean = float("7.90157e-05") + std = float("0.0443556") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [768] + dtype = "float32" + min_val = float("-1.49992") + max_val = float("0.376362") + mean = float("-0.0373322") + std = float("0.0687696") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [768] + dtype = "float32" + min_val = float("0.432619") + max_val = float("1.21757") + mean = float("0.744368") + std = float("0.0500023") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [768] + dtype = "float32" + min_val = float("-1.83616") + max_val = float("0.42252") + mean = float("-0.0297079") + std = float("0.0944339") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [768] + dtype = "float32" + min_val = float("0.489803") + max_val = float("2.11073") + mean = float("0.6143") + std = float("0.0960973") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [768] + dtype = "float32" + min_val = float("-1.03446") + max_val = float("0.532758") + mean = float("-0.000311749") + std = float("0.117198") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [3072, 768] + dtype = "float32" + min_val = float("-5.79582") + max_val = float("0.823666") + mean = float("-2.87465e-05") + std = float("0.0407577") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [3072] + dtype = "float32" + min_val = float("-0.369089") + max_val = float("0.44263") + mean = float("-0.0532068") + std = float("0.0615774") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.572365") + max_val = float("0.500491") + mean = float("8.85947e-05") + std = float("0.0413571") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [768] + dtype = "float32" + min_val = float("-0.108506") + max_val = float("0.169842") + mean = float("0.00122439") + std = float("0.0417937") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.46405") + max_val = float("0.397647") + mean = float("-7.29483e-06") + std = float("0.0458528") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [768] + dtype = "float32" + min_val = float("-0.0970066") + max_val = float("0.0816627") + mean = float("-0.00181925") + std = float("0.023054") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.240471") + max_val = float("0.250304") + mean = float("1.58466e-05") + std = float("0.0503006") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [768] + dtype = "float32" + min_val = float("-0.0042642") + max_val = float("0.00580597") + mean = float("7.96188e-06") + std = float("0.000607467") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.463104") + max_val = float("0.434771") + mean = float("-2.37851e-05") + std = float("0.0455358") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [768] + dtype = "float32" + min_val = float("-0.597701") + max_val = float("0.557275") + mean = float("-0.000339183") + std = float("0.126742") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.264723") + max_val = float("0.280125") + mean = float("1.00544e-05") + std = float("0.0450672") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [768] + dtype = "float32" + min_val = float("-1.37629") + max_val = float("0.28996") + mean = float("-0.0270089") + std = float("0.0605161") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [768] + dtype = "float32" + min_val = float("0.298407") + max_val = float("1.01034") + mean = float("0.708118") + std = float("0.0513017") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [768] + dtype = "float32" + min_val = float("-2.17595") + max_val = float("0.711258") + mean = float("-0.030806") + std = float("0.115833") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [768] + dtype = "float32" + min_val = float("0.495697") + max_val = float("1.34734") + mean = float("0.646722") + std = float("0.0818427") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [768] + dtype = "float32" + min_val = float("-1.01341") + max_val = float("0.457797") + mean = float("-0.000685769") + std = float("0.103598") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [3072, 768] + dtype = "float32" + min_val = float("-2.75898") + max_val = float("0.847321") + mean = float("-1.6719e-05") + std = float("0.045059") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [3072] + dtype = "float32" + min_val = float("-0.428225") + max_val = float("0.436528") + mean = float("-0.0661256") + std = float("0.0698612") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.575507") + max_val = float("0.448389") + mean = float("0.000324736") + std = float("0.045927") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [768] + dtype = "float32" + min_val = float("-0.12387") + max_val = float("0.131") + mean = float("0.000778701") + std = float("0.0397953") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.224458") + max_val = float("0.326409") + mean = float("-8.79566e-06") + std = float("0.0457564") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [768] + dtype = "float32" + min_val = float("-0.105998") + max_val = float("0.109297") + mean = float("-0.000253875") + std = float("0.0275716") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.333495") + max_val = float("0.240219") + mean = float("-2.5332e-05") + std = float("0.048555") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [768] + dtype = "float32" + min_val = float("-0.00532182") + max_val = float("0.00444642") + mean = float("-1.36589e-05") + std = float("0.000669209") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.398708") + max_val = float("0.386883") + mean = float("-1.49492e-05") + std = float("0.0452886") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [768] + dtype = "float32" + min_val = float("-0.645808") + max_val = float("0.444782") + mean = float("-0.00549511") + std = float("0.116388") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.271563") + max_val = float("0.255634") + mean = float("0.000143765") + std = float("0.0444704") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [768] + dtype = "float32" + min_val = float("-1.42829") + max_val = float("0.484513") + mean = float("-0.018908") + std = float("0.0817796") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [768] + dtype = "float32" + min_val = float("0.282995") + max_val = float("0.921629") + mean = float("0.66621") + std = float("0.0488636") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [768] + dtype = "float32" + min_val = float("-2.7346") + max_val = float("0.481669") + mean = float("-0.0187077") + std = float("0.156345") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [768] + dtype = "float32" + min_val = float("0.532693") + max_val = float("1.35831") + mean = float("0.648132") + std = float("0.0831034") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [768] + dtype = "float32" + min_val = float("-0.694974") + max_val = float("0.330952") + mean = float("-0.000268815") + std = float("0.0790567") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.15739") + max_val = float("1.47899") + mean = float("1.14746e-06") + std = float("0.048065") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [3072] + dtype = "float32" + min_val = float("-0.411663") + max_val = float("0.371983") + mean = float("-0.0765532") + std = float("0.073663") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.492099") + max_val = float("0.436977") + mean = float("4.15338e-05") + std = float("0.0485094") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [768] + dtype = "float32" + min_val = float("-0.224624") + max_val = float("0.238074") + mean = float("0.000961501") + std = float("0.0634426") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.212477") + max_val = float("0.245473") + mean = float("3.46192e-06") + std = float("0.0428682") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [768] + dtype = "float32" + min_val = float("-0.252352") + max_val = float("0.396333") + mean = float("0.00290513") + std = float("0.0553399") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.270299") + max_val = float("0.236083") + mean = float("-0.000106585") + std = float("0.0446466") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [768] + dtype = "float32" + min_val = float("-0.0104636") + max_val = float("0.00826251") + mean = float("-1.33894e-06") + std = float("0.000654879") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.440113") + max_val = float("0.440921") + mean = float("-4.46085e-05") + std = float("0.046503") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [768] + dtype = "float32" + min_val = float("-0.622408") + max_val = float("0.494817") + mean = float("-0.000264286") + std = float("0.131533") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.246734") + max_val = float("0.312242") + mean = float("4.38729e-05") + std = float("0.0450959") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [768] + dtype = "float32" + min_val = float("-1.72183") + max_val = float("0.655888") + mean = float("-0.0240071") + std = float("0.0991541") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [768] + dtype = "float32" + min_val = float("0.197591") + max_val = float("0.992034") + mean = float("0.654761") + std = float("0.0442305") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [768] + dtype = "float32" + min_val = float("-3.02657") + max_val = float("0.626958") + mean = float("-0.0123815") + std = float("0.175284") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [768] + dtype = "float32" + min_val = float("0.533579") + max_val = float("1.62655") + mean = float("0.667593") + std = float("0.0900764") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [768] + dtype = "float32" + min_val = float("-0.592158") + max_val = float("0.214761") + mean = float("-0.000178807") + std = float("0.0614712") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.2089") + max_val = float("1.64894") + mean = float("-8.54595e-06") + std = float("0.0482231") + data = None + + +class Program_weight_tensor_parameter_72: + name = "parameter_72" + shape = [3072] + dtype = "float32" + min_val = float("-0.481237") + max_val = float("0.335527") + mean = float("-0.0865648") + std = float("0.0677103") + data = None + + +class Program_weight_tensor_parameter_73: + name = "parameter_73" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.405961") + max_val = float("0.456373") + mean = float("-5.85047e-05") + std = float("0.049556") + data = None + + +class Program_weight_tensor_parameter_74: + name = "parameter_74" + shape = [768] + dtype = "float32" + min_val = float("-0.228998") + max_val = float("0.265246") + mean = float("0.000102893") + std = float("0.0733189") + data = None + + +class Program_weight_tensor_parameter_75: + name = "parameter_75" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.331733") + max_val = float("0.308074") + mean = float("-1.29346e-05") + std = float("0.0371112") + data = None + + +class Program_weight_tensor_parameter_76: + name = "parameter_76" + shape = [768] + dtype = "float32" + min_val = float("-0.461625") + max_val = float("0.264012") + mean = float("-0.00140254") + std = float("0.0517099") + data = None + + +class Program_weight_tensor_parameter_77: + name = "parameter_77" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.205374") + max_val = float("0.200411") + mean = float("2.41871e-05") + std = float("0.0377811") + data = None + + +class Program_weight_tensor_parameter_78: + name = "parameter_78" + shape = [768] + dtype = "float32" + min_val = float("-0.00174988") + max_val = float("0.00240397") + mean = float("5.63395e-06") + std = float("0.000305214") + data = None + + +class Program_weight_tensor_parameter_79: + name = "parameter_79" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.463632") + max_val = float("0.416874") + mean = float("4.27704e-05") + std = float("0.0488578") + data = None + + +class Program_weight_tensor_parameter_80: + name = "parameter_80" + shape = [768] + dtype = "float32" + min_val = float("-0.880112") + max_val = float("0.810956") + mean = float("0.00558201") + std = float("0.190634") + data = None + + +class Program_weight_tensor_parameter_81: + name = "parameter_81" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.300723") + max_val = float("0.320481") + mean = float("-0.000104635") + std = float("0.047917") + data = None + + +class Program_weight_tensor_parameter_82: + name = "parameter_82" + shape = [768] + dtype = "float32" + min_val = float("-2.19982") + max_val = float("0.395055") + mean = float("-0.0230541") + std = float("0.113709") + data = None + + +class Program_weight_tensor_parameter_83: + name = "parameter_83" + shape = [768] + dtype = "float32" + min_val = float("0.32642") + max_val = float("0.956967") + mean = float("0.72485") + std = float("0.04763") + data = None + + +class Program_weight_tensor_parameter_84: + name = "parameter_84" + shape = [768] + dtype = "float32" + min_val = float("-3.68721") + max_val = float("1.00411") + mean = float("-0.00852231") + std = float("0.242641") + data = None + + +class Program_weight_tensor_parameter_85: + name = "parameter_85" + shape = [768] + dtype = "float32" + min_val = float("0.599653") + max_val = float("1.82416") + mean = float("0.720409") + std = float("0.0731884") + data = None + + +class Program_weight_tensor_parameter_86: + name = "parameter_86" + shape = [768] + dtype = "float32" + min_val = float("-0.337727") + max_val = float("0.312317") + mean = float("-9.20971e-05") + std = float("0.0626828") + data = None + + +class Program_weight_tensor_parameter_87: + name = "parameter_87" + shape = [3072, 768] + dtype = "float32" + min_val = float("-1.56985") + max_val = float("1.09216") + mean = float("-6.79146e-06") + std = float("0.0454104") + data = None + + +class Program_weight_tensor_parameter_88: + name = "parameter_88" + shape = [3072] + dtype = "float32" + min_val = float("-0.472336") + max_val = float("0.344786") + mean = float("-0.0944871") + std = float("0.0671974") + data = None + + +class Program_weight_tensor_parameter_89: + name = "parameter_89" + shape = [768, 3072] + dtype = "float32" + min_val = float("-0.390413") + max_val = float("0.332457") + mean = float("-7.91497e-05") + std = float("0.0457802") + data = None + + +class Program_weight_tensor_parameter_90: + name = "parameter_90" + shape = [768] + dtype = "float32" + min_val = float("-0.390223") + max_val = float("0.22281") + mean = float("8.62622e-05") + std = float("0.0878316") + data = None + + +class Program_weight_tensor_parameter_91: + name = "parameter_91" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.435161") + max_val = float("0.474658") + mean = float("-9.17532e-06") + std = float("0.0337563") + data = None + + +class Program_weight_tensor_parameter_92: + name = "parameter_92" + shape = [768] + dtype = "float32" + min_val = float("-0.319644") + max_val = float("0.436972") + mean = float("0.00265391") + std = float("0.0675419") + data = None + + +class Program_weight_tensor_parameter_93: + name = "parameter_93" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.281741") + max_val = float("0.280741") + mean = float("-2.6977e-05") + std = float("0.0325813") + data = None + + +class Program_weight_tensor_parameter_94: + name = "parameter_94" + shape = [768] + dtype = "float32" + min_val = float("-0.000870693") + max_val = float("0.000882075") + mean = float("7.52721e-07") + std = float("0.000206196") + data = None + + +class Program_weight_tensor_parameter_95: + name = "parameter_95" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.372594") + max_val = float("0.362902") + mean = float("-1.14159e-06") + std = float("0.0467891") + data = None + + +class Program_weight_tensor_parameter_96: + name = "parameter_96" + shape = [768] + dtype = "float32" + min_val = float("-0.986087") + max_val = float("1.07122") + mean = float("0.0111157") + std = float("0.321341") + data = None + + +class Program_weight_tensor_parameter_97: + name = "parameter_97" + shape = [768, 768] + dtype = "float32" + min_val = float("-0.355893") + max_val = float("0.359506") + mean = float("-1.9428e-05") + std = float("0.0459212") + data = None + + +class Program_weight_tensor_parameter_98: + name = "parameter_98" + shape = [768] + dtype = "float32" + min_val = float("-0.207166") + max_val = float("2.54261") + mean = float("-0.0137193") + std = float("0.113818") + data = None + + +class Program_weight_tensor_parameter_99: + name = "parameter_99" + shape = [768] + dtype = "float32" + min_val = float("0.0941822") + max_val = float("0.850376") + mean = float("0.738505") + std = float("0.043235") + data = None + + +class Program_weight_tensor_parameter_100: + name = "parameter_100" + shape = [4, 768] + dtype = "float32" + min_val = float("-0.887317") + max_val = float("0.178267") + mean = float("-0.000458706") + std = float("0.0409894") + data = None + + +class Program_weight_tensor_parameter_101: + name = "parameter_101" + shape = [2048, 768] + dtype = "float32" + min_val = float("-0.527603") + max_val = float("0.429059") + mean = float("2.90742e-05") + std = float("0.0286756") + data = None + + +class Program_weight_tensor_parameter_102: + name = "parameter_102" + shape = [39981, 768] + dtype = "float32" + min_val = float("-0.907414") + max_val = float("0.429314") + mean = float("5.98717e-06") + std = float("0.0316448") + data = None diff --git a/paddle_samples/PaddleNLP/utc-micro/graph_hash.txt b/paddle_samples/PaddleNLP/utc-micro/graph_hash.txt new file mode 100644 index 0000000000..783280d2bf --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-micro/graph_hash.txt @@ -0,0 +1 @@ +37a88389b1fd630972c3281b79387e59b38b0fe03e108e17025f8e8848927f40 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-micro/graph_net.json b/paddle_samples/PaddleNLP/utc-micro/graph_net.json new file mode 100644 index 0000000000..cb7f873d7a --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-micro/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "utc-micro", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-micro/input_meta.py b/paddle_samples/PaddleNLP/utc-micro/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-micro/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/utc-micro/model.py b/paddle_samples/PaddleNLP/utc-micro/model.py new file mode 100644 index 0000000000..66d1e46228 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-micro/model.py @@ -0,0 +1,1002 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 39981x384xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_70, 0, False) + del data_0, parameter_70 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0, full_2 + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 2048x384xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_69, -1, False) + del parameter_69 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 4x384xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_68, -1, False) + del data_1, parameter_68 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_4 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_64) + del parameter_64 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 32] + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.176777"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_5 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 384] + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_20, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_21 = paddle._C_ops.add(matmul_17, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_22 = paddle._C_ops.add(matmul_18, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_8, full_5, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_19 = paddle._C_ops.matmul(scale_3, transpose_9, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_23 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_23, -1) + del add_23 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_24 = paddle._C_ops.add(matmul_21, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_24, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_24 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_25 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_25, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_26 = paddle._C_ops.add(matmul_22, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_2 = paddle._C_ops.gelu(add_26, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_27 = paddle._C_ops.add(matmul_23, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_27, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_27 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_28 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_28, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_29 = paddle._C_ops.add(matmul_24, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_29, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_30 = paddle._C_ops.add(matmul_25, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_31 = paddle._C_ops.add(matmul_26, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_31, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_12, full_5, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_27 = paddle._C_ops.matmul(scale_4, transpose_13, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_32 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_32, -1) + del add_32 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_33 = paddle._C_ops.add(matmul_29, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_33, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_33 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_34 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_34, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_35 = paddle._C_ops.add(matmul_30, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_3 = paddle._C_ops.gelu(add_35, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_36 = paddle._C_ops.add(matmul_31, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_36, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_36 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_37 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_37, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x384xf32) <- (1x21x384xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_24, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x384xf32) <- (1x384xf32, 384x384xf32) + matmul_32 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x384xf32) <- (1x384xf32, 384xf32) + add_38 = paddle._C_ops.add(matmul_32, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x384xf32) <- (1x384xf32) + tanh_0 = paddle._C_ops.tanh(add_38) + del ( + add_0, + add_1, + add_10, + add_11, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_21, + add_22, + add_25, + add_26, + add_28, + add_29, + add_3, + add_30, + add_31, + add_34, + add_35, + add_37, + add_38, + add_4, + add_7, + add_8, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_2, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_3, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_3, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_2, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/utc-micro/weight_meta.py b/paddle_samples/PaddleNLP/utc-micro/weight_meta.py new file mode 100644 index 0000000000..ad3b140a42 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-micro/weight_meta.py @@ -0,0 +1,775 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [384] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.0868528") + max_val = float("0.084559") + mean = float("-6.10123e-05") + std = float("0.0200599") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [384] + dtype = "float32" + min_val = float("-0.240646") + max_val = float("0.312508") + mean = float("0.0102784") + std = float("0.0512916") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [384] + dtype = "float32" + min_val = float("0.337628") + max_val = float("1.0406") + mean = float("0.70612") + std = float("0.069387") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [384] + dtype = "float32" + min_val = float("-1.24373") + max_val = float("1.13126") + mean = float("0.0238952") + std = float("0.141707") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [384] + dtype = "float32" + min_val = float("0.338383") + max_val = float("1.328") + mean = float("0.507814") + std = float("0.131045") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [384] + dtype = "float32" + min_val = float("-0.415064") + max_val = float("0.400462") + mean = float("-0.000267592") + std = float("0.069139") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [1536, 384] + dtype = "float32" + min_val = float("-0.700093") + max_val = float("0.567645") + mean = float("-4.2248e-05") + std = float("0.0518452") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [1536] + dtype = "float32" + min_val = float("-0.326438") + max_val = float("0.255944") + mean = float("-0.0341458") + std = float("0.0722364") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.350159") + max_val = float("0.364675") + mean = float("-0.000269193") + std = float("0.0521359") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [384] + dtype = "float32" + min_val = float("-0.397852") + max_val = float("0.277902") + mean = float("0.000746915") + std = float("0.0956305") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.340329") + max_val = float("0.386105") + mean = float("4.16132e-05") + std = float("0.0742603") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [384] + dtype = "float32" + min_val = float("-0.057887") + max_val = float("0.0687698") + mean = float("-0.00111387") + std = float("0.019784") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.363701") + max_val = float("0.374288") + mean = float("-1.39916e-05") + std = float("0.0768361") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [384] + dtype = "float32" + min_val = float("-0.0210559") + max_val = float("0.0122425") + mean = float("-7.9265e-05") + std = float("0.00323737") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.377401") + max_val = float("0.35892") + mean = float("-4.82986e-05") + std = float("0.0526574") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [384] + dtype = "float32" + min_val = float("-0.654567") + max_val = float("0.660981") + mean = float("-0.00195796") + std = float("0.197622") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.317841") + max_val = float("0.297425") + mean = float("-1.96017e-05") + std = float("0.0520414") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [384] + dtype = "float32" + min_val = float("-1.02355") + max_val = float("1.23307") + mean = float("0.0206064") + std = float("0.11133") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [384] + dtype = "float32" + min_val = float("0.50621") + max_val = float("1.48514") + mean = float("0.902145") + std = float("0.0762886") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [384] + dtype = "float32" + min_val = float("-1.82083") + max_val = float("1.86675") + mean = float("0.0221257") + std = float("0.161807") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [384] + dtype = "float32" + min_val = float("0.47145") + max_val = float("1.26105") + mean = float("0.603574") + std = float("0.0849736") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [384] + dtype = "float32" + min_val = float("-0.288187") + max_val = float("0.244834") + mean = float("-0.000332521") + std = float("0.0750294") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [1536, 384] + dtype = "float32" + min_val = float("-0.965382") + max_val = float("3.98251") + mean = float("-1.20075e-05") + std = float("0.0602848") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [1536] + dtype = "float32" + min_val = float("-0.426501") + max_val = float("0.504579") + mean = float("-0.0517021") + std = float("0.0823297") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.686235") + max_val = float("0.716697") + mean = float("-0.000232298") + std = float("0.057083") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [384] + dtype = "float32" + min_val = float("-0.195773") + max_val = float("0.176597") + mean = float("0.000698491") + std = float("0.0636828") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.335802") + max_val = float("0.331509") + mean = float("-1.46458e-05") + std = float("0.0671557") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [384] + dtype = "float32" + min_val = float("-0.164288") + max_val = float("0.16361") + mean = float("0.00246613") + std = float("0.0356926") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.343177") + max_val = float("0.361789") + mean = float("1.14134e-06") + std = float("0.071588") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [384] + dtype = "float32" + min_val = float("-0.0167669") + max_val = float("0.00697731") + mean = float("-6.06622e-05") + std = float("0.00230846") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.467888") + max_val = float("0.383036") + mean = float("-6.31831e-06") + std = float("0.0525475") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [384] + dtype = "float32" + min_val = float("-0.585628") + max_val = float("0.60159") + mean = float("-0.00327858") + std = float("0.168216") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.233831") + max_val = float("0.244092") + mean = float("2.30283e-05") + std = float("0.0519435") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [384] + dtype = "float32" + min_val = float("-0.777819") + max_val = float("1.29214") + mean = float("0.0131474") + std = float("0.105737") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [384] + dtype = "float32" + min_val = float("0.508553") + max_val = float("1.29293") + mean = float("0.901613") + std = float("0.0701926") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [384] + dtype = "float32" + min_val = float("-2.35588") + max_val = float("2.37617") + mean = float("0.0179349") + std = float("0.22337") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [384] + dtype = "float32" + min_val = float("0.51566") + max_val = float("1.49192") + mean = float("0.66296") + std = float("0.100032") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [384] + dtype = "float32" + min_val = float("-0.38189") + max_val = float("0.220788") + mean = float("-0.001017") + std = float("0.0798095") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [1536, 384] + dtype = "float32" + min_val = float("-0.805448") + max_val = float("1.70778") + mean = float("-9.25836e-05") + std = float("0.0653069") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [1536] + dtype = "float32" + min_val = float("-0.56058") + max_val = float("0.464583") + mean = float("-0.0825432") + std = float("0.0991611") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.417061") + max_val = float("0.490507") + mean = float("-0.000217915") + std = float("0.0615543") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [384] + dtype = "float32" + min_val = float("-0.186593") + max_val = float("0.176967") + mean = float("0.000721439") + std = float("0.06529") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.346904") + max_val = float("0.311662") + mean = float("2.74669e-05") + std = float("0.061564") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [384] + dtype = "float32" + min_val = float("-0.175393") + max_val = float("0.306544") + mean = float("0.00116522") + std = float("0.0370074") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.342072") + max_val = float("0.314652") + mean = float("-4.6802e-05") + std = float("0.0644853") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [384] + dtype = "float32" + min_val = float("-0.00368663") + max_val = float("0.0059404") + mean = float("-2.82553e-06") + std = float("0.000863015") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.585066") + max_val = float("0.704449") + mean = float("5.45426e-05") + std = float("0.0539332") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [384] + dtype = "float32" + min_val = float("-0.50114") + max_val = float("0.531157") + mean = float("0.0182671") + std = float("0.161578") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.331881") + max_val = float("0.351234") + mean = float("4.82559e-05") + std = float("0.0519896") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [384] + dtype = "float32" + min_val = float("-0.894638") + max_val = float("1.08827") + mean = float("0.00498802") + std = float("0.124056") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [384] + dtype = "float32" + min_val = float("0.560524") + max_val = float("1.07137") + mean = float("0.907604") + std = float("0.0680256") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [384] + dtype = "float32" + min_val = float("-3.73015") + max_val = float("3.53331") + mean = float("0.00599193") + std = float("0.333366") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [384] + dtype = "float32" + min_val = float("0.663857") + max_val = float("1.59182") + mean = float("0.826378") + std = float("0.0834019") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [384] + dtype = "float32" + min_val = float("-0.217625") + max_val = float("0.153144") + mean = float("-0.000225682") + std = float("0.0476677") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [1536, 384] + dtype = "float32" + min_val = float("-0.642101") + max_val = float("1.36791") + mean = float("-0.000122597") + std = float("0.0555642") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [1536] + dtype = "float32" + min_val = float("-0.748716") + max_val = float("0.161776") + mean = float("-0.106144") + std = float("0.112625") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.348056") + max_val = float("0.400669") + mean = float("0.000113009") + std = float("0.0562808") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [384] + dtype = "float32" + min_val = float("-0.313085") + max_val = float("0.267738") + mean = float("0.000567269") + std = float("0.104061") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.313892") + max_val = float("0.360814") + mean = float("-2.04738e-05") + std = float("0.049637") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [384] + dtype = "float32" + min_val = float("-0.335085") + max_val = float("0.530634") + mean = float("0.0094351") + std = float("0.0931919") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.244159") + max_val = float("0.274967") + mean = float("6.0064e-05") + std = float("0.0481336") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [384] + dtype = "float32" + min_val = float("-0.0018839") + max_val = float("0.00178952") + mean = float("-2.0565e-05") + std = float("0.000461505") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.412865") + max_val = float("0.447721") + mean = float("1.91238e-05") + std = float("0.0587388") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [384] + dtype = "float32" + min_val = float("-0.850165") + max_val = float("0.964736") + mean = float("-0.013819") + std = float("0.332531") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.278754") + max_val = float("0.320073") + mean = float("2.0699e-05") + std = float("0.0568896") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [384] + dtype = "float32" + min_val = float("-1.27432") + max_val = float("1.50525") + mean = float("-0.000713325") + std = float("0.122629") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [384] + dtype = "float32" + min_val = float("0.283128") + max_val = float("1.09641") + mean = float("0.913866") + std = float("0.0682545") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [4, 384] + dtype = "float32" + min_val = float("-0.520117") + max_val = float("0.385478") + mean = float("0.000477649") + std = float("0.0394162") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [2048, 384] + dtype = "float32" + min_val = float("-0.218509") + max_val = float("0.624347") + mean = float("2.3539e-05") + std = float("0.0319453") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [39981, 384] + dtype = "float32" + min_val = float("-0.632617") + max_val = float("0.616999") + mean = float("1.25301e-05") + std = float("0.0371955") + data = None diff --git a/paddle_samples/PaddleNLP/utc-mini/graph_hash.txt b/paddle_samples/PaddleNLP/utc-mini/graph_hash.txt new file mode 100644 index 0000000000..1d23e00843 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-mini/graph_hash.txt @@ -0,0 +1 @@ +b41ca68b34d7ffb7543fba0b691f4004da01ba74217bc4397b43c13deed4ba6a \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-mini/graph_net.json b/paddle_samples/PaddleNLP/utc-mini/graph_net.json new file mode 100644 index 0000000000..54b39d438e --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-mini/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "utc-mini", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-mini/input_meta.py b/paddle_samples/PaddleNLP/utc-mini/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-mini/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/utc-mini/model.py b/paddle_samples/PaddleNLP/utc-mini/model.py new file mode 100644 index 0000000000..1f2df9beb7 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-mini/model.py @@ -0,0 +1,1422 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + parameter_72, + parameter_73, + parameter_74, + parameter_75, + parameter_76, + parameter_77, + parameter_78, + parameter_79, + parameter_80, + parameter_81, + parameter_82, + parameter_83, + parameter_84, + parameter_85, + parameter_86, + parameter_87, + parameter_88, + parameter_89, + parameter_90, + parameter_91, + parameter_92, + parameter_93, + parameter_94, + parameter_95, + parameter_96, + parameter_97, + parameter_98, + parameter_99, + parameter_100, + parameter_101, + parameter_102, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 39981x384xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_102, 0, False) + del data_0, parameter_102 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0, full_2 + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 2048x384xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_101, -1, False) + del parameter_101 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x384xf32) <- (1x21xi64, 4x384xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_100, -1, False) + del data_1, parameter_100 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_99, parameter_98, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_98, parameter_99 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_15 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_16 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_17 = full_4 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_97, False, False) + del parameter_97 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_96) + del parameter_96 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 32] + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_95, False, False) + del parameter_95 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_94) + del parameter_94 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_93, False, False) + del parameter_93 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_92) + del parameter_92 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.176777"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_18 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_19 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_20 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_21 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_22 = full_5 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 384] + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_91, False, False) + del parameter_91 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_90) + del parameter_90 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_85, parameter_84, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_84, parameter_85 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_89, False, False) + del parameter_89 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_88) + del parameter_88 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_87, False, False) + del parameter_87 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_86) + del parameter_86 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_83, parameter_82, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_82, parameter_83 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_81, False, False) + del parameter_81 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_80) + del parameter_80 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_79, False, False) + del parameter_79 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_78) + del parameter_78 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_77, False, False) + del parameter_77 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_76) + del parameter_76 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_75, False, False) + del parameter_75 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_74) + del parameter_74 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_69, parameter_68, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_68, parameter_69 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_73, False, False) + del parameter_73 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_72) + del parameter_72 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_71, False, False) + del parameter_71 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_70) + del parameter_70 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_64) + del parameter_64 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_20, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_21 = paddle._C_ops.add(matmul_17, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_22 = paddle._C_ops.add(matmul_18, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_8, full_5, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_19 = paddle._C_ops.matmul(scale_3, transpose_9, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_23 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_23, -1) + del add_23 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_24 = paddle._C_ops.add(matmul_21, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_24, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_24 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_25 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_25, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_26 = paddle._C_ops.add(matmul_22, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_2 = paddle._C_ops.gelu(add_26, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_27 = paddle._C_ops.add(matmul_23, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_27, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_27 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_28 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_28, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_29 = paddle._C_ops.add(matmul_24, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_29, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_30 = paddle._C_ops.add(matmul_25, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_31 = paddle._C_ops.add(matmul_26, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_12, full_5, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_27 = paddle._C_ops.matmul(scale_4, transpose_13, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_32 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_32, -1) + del add_32 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_33 = paddle._C_ops.add(matmul_29, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_33, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_33 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_34 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_34, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_35 = paddle._C_ops.add(matmul_30, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_3 = paddle._C_ops.gelu(add_35, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_36 = paddle._C_ops.add(matmul_31, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_36, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_36 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_37 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_37, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_32 = paddle._C_ops.matmul(layer_norm_24, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_38 = paddle._C_ops.add(matmul_32, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_16 = paddle._C_ops.reshape(add_38, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_16 = paddle._C_ops.transpose(reshape_16, [0, 2, 1, 3]) + del reshape_16 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_33 = paddle._C_ops.matmul(layer_norm_24, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_39 = paddle._C_ops.add(matmul_33, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_34 = paddle._C_ops.matmul(layer_norm_24, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_40 = paddle._C_ops.add(matmul_34, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_17 = paddle._C_ops.reshape(add_39, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_17 = paddle._C_ops.transpose(reshape_17, [0, 2, 1, 3]) + del reshape_17 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_18 = paddle._C_ops.reshape(add_40, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_18 = paddle._C_ops.transpose(reshape_18, [0, 2, 1, 3]) + del reshape_18 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_16, full_5, float("0"), True) + del transpose_16 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_35 = paddle._C_ops.matmul(scale_5, transpose_17, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_41 = paddle._C_ops.add(matmul_35, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_4 = paddle._C_ops.softmax(add_41, -1) + del add_41 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_26, dropout_27 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_4, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_36 = paddle._C_ops.matmul(dropout_26, transpose_18, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_19 = paddle._C_ops.transpose(matmul_36, [0, 2, 1, 3]) + del matmul_36 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_19 = paddle._C_ops.reshape(transpose_19, full_int_array_2) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_37 = paddle._C_ops.matmul(reshape_19, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_42 = paddle._C_ops.add(matmul_37, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_28, dropout_29 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_42, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_42 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_43 = paddle._C_ops.add(layer_norm_24, dropout_28) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_27, layer_norm_28, layer_norm_29 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_43, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_38 = paddle._C_ops.matmul(layer_norm_27, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_44 = paddle._C_ops.add(matmul_38, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_4 = paddle._C_ops.gelu(add_44, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_39 = paddle._C_ops.matmul(gelu_4, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_45 = paddle._C_ops.add(matmul_39, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_30, dropout_31 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_45, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_45 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_46 = paddle._C_ops.add(layer_norm_27, dropout_30) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_30, layer_norm_31, layer_norm_32 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_46, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_40 = paddle._C_ops.matmul(layer_norm_30, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_47 = paddle._C_ops.add(matmul_40, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_20 = paddle._C_ops.reshape(add_47, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_20 = paddle._C_ops.transpose(reshape_20, [0, 2, 1, 3]) + del reshape_20 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_41 = paddle._C_ops.matmul(layer_norm_30, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_48 = paddle._C_ops.add(matmul_41, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_42 = paddle._C_ops.matmul(layer_norm_30, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_49 = paddle._C_ops.add(matmul_42, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_21 = paddle._C_ops.reshape(add_48, full_int_array_1) + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_21 = paddle._C_ops.transpose(reshape_21, [0, 2, 1, 3]) + del reshape_21 + + # pd_op.reshape: (1x21x12x32xf32) <- (1x21x384xf32, 4xi64) + reshape_22 = paddle._C_ops.reshape(add_49, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x21x32xf32) <- (1x21x12x32xf32) + transpose_22 = paddle._C_ops.transpose(reshape_22, [0, 2, 1, 3]) + del reshape_22 + + # pd_op.scale: (1x12x21x32xf32) <- (1x12x21x32xf32, 1xf32) + scale_6 = paddle._C_ops.scale(transpose_20, full_5, float("0"), True) + del transpose_20 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x32xf32, 1x12x21x32xf32) + matmul_43 = paddle._C_ops.matmul(scale_6, transpose_21, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_50 = paddle._C_ops.add(matmul_43, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_5 = paddle._C_ops.softmax(add_50, -1) + del add_50 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_32, dropout_33 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_5, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x32xf32) <- (1x12x21x21xf32, 1x12x21x32xf32) + matmul_44 = paddle._C_ops.matmul(dropout_32, transpose_22, False, False) + + # pd_op.transpose: (1x21x12x32xf32) <- (1x12x21x32xf32) + transpose_23 = paddle._C_ops.transpose(matmul_44, [0, 2, 1, 3]) + del matmul_44 + + # pd_op.reshape: (1x21x384xf32) <- (1x21x12x32xf32, 3xi64) + reshape_23 = paddle._C_ops.reshape(transpose_23, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x384xf32) <- (1x21x384xf32, 384x384xf32) + matmul_45 = paddle._C_ops.matmul(reshape_23, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_51 = paddle._C_ops.add(matmul_45, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_34, dropout_35 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_51, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_51 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_52 = paddle._C_ops.add(layer_norm_30, dropout_34) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_33, layer_norm_34, layer_norm_35 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_52, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x1536xf32) <- (1x21x384xf32, 384x1536xf32) + matmul_46 = paddle._C_ops.matmul(layer_norm_33, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x1536xf32) <- (1x21x1536xf32, 1536xf32) + add_53 = paddle._C_ops.add(matmul_46, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x1536xf32) <- (1x21x1536xf32) + gelu_5 = paddle._C_ops.gelu(add_53, False) + + # pd_op.matmul: (1x21x384xf32) <- (1x21x1536xf32, 1536x384xf32) + matmul_47 = paddle._C_ops.matmul(gelu_5, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 384xf32) + add_54 = paddle._C_ops.add(matmul_47, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x384xf32, 1x21x384xui8) <- (1x21x384xf32, None, 1xf32) + dropout_36, dropout_37 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_54, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_54 + + # pd_op.add: (1x21x384xf32) <- (1x21x384xf32, 1x21x384xf32) + add_55 = paddle._C_ops.add(layer_norm_33, dropout_36) + + # pd_op.layer_norm: (1x21x384xf32, 1x21xf32, 1x21xf32) <- (1x21x384xf32, 384xf32, 384xf32) + layer_norm_36, layer_norm_37, layer_norm_38 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_55, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x384xf32) <- (1x21x384xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_36, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x384xf32) <- (1x384xf32, 384x384xf32) + matmul_48 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x384xf32) <- (1x384xf32, 384xf32) + add_56 = paddle._C_ops.add(matmul_48, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x384xf32) <- (1x384xf32) + tanh_0 = paddle._C_ops.tanh(add_56) + del ( + add_0, + add_1, + add_10, + add_11, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_21, + add_22, + add_25, + add_26, + add_28, + add_29, + add_3, + add_30, + add_31, + add_34, + add_35, + add_37, + add_38, + add_39, + add_4, + add_40, + add_43, + add_44, + add_46, + add_47, + add_48, + add_49, + add_52, + add_53, + add_55, + add_56, + add_7, + add_8, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_15, + assign_16, + assign_17, + assign_18, + assign_19, + assign_2, + assign_20, + assign_21, + assign_22, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_26, + dropout_27, + dropout_28, + dropout_29, + dropout_3, + dropout_30, + dropout_31, + dropout_32, + dropout_33, + dropout_34, + dropout_35, + dropout_36, + dropout_37, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + gelu_4, + gelu_5, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_27, + layer_norm_28, + layer_norm_29, + layer_norm_3, + layer_norm_30, + layer_norm_31, + layer_norm_32, + layer_norm_33, + layer_norm_34, + layer_norm_35, + layer_norm_36, + layer_norm_37, + layer_norm_38, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_33, + matmul_34, + matmul_35, + matmul_37, + matmul_38, + matmul_39, + matmul_40, + matmul_41, + matmul_42, + matmul_43, + matmul_45, + matmul_46, + matmul_47, + matmul_48, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_19, + reshape_23, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + scale_5, + scale_6, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + softmax_4, + softmax_5, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_17, + transpose_18, + transpose_19, + transpose_2, + transpose_21, + transpose_22, + transpose_23, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/utc-mini/weight_meta.py b/paddle_samples/PaddleNLP/utc-mini/weight_meta.py new file mode 100644 index 0000000000..43e0480d12 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-mini/weight_meta.py @@ -0,0 +1,1127 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [384] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.101683") + max_val = float("0.0839571") + mean = float("-1.26937e-05") + std = float("0.0199923") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [384] + dtype = "float32" + min_val = float("-0.172192") + max_val = float("0.251711") + mean = float("-0.00336861") + std = float("0.0440572") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [384] + dtype = "float32" + min_val = float("0.44819") + max_val = float("1.04249") + mean = float("0.730205") + std = float("0.0603769") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [384] + dtype = "float32" + min_val = float("-1.38361") + max_val = float("1.3243") + mean = float("0.0196256") + std = float("0.119287") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [384] + dtype = "float32" + min_val = float("0.461917") + max_val = float("1.33497") + mean = float("0.596088") + std = float("0.121354") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [384] + dtype = "float32" + min_val = float("-0.40322") + max_val = float("0.405667") + mean = float("-0.000170439") + std = float("0.063385") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [1536, 384] + dtype = "float32" + min_val = float("-0.588513") + max_val = float("0.58377") + mean = float("2.49837e-05") + std = float("0.0470846") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [1536] + dtype = "float32" + min_val = float("-0.286867") + max_val = float("0.209362") + mean = float("-0.0289342") + std = float("0.0566357") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.300037") + max_val = float("0.373753") + mean = float("0.000311759") + std = float("0.0497359") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [384] + dtype = "float32" + min_val = float("-0.359621") + max_val = float("0.341715") + mean = float("-0.00453144") + std = float("0.0961481") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.329643") + max_val = float("0.333759") + mean = float("7.4529e-05") + std = float("0.0646582") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [384] + dtype = "float32" + min_val = float("-0.0585493") + max_val = float("0.0712394") + mean = float("1.40564e-05") + std = float("0.0181636") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.330991") + max_val = float("0.315234") + mean = float("4.91953e-05") + std = float("0.069529") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [384] + dtype = "float32" + min_val = float("-0.010775") + max_val = float("0.014468") + mean = float("7.04353e-05") + std = float("0.00237174") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.284357") + max_val = float("0.296931") + mean = float("2.0549e-05") + std = float("0.0542902") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [384] + dtype = "float32" + min_val = float("-0.460529") + max_val = float("0.469384") + mean = float("0.00220666") + std = float("0.158679") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.353106") + max_val = float("0.339521") + mean = float("0.000104621") + std = float("0.0539286") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [384] + dtype = "float32" + min_val = float("-0.989916") + max_val = float("1.40692") + mean = float("0.0237002") + std = float("0.110404") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [384] + dtype = "float32" + min_val = float("0.549164") + max_val = float("1.57255") + mean = float("0.917489") + std = float("0.0708043") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [384] + dtype = "float32" + min_val = float("-0.757596") + max_val = float("1.20616") + mean = float("0.0264293") + std = float("0.10177") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [384] + dtype = "float32" + min_val = float("0.531009") + max_val = float("1.68892") + mean = float("0.677746") + std = float("0.104105") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [384] + dtype = "float32" + min_val = float("-0.320595") + max_val = float("0.424408") + mean = float("-4.62187e-05") + std = float("0.0892558") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [1536, 384] + dtype = "float32" + min_val = float("-2.6821") + max_val = float("3.99833") + mean = float("-1.11507e-05") + std = float("0.0535264") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [1536] + dtype = "float32" + min_val = float("-0.388539") + max_val = float("0.222306") + mean = float("-0.0468099") + std = float("0.0644349") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.536196") + max_val = float("0.652742") + mean = float("4.29918e-05") + std = float("0.0527017") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [384] + dtype = "float32" + min_val = float("-0.123734") + max_val = float("0.142247") + mean = float("-0.000187243") + std = float("0.0470937") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.700245") + max_val = float("0.833686") + mean = float("2.46595e-05") + std = float("0.0617693") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [384] + dtype = "float32" + min_val = float("-0.0721702") + max_val = float("0.0877271") + mean = float("0.000580043") + std = float("0.0217204") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.287703") + max_val = float("0.30402") + mean = float("5.90119e-05") + std = float("0.0653578") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [384] + dtype = "float32" + min_val = float("-0.00816751") + max_val = float("0.0102991") + mean = float("8.94176e-05") + std = float("0.00134746") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.283706") + max_val = float("0.306195") + mean = float("5.70338e-05") + std = float("0.0539181") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [384] + dtype = "float32" + min_val = float("-0.390775") + max_val = float("0.390248") + mean = float("-0.0113225") + std = float("0.132297") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.238336") + max_val = float("0.265407") + mean = float("-0.000209967") + std = float("0.054144") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [384] + dtype = "float32" + min_val = float("-0.28105") + max_val = float("1.02054") + mean = float("0.0203077") + std = float("0.072047") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [384] + dtype = "float32" + min_val = float("0.616272") + max_val = float("1.12737") + mean = float("0.938546") + std = float("0.0545803") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [384] + dtype = "float32" + min_val = float("-0.696708") + max_val = float("1.6625") + mean = float("0.0202946") + std = float("0.122215") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [384] + dtype = "float32" + min_val = float("0.607064") + max_val = float("1.36651") + mean = float("0.740434") + std = float("0.0826739") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [384] + dtype = "float32" + min_val = float("-0.225838") + max_val = float("0.361102") + mean = float("0.000468136") + std = float("0.0846432") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [1536, 384] + dtype = "float32" + min_val = float("-1.40433") + max_val = float("1.5572") + mean = float("1.98089e-05") + std = float("0.0566384") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [1536] + dtype = "float32" + min_val = float("-0.38987") + max_val = float("0.269932") + mean = float("-0.0617265") + std = float("0.073597") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.516755") + max_val = float("0.607181") + mean = float("-6.00625e-05") + std = float("0.0555937") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [384] + dtype = "float32" + min_val = float("-0.17558") + max_val = float("0.185831") + mean = float("-0.000147652") + std = float("0.0625668") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.332465") + max_val = float("0.298849") + mean = float("2.82351e-05") + std = float("0.0613417") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [384] + dtype = "float32" + min_val = float("-0.132483") + max_val = float("0.216082") + mean = float("0.00305651") + std = float("0.0281338") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.302451") + max_val = float("0.317348") + mean = float("1.74277e-05") + std = float("0.06564") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [384] + dtype = "float32" + min_val = float("-0.0055914") + max_val = float("0.00484078") + mean = float("2.6251e-05") + std = float("0.00103886") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.284339") + max_val = float("0.292728") + mean = float("-4.74098e-05") + std = float("0.0529396") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [384] + dtype = "float32" + min_val = float("-0.459203") + max_val = float("0.448871") + mean = float("-0.00431505") + std = float("0.148347") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.25709") + max_val = float("0.314753") + mean = float("3.24333e-06") + std = float("0.052596") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [384] + dtype = "float32" + min_val = float("-0.269894") + max_val = float("1.13583") + mean = float("0.00773097") + std = float("0.081264") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [384] + dtype = "float32" + min_val = float("0.422273") + max_val = float("1.14198") + mean = float("0.918961") + std = float("0.0754118") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [384] + dtype = "float32" + min_val = float("-0.778403") + max_val = float("1.87609") + mean = float("0.0155292") + std = float("0.152842") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [384] + dtype = "float32" + min_val = float("0.616487") + max_val = float("1.37692") + mean = float("0.762301") + std = float("0.0889278") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [384] + dtype = "float32" + min_val = float("-0.320638") + max_val = float("0.322712") + mean = float("-0.00075365") + std = float("0.0766248") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [1536, 384] + dtype = "float32" + min_val = float("-1.43622") + max_val = float("0.699858") + mean = float("-2.53726e-05") + std = float("0.0602106") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [1536] + dtype = "float32" + min_val = float("-0.430917") + max_val = float("0.242104") + mean = float("-0.0811268") + std = float("0.0905956") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.419304") + max_val = float("0.376137") + mean = float("-0.000214876") + std = float("0.0580273") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [384] + dtype = "float32" + min_val = float("-0.14193") + max_val = float("0.122034") + mean = float("-0.000955827") + std = float("0.0460719") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.297892") + max_val = float("0.304839") + mean = float("-1.67907e-05") + std = float("0.0523299") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [384] + dtype = "float32" + min_val = float("-0.162595") + max_val = float("0.15324") + mean = float("-0.000890762") + std = float("0.0324195") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.305076") + max_val = float("0.275936") + mean = float("-8.97071e-05") + std = float("0.0557531") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [384] + dtype = "float32" + min_val = float("-0.00179544") + max_val = float("0.00229217") + mean = float("3.35024e-05") + std = float("0.000426121") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.449025") + max_val = float("0.430603") + mean = float("-1.48216e-05") + std = float("0.0552368") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [384] + dtype = "float32" + min_val = float("-0.465313") + max_val = float("0.486114") + mean = float("-0.0100473") + std = float("0.134453") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.257097") + max_val = float("0.261228") + mean = float("-0.00011705") + std = float("0.0545112") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [384] + dtype = "float32" + min_val = float("-0.446379") + max_val = float("1.0075") + mean = float("0.00922821") + std = float("0.0914987") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [384] + dtype = "float32" + min_val = float("0.671904") + max_val = float("1.13399") + mean = float("0.967405") + std = float("0.0577597") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [384] + dtype = "float32" + min_val = float("-1.25057") + max_val = float("2.28482") + mean = float("0.0030069") + std = float("0.156095") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [384] + dtype = "float32" + min_val = float("0.767562") + max_val = float("1.60682") + mean = float("0.905788") + std = float("0.079967") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [384] + dtype = "float32" + min_val = float("-0.0933494") + max_val = float("0.0999857") + mean = float("-8.7775e-05") + std = float("0.0321199") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [1536, 384] + dtype = "float32" + min_val = float("-0.718978") + max_val = float("0.719045") + mean = float("-1.63185e-06") + std = float("0.0535942") + data = None + + +class Program_weight_tensor_parameter_72: + name = "parameter_72" + shape = [1536] + dtype = "float32" + min_val = float("-0.677618") + max_val = float("0.302011") + mean = float("-0.0909856") + std = float("0.0965587") + data = None + + +class Program_weight_tensor_parameter_73: + name = "parameter_73" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.318892") + max_val = float("0.369657") + mean = float("0.000108254") + std = float("0.0558016") + data = None + + +class Program_weight_tensor_parameter_74: + name = "parameter_74" + shape = [384] + dtype = "float32" + min_val = float("-0.292567") + max_val = float("0.283847") + mean = float("-0.00079329") + std = float("0.10353") + data = None + + +class Program_weight_tensor_parameter_75: + name = "parameter_75" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.355823") + max_val = float("0.227448") + mean = float("9.75147e-06") + std = float("0.045444") + data = None + + +class Program_weight_tensor_parameter_76: + name = "parameter_76" + shape = [384] + dtype = "float32" + min_val = float("-0.134211") + max_val = float("0.132215") + mean = float("-3.80186e-05") + std = float("0.0338807") + data = None + + +class Program_weight_tensor_parameter_77: + name = "parameter_77" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.250366") + max_val = float("0.253505") + mean = float("-3.7957e-05") + std = float("0.0473574") + data = None + + +class Program_weight_tensor_parameter_78: + name = "parameter_78" + shape = [384] + dtype = "float32" + min_val = float("-0.00292311") + max_val = float("0.00238207") + mean = float("-7.3997e-06") + std = float("0.000412252") + data = None + + +class Program_weight_tensor_parameter_79: + name = "parameter_79" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.402503") + max_val = float("0.419668") + mean = float("-3.11487e-06") + std = float("0.0560666") + data = None + + +class Program_weight_tensor_parameter_80: + name = "parameter_80" + shape = [384] + dtype = "float32" + min_val = float("-0.657866") + max_val = float("0.545025") + mean = float("-0.00598146") + std = float("0.179846") + data = None + + +class Program_weight_tensor_parameter_81: + name = "parameter_81" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.326365") + max_val = float("0.311336") + mean = float("-6.06179e-05") + std = float("0.0551595") + data = None + + +class Program_weight_tensor_parameter_82: + name = "parameter_82" + shape = [384] + dtype = "float32" + min_val = float("-0.903886") + max_val = float("1.57393") + mean = float("0.0096397") + std = float("0.111348") + data = None + + +class Program_weight_tensor_parameter_83: + name = "parameter_83" + shape = [384] + dtype = "float32" + min_val = float("0.751895") + max_val = float("1.0356") + mean = float("0.932014") + std = float("0.0421121") + data = None + + +class Program_weight_tensor_parameter_84: + name = "parameter_84" + shape = [384] + dtype = "float32" + min_val = float("-2.59768") + max_val = float("3.73145") + mean = float("0.00533021") + std = float("0.273377") + data = None + + +class Program_weight_tensor_parameter_85: + name = "parameter_85" + shape = [384] + dtype = "float32" + min_val = float("0.749395") + max_val = float("1.23139") + mean = float("0.898188") + std = float("0.0608318") + data = None + + +class Program_weight_tensor_parameter_86: + name = "parameter_86" + shape = [384] + dtype = "float32" + min_val = float("-0.131926") + max_val = float("0.154589") + mean = float("9.28105e-05") + std = float("0.04949") + data = None + + +class Program_weight_tensor_parameter_87: + name = "parameter_87" + shape = [1536, 384] + dtype = "float32" + min_val = float("-1.33924") + max_val = float("0.571041") + mean = float("3.18481e-05") + std = float("0.0467584") + data = None + + +class Program_weight_tensor_parameter_88: + name = "parameter_88" + shape = [1536] + dtype = "float32" + min_val = float("-0.721492") + max_val = float("0.178919") + mean = float("-0.101732") + std = float("0.107538") + data = None + + +class Program_weight_tensor_parameter_89: + name = "parameter_89" + shape = [384, 1536] + dtype = "float32" + min_val = float("-0.320568") + max_val = float("0.336431") + mean = float("-2.91802e-05") + std = float("0.0505907") + data = None + + +class Program_weight_tensor_parameter_90: + name = "parameter_90" + shape = [384] + dtype = "float32" + min_val = float("-0.203203") + max_val = float("0.292374") + mean = float("-4.553e-07") + std = float("0.0652117") + data = None + + +class Program_weight_tensor_parameter_91: + name = "parameter_91" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.403206") + max_val = float("0.32955") + mean = float("2.19754e-05") + std = float("0.0442889") + data = None + + +class Program_weight_tensor_parameter_92: + name = "parameter_92" + shape = [384] + dtype = "float32" + min_val = float("-0.368445") + max_val = float("0.22075") + mean = float("-0.000897121") + std = float("0.0619484") + data = None + + +class Program_weight_tensor_parameter_93: + name = "parameter_93" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.210345") + max_val = float("0.210326") + mean = float("2.66166e-05") + std = float("0.0434788") + data = None + + +class Program_weight_tensor_parameter_94: + name = "parameter_94" + shape = [384] + dtype = "float32" + min_val = float("-0.00118559") + max_val = float("0.00114795") + mean = float("3.93487e-06") + std = float("0.000255501") + data = None + + +class Program_weight_tensor_parameter_95: + name = "parameter_95" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.296956") + max_val = float("0.301121") + mean = float("-2.51798e-05") + std = float("0.0552989") + data = None + + +class Program_weight_tensor_parameter_96: + name = "parameter_96" + shape = [384] + dtype = "float32" + min_val = float("-0.877916") + max_val = float("0.830111") + mean = float("-0.0204988") + std = float("0.283187") + data = None + + +class Program_weight_tensor_parameter_97: + name = "parameter_97" + shape = [384, 384] + dtype = "float32" + min_val = float("-0.303427") + max_val = float("0.298674") + mean = float("1.12219e-05") + std = float("0.0546344") + data = None + + +class Program_weight_tensor_parameter_98: + name = "parameter_98" + shape = [384] + dtype = "float32" + min_val = float("-1.71899") + max_val = float("0.425974") + mean = float("0.012693") + std = float("0.111519") + data = None + + +class Program_weight_tensor_parameter_99: + name = "parameter_99" + shape = [384] + dtype = "float32" + min_val = float("0.263663") + max_val = float("1.06575") + mean = float("0.961003") + std = float("0.0511146") + data = None + + +class Program_weight_tensor_parameter_100: + name = "parameter_100" + shape = [4, 384] + dtype = "float32" + min_val = float("-0.101891") + max_val = float("0.587885") + mean = float("0.000341565") + std = float("0.0347423") + data = None + + +class Program_weight_tensor_parameter_101: + name = "parameter_101" + shape = [2048, 384] + dtype = "float32" + min_val = float("-0.589378") + max_val = float("0.343809") + mean = float("-4.74015e-06") + std = float("0.0341129") + data = None + + +class Program_weight_tensor_parameter_102: + name = "parameter_102" + shape = [39981, 384] + dtype = "float32" + min_val = float("-0.589774") + max_val = float("0.531204") + mean = float("-8.69113e-06") + std = float("0.0358079") + data = None diff --git a/paddle_samples/PaddleNLP/utc-nano/graph_hash.txt b/paddle_samples/PaddleNLP/utc-nano/graph_hash.txt new file mode 100644 index 0000000000..032225e4e5 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-nano/graph_hash.txt @@ -0,0 +1 @@ +e2fd3647885ed83d3378b86eca0b60e08c8d4024322d4945a67bd41cb1149626 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-nano/graph_net.json b/paddle_samples/PaddleNLP/utc-nano/graph_net.json new file mode 100644 index 0000000000..52135fd60b --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-nano/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "utc-nano", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-nano/input_meta.py b/paddle_samples/PaddleNLP/utc-nano/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-nano/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/utc-nano/model.py b/paddle_samples/PaddleNLP/utc-nano/model.py new file mode 100644 index 0000000000..3ec6e5d112 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-nano/model.py @@ -0,0 +1,1002 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x312xf32) <- (1x21xi64, 39981x312xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_70, 0, False) + del data_0, parameter_70 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0, full_2 + + # pd_op.embedding: (1x21x312xf32) <- (1x21xi64, 2048x312xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_69, -1, False) + del parameter_69 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x312xf32) <- (1x21xi64, 4x312xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_68, -1, False) + del data_1, parameter_68 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_4 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_64) + del parameter_64 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 12, 26] + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.196116"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_5 + + # pd_op.scale: (1x12x21x26xf32) <- (1x12x21x26xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x26xf32, 1x12x21x26xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x26xf32) <- (1x12x21x21xf32, 1x12x21x26xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x12x26xf32) <- (1x12x21x26xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 312] + + # pd_op.reshape: (1x21x312xf32) <- (1x21x12x26xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x1248xf32) <- (1x21x312xf32, 312x1248xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x1248xf32) <- (1x21x1248xf32, 1248xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x1248xf32) <- (1x21x1248xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x1248xf32, 1248x312xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x12x21x26xf32) <- (1x12x21x26xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x26xf32, 1x12x21x26xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x26xf32) <- (1x12x21x21xf32, 1x12x21x26xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x12x26xf32) <- (1x12x21x26xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x312xf32) <- (1x21x12x26xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x1248xf32) <- (1x21x312xf32, 312x1248xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x1248xf32) <- (1x21x1248xf32, 1248xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x1248xf32) <- (1x21x1248xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x1248xf32, 1248x312xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_20, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_21 = paddle._C_ops.add(matmul_17, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_22 = paddle._C_ops.add(matmul_18, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x12x21x26xf32) <- (1x12x21x26xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_8, full_5, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x26xf32, 1x12x21x26xf32) + matmul_19 = paddle._C_ops.matmul(scale_3, transpose_9, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_23 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_23, -1) + del add_23 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x26xf32) <- (1x12x21x21xf32, 1x12x21x26xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x12x26xf32) <- (1x12x21x26xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x312xf32) <- (1x21x12x26xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_24 = paddle._C_ops.add(matmul_21, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_24, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_24 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_25 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_25, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x1248xf32) <- (1x21x312xf32, 312x1248xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x1248xf32) <- (1x21x1248xf32, 1248xf32) + add_26 = paddle._C_ops.add(matmul_22, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x1248xf32) <- (1x21x1248xf32) + gelu_2 = paddle._C_ops.gelu(add_26, False) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x1248xf32, 1248x312xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_27 = paddle._C_ops.add(matmul_23, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_27, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_27 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_28 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_28, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_29 = paddle._C_ops.add(matmul_24, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_29, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_30 = paddle._C_ops.add(matmul_25, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_31 = paddle._C_ops.add(matmul_26, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x12x26xf32) <- (1x21x312xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_31, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x12x21x26xf32) <- (1x21x12x26xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x12x21x26xf32) <- (1x12x21x26xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_12, full_5, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x12x21x21xf32) <- (1x12x21x26xf32, 1x12x21x26xf32) + matmul_27 = paddle._C_ops.matmul(scale_4, transpose_13, False, True) + + # pd_op.add: (1x12x21x21xf32) <- (1x12x21x21xf32, 1x1x1x21xf32) + add_32 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x12x21x21xf32) <- (1x12x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_32, -1) + del add_32 + + # pd_op.dropout: (1x12x21x21xf32, 1x12x21x21xui8) <- (1x12x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x12x21x26xf32) <- (1x12x21x21xf32, 1x12x21x26xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x12x26xf32) <- (1x12x21x26xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x312xf32) <- (1x21x12x26xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x312xf32) <- (1x21x312xf32, 312x312xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_33 = paddle._C_ops.add(matmul_29, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_33, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_33 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_34 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_34, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x1248xf32) <- (1x21x312xf32, 312x1248xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x1248xf32) <- (1x21x1248xf32, 1248xf32) + add_35 = paddle._C_ops.add(matmul_30, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x1248xf32) <- (1x21x1248xf32) + gelu_3 = paddle._C_ops.gelu(add_35, False) + + # pd_op.matmul: (1x21x312xf32) <- (1x21x1248xf32, 1248x312xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 312xf32) + add_36 = paddle._C_ops.add(matmul_31, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x312xf32, 1x21x312xui8) <- (1x21x312xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_36, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_36 + + # pd_op.add: (1x21x312xf32) <- (1x21x312xf32, 1x21x312xf32) + add_37 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x312xf32, 1x21xf32, 1x21xf32) <- (1x21x312xf32, 312xf32, 312xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_37, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x312xf32) <- (1x21x312xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_24, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x312xf32) <- (1x312xf32, 312x312xf32) + matmul_32 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x312xf32) <- (1x312xf32, 312xf32) + add_38 = paddle._C_ops.add(matmul_32, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x312xf32) <- (1x312xf32) + tanh_0 = paddle._C_ops.tanh(add_38) + del ( + add_0, + add_1, + add_10, + add_11, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_21, + add_22, + add_25, + add_26, + add_28, + add_29, + add_3, + add_30, + add_31, + add_34, + add_35, + add_37, + add_38, + add_4, + add_7, + add_8, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_2, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_3, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + gelu_3, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_3, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_15, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + scale_4, + slice_0, + softmax_0, + softmax_1, + softmax_2, + softmax_3, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_2, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/utc-nano/weight_meta.py b/paddle_samples/PaddleNLP/utc-nano/weight_meta.py new file mode 100644 index 0000000000..736167328e --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-nano/weight_meta.py @@ -0,0 +1,775 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [312] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.0911851") + max_val = float("0.0998664") + mean = float("3.67273e-05") + std = float("0.0199371") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [312] + dtype = "float32" + min_val = float("-0.150006") + max_val = float("0.211364") + mean = float("0.0179674") + std = float("0.0367988") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [312] + dtype = "float32" + min_val = float("0.464189") + max_val = float("0.947595") + mean = float("0.659171") + std = float("0.0699225") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [312] + dtype = "float32" + min_val = float("-1.49678") + max_val = float("1.47565") + mean = float("0.0252314") + std = float("0.203294") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [312] + dtype = "float32" + min_val = float("0.343647") + max_val = float("1.48568") + mean = float("0.55897") + std = float("0.201058") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [312] + dtype = "float32" + min_val = float("-0.219493") + max_val = float("0.231237") + mean = float("-0.00309679") + std = float("0.0675571") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [1248, 312] + dtype = "float32" + min_val = float("-0.721313") + max_val = float("0.774449") + mean = float("-1.69287e-05") + std = float("0.0563938") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [1248] + dtype = "float32" + min_val = float("-0.353092") + max_val = float("0.22971") + mean = float("-0.0564648") + std = float("0.0806126") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [312, 1248] + dtype = "float32" + min_val = float("-0.363129") + max_val = float("0.400522") + mean = float("-0.000494117") + std = float("0.0576538") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [312] + dtype = "float32" + min_val = float("-0.334724") + max_val = float("0.292935") + mean = float("0.00076351") + std = float("0.0909657") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.447344") + max_val = float("0.4468") + mean = float("0.000101176") + std = float("0.0823718") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [312] + dtype = "float32" + min_val = float("-0.113742") + max_val = float("0.0983492") + mean = float("0.00103292") + std = float("0.0243817") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.435533") + max_val = float("0.440482") + mean = float("-0.000284702") + std = float("0.089687") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [312] + dtype = "float32" + min_val = float("-0.00942503") + max_val = float("0.00411445") + mean = float("-8.89898e-05") + std = float("0.00116584") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.351269") + max_val = float("0.338757") + mean = float("-7.83941e-05") + std = float("0.0578056") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [312] + dtype = "float32" + min_val = float("-0.454392") + max_val = float("0.506802") + mean = float("0.000280165") + std = float("0.190309") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.250111") + max_val = float("0.266278") + mean = float("0.000219382") + std = float("0.0554188") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [312] + dtype = "float32" + min_val = float("-0.112385") + max_val = float("0.674414") + mean = float("0.0452658") + std = float("0.0649442") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [312] + dtype = "float32" + min_val = float("0.618468") + max_val = float("1.17084") + mean = float("0.907309") + std = float("0.0642505") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [312] + dtype = "float32" + min_val = float("-0.945897") + max_val = float("2.01682") + mean = float("0.0242805") + std = float("0.154528") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [312] + dtype = "float32" + min_val = float("0.462761") + max_val = float("1.61054") + mean = float("0.666733") + std = float("0.126803") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [312] + dtype = "float32" + min_val = float("-0.154021") + max_val = float("0.159373") + mean = float("-0.000505829") + std = float("0.0472016") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [1248, 312] + dtype = "float32" + min_val = float("-1.57069") + max_val = float("1.53035") + mean = float("2.08124e-05") + std = float("0.0694401") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [1248] + dtype = "float32" + min_val = float("-0.527369") + max_val = float("0.364977") + mean = float("-0.0759544") + std = float("0.0924487") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [312, 1248] + dtype = "float32" + min_val = float("-0.726991") + max_val = float("0.745697") + mean = float("0.000426952") + std = float("0.0654598") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [312] + dtype = "float32" + min_val = float("-0.155461") + max_val = float("0.166581") + mean = float("0.000365796") + std = float("0.0534042") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.417496") + max_val = float("0.360104") + mean = float("-8.03561e-06") + std = float("0.0778355") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [312] + dtype = "float32" + min_val = float("-0.11219") + max_val = float("0.138785") + mean = float("-0.00196892") + std = float("0.0327501") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.393841") + max_val = float("0.384477") + mean = float("-0.000197588") + std = float("0.0831858") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [312] + dtype = "float32" + min_val = float("-0.00398009") + max_val = float("0.00486827") + mean = float("-3.53411e-05") + std = float("0.000834643") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.391252") + max_val = float("0.402147") + mean = float("1.22554e-05") + std = float("0.0572626") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [312] + dtype = "float32" + min_val = float("-0.570386") + max_val = float("0.704534") + mean = float("0.0109258") + std = float("0.186586") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.244494") + max_val = float("0.293417") + mean = float("0.000142064") + std = float("0.0549979") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [312] + dtype = "float32" + min_val = float("-0.322245") + max_val = float("1.1308") + mean = float("0.0273931") + std = float("0.0979677") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [312] + dtype = "float32" + min_val = float("0.539876") + max_val = float("1.13121") + mean = float("0.896351") + std = float("0.0777043") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [312] + dtype = "float32" + min_val = float("-1.51839") + max_val = float("2.28142") + mean = float("0.00845521") + std = float("0.199602") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [312] + dtype = "float32" + min_val = float("0.48069") + max_val = float("1.58475") + mean = float("0.688613") + std = float("0.12097") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [312] + dtype = "float32" + min_val = float("-0.218474") + max_val = float("0.244454") + mean = float("-0.000890749") + std = float("0.0649128") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [1248, 312] + dtype = "float32" + min_val = float("-1.01084") + max_val = float("1.01024") + mean = float("-6.06972e-05") + std = float("0.0754051") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [1248] + dtype = "float32" + min_val = float("-0.510169") + max_val = float("0.277593") + mean = float("-0.0988848") + std = float("0.11327") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [312, 1248] + dtype = "float32" + min_val = float("-0.681361") + max_val = float("0.618683") + mean = float("0.000671094") + std = float("0.0692203") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [312] + dtype = "float32" + min_val = float("-0.196507") + max_val = float("0.225849") + mean = float("0.0011279") + std = float("0.065219") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.325616") + max_val = float("0.338493") + mean = float("-8.52237e-05") + std = float("0.0715562") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [312] + dtype = "float32" + min_val = float("-0.175175") + max_val = float("0.197453") + mean = float("0.00383375") + std = float("0.0385097") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.429435") + max_val = float("0.427921") + mean = float("0.0001341") + std = float("0.0761064") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [312] + dtype = "float32" + min_val = float("-0.00250296") + max_val = float("0.0024816") + mean = float("1.35247e-06") + std = float("0.000609291") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.616594") + max_val = float("0.71547") + mean = float("2.68312e-05") + std = float("0.0588786") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [312] + dtype = "float32" + min_val = float("-0.672011") + max_val = float("0.616346") + mean = float("-0.00802001") + std = float("0.210513") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.295228") + max_val = float("0.386148") + mean = float("-2.84657e-05") + std = float("0.0543628") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [312] + dtype = "float32" + min_val = float("-0.412131") + max_val = float("1.21546") + mean = float("0.0137742") + std = float("0.131354") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [312] + dtype = "float32" + min_val = float("0.599737") + max_val = float("1.132") + mean = float("0.910471") + std = float("0.0747345") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [312] + dtype = "float32" + min_val = float("-1.90805") + max_val = float("3.07261") + mean = float("0.000586223") + std = float("0.263639") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [312] + dtype = "float32" + min_val = float("0.662993") + max_val = float("1.2011") + mean = float("0.814816") + std = float("0.0848459") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [312] + dtype = "float32" + min_val = float("-0.103974") + max_val = float("0.171779") + mean = float("0.000478914") + std = float("0.0412567") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [1248, 312] + dtype = "float32" + min_val = float("-1.27456") + max_val = float("0.967857") + mean = float("-0.000121506") + std = float("0.0654026") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [1248] + dtype = "float32" + min_val = float("-0.775418") + max_val = float("0.367288") + mean = float("-0.130227") + std = float("0.132073") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [312, 1248] + dtype = "float32" + min_val = float("-0.446247") + max_val = float("0.37706") + mean = float("0.000709958") + std = float("0.0634817") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [312] + dtype = "float32" + min_val = float("-0.382344") + max_val = float("0.267981") + mean = float("0.000577516") + std = float("0.113486") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.293968") + max_val = float("0.278988") + mean = float("-1.16064e-06") + std = float("0.0571727") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [312] + dtype = "float32" + min_val = float("-0.438526") + max_val = float("0.406044") + mean = float("0.0135443") + std = float("0.110215") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.355682") + max_val = float("0.300861") + mean = float("1.11164e-05") + std = float("0.0557354") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [312] + dtype = "float32" + min_val = float("-0.00143978") + max_val = float("0.00159392") + mean = float("-1.74433e-05") + std = float("0.000447798") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.630866") + max_val = float("0.574378") + mean = float("6.60112e-05") + std = float("0.0650797") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [312] + dtype = "float32" + min_val = float("-1.01173") + max_val = float("0.88133") + mean = float("0.00945653") + std = float("0.347208") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [312, 312] + dtype = "float32" + min_val = float("-0.37644") + max_val = float("0.426425") + mean = float("1.71029e-05") + std = float("0.0624272") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [312] + dtype = "float32" + min_val = float("-1.17741") + max_val = float("0.332891") + mean = float("0.0179319") + std = float("0.100272") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [312] + dtype = "float32" + min_val = float("0.177432") + max_val = float("1.18331") + mean = float("0.961482") + std = float("0.0761215") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [4, 312] + dtype = "float32" + min_val = float("-0.135068") + max_val = float("0.560655") + mean = float("0.0016981") + std = float("0.0389375") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [2048, 312] + dtype = "float32" + min_val = float("-0.494799") + max_val = float("0.366048") + mean = float("-9.61465e-05") + std = float("0.0343613") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [39981, 312] + dtype = "float32" + min_val = float("-0.592533") + max_val = float("0.615448") + mean = float("-1.5238e-05") + std = float("0.0372265") + data = None diff --git a/paddle_samples/PaddleNLP/utc-pico/graph_hash.txt b/paddle_samples/PaddleNLP/utc-pico/graph_hash.txt new file mode 100644 index 0000000000..aa3aab4dfb --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-pico/graph_hash.txt @@ -0,0 +1 @@ +e020bedf12bc138749ce39b08afe1a0a2a38bdcf27709995cb8c35a461e48a09 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-pico/graph_net.json b/paddle_samples/PaddleNLP/utc-pico/graph_net.json new file mode 100644 index 0000000000..cec2bba956 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-pico/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "utc-pico", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-pico/input_meta.py b/paddle_samples/PaddleNLP/utc-pico/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-pico/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/utc-pico/model.py b/paddle_samples/PaddleNLP/utc-pico/model.py new file mode 100644 index 0000000000..32e75e834a --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-pico/model.py @@ -0,0 +1,792 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x128xf32) <- (1x21xi64, 39981x128xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_54, 0, False) + del data_0, parameter_54 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0, full_2 + + # pd_op.embedding: (1x21x128xf32) <- (1x21xi64, 2048x128xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_53, -1, False) + del parameter_53 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 1x21x128xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x128xf32) <- (1x21xi64, 4x128xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_52, -1, False) + del data_1, parameter_52 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 1x21x128xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.layer_norm: (1x21x128xf32, 1x21xf32, 1x21xf32) <- (1x21x128xf32, 128xf32, 128xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_1, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_4 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_4 + + # pd_op.dropout: (1x21x128xf32, 1x21x128xui8) <- (1x21x128xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_2 = paddle._C_ops.add(matmul_0, parameter_48) + del parameter_48 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 2, 64] + + # pd_op.reshape: (1x21x2x64xf32) <- (1x21x128xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_2, full_int_array_1) + + # pd_op.transpose: (1x2x21x64xf32) <- (1x21x2x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_3 = paddle._C_ops.add(matmul_1, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_4 = paddle._C_ops.add(matmul_2, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x2x64xf32) <- (1x21x128xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x2x21x64xf32) <- (1x21x2x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x2x64xf32) <- (1x21x128xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x2x21x64xf32) <- (1x21x2x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_5 + + # pd_op.scale: (1x2x21x64xf32) <- (1x2x21x64xf32, 1xf32) + scale_1 = paddle._C_ops.scale(transpose_0, full_5, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x2x21x21xf32) <- (1x2x21x64xf32, 1x2x21x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_1, transpose_1, False, True) + + # pd_op.add: (1x2x21x21xf32) <- (1x2x21x21xf32, 1x1x1x21xf32) + add_5 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x2x21x21xf32) <- (1x2x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_5, -1) + del add_5 + + # pd_op.dropout: (1x2x21x21xf32, 1x2x21x21xui8) <- (1x2x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x2x21x64xf32) <- (1x2x21x21xf32, 1x2x21x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x2x64xf32) <- (1x2x21x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 128] + + # pd_op.reshape: (1x21x128xf32) <- (1x21x2x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_6 = paddle._C_ops.add(matmul_5, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x128xf32, 1x21x128xui8) <- (1x21x128xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_6, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_6 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 1x21x128xf32) + add_7 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x128xf32, 1x21xf32, 1x21xf32) <- (1x21x128xf32, 128xf32, 128xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_7, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x512xf32) <- (1x21x128xf32, 128x512xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x512xf32) <- (1x21x512xf32, 512xf32) + add_8 = paddle._C_ops.add(matmul_6, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x512xf32) <- (1x21x512xf32) + gelu_0 = paddle._C_ops.gelu(add_8, False) + + # pd_op.matmul: (1x21x128xf32) <- (1x21x512xf32, 512x128xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_9 = paddle._C_ops.add(matmul_7, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x128xf32, 1x21x128xui8) <- (1x21x128xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_9, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_9 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 1x21x128xf32) + add_10 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x128xf32, 1x21xf32, 1x21xf32) <- (1x21x128xf32, 128xf32, 128xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_10, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_11 = paddle._C_ops.add(matmul_8, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x2x64xf32) <- (1x21x128xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_11, full_int_array_1) + + # pd_op.transpose: (1x2x21x64xf32) <- (1x21x2x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_12 = paddle._C_ops.add(matmul_9, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_13 = paddle._C_ops.add(matmul_10, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x2x64xf32) <- (1x21x128xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x2x21x64xf32) <- (1x21x2x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x2x64xf32) <- (1x21x128xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x2x21x64xf32) <- (1x21x2x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x2x21x64xf32) <- (1x2x21x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_4, full_5, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x2x21x21xf32) <- (1x2x21x64xf32, 1x2x21x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_2, transpose_5, False, True) + + # pd_op.add: (1x2x21x21xf32) <- (1x2x21x21xf32, 1x1x1x21xf32) + add_14 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x2x21x21xf32) <- (1x2x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_14, -1) + del add_14 + + # pd_op.dropout: (1x2x21x21xf32, 1x2x21x21xui8) <- (1x2x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x2x21x64xf32) <- (1x2x21x21xf32, 1x2x21x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x2x64xf32) <- (1x2x21x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x128xf32) <- (1x21x2x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_15 = paddle._C_ops.add(matmul_13, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x128xf32, 1x21x128xui8) <- (1x21x128xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_15, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_15 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 1x21x128xf32) + add_16 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x128xf32, 1x21xf32, 1x21xf32) <- (1x21x128xf32, 128xf32, 128xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_16, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x512xf32) <- (1x21x128xf32, 128x512xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x512xf32) <- (1x21x512xf32, 512xf32) + add_17 = paddle._C_ops.add(matmul_14, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x512xf32) <- (1x21x512xf32) + gelu_1 = paddle._C_ops.gelu(add_17, False) + + # pd_op.matmul: (1x21x128xf32) <- (1x21x512xf32, 512x128xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_18 = paddle._C_ops.add(matmul_15, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x128xf32, 1x21x128xui8) <- (1x21x128xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_18, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_18 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 1x21x128xf32) + add_19 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x128xf32, 1x21xf32, 1x21xf32) <- (1x21x128xf32, 128xf32, 128xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_19, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_20 = paddle._C_ops.add(matmul_16, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x2x64xf32) <- (1x21x128xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_20, full_int_array_1) + + # pd_op.transpose: (1x2x21x64xf32) <- (1x21x2x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_21 = paddle._C_ops.add(matmul_17, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_22 = paddle._C_ops.add(matmul_18, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x2x64xf32) <- (1x21x128xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x2x21x64xf32) <- (1x21x2x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x2x64xf32) <- (1x21x128xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_22, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x2x21x64xf32) <- (1x21x2x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x2x21x64xf32) <- (1x2x21x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_8, full_5, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x2x21x21xf32) <- (1x2x21x64xf32, 1x2x21x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_3, transpose_9, False, True) + + # pd_op.add: (1x2x21x21xf32) <- (1x2x21x21xf32, 1x1x1x21xf32) + add_23 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x2x21x21xf32) <- (1x2x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_23, -1) + del add_23 + + # pd_op.dropout: (1x2x21x21xf32, 1x2x21x21xui8) <- (1x2x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x2x21x64xf32) <- (1x2x21x21xf32, 1x2x21x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x2x64xf32) <- (1x2x21x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x128xf32) <- (1x21x2x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x128xf32) <- (1x21x128xf32, 128x128xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_24 = paddle._C_ops.add(matmul_21, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x128xf32, 1x21x128xui8) <- (1x21x128xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_24, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_24 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 1x21x128xf32) + add_25 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x128xf32, 1x21xf32, 1x21xf32) <- (1x21x128xf32, 128xf32, 128xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_25, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x512xf32) <- (1x21x128xf32, 128x512xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x512xf32) <- (1x21x512xf32, 512xf32) + add_26 = paddle._C_ops.add(matmul_22, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x512xf32) <- (1x21x512xf32) + gelu_2 = paddle._C_ops.gelu(add_26, False) + + # pd_op.matmul: (1x21x128xf32) <- (1x21x512xf32, 512x128xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 128xf32) + add_27 = paddle._C_ops.add(matmul_23, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x128xf32, 1x21x128xui8) <- (1x21x128xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_27, None, full_4, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_27 + + # pd_op.add: (1x21x128xf32) <- (1x21x128xf32, 1x21x128xf32) + add_28 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x128xf32, 1x21xf32, 1x21xf32) <- (1x21x128xf32, 128xf32, 128xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_28, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x128xf32) <- (1x21x128xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_18, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x128xf32) <- (1x128xf32, 128x128xf32) + matmul_24 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x128xf32) <- (1x128xf32, 128xf32) + add_29 = paddle._C_ops.add(matmul_24, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x128xf32) <- (1x128xf32) + tanh_0 = paddle._C_ops.tanh(add_29) + del ( + add_0, + add_1, + add_10, + add_11, + add_12, + add_13, + add_16, + add_17, + add_19, + add_2, + add_20, + add_21, + add_22, + add_25, + add_26, + add_28, + add_29, + add_3, + add_4, + add_7, + add_8, + assign_0, + assign_1, + assign_10, + assign_2, + assign_3, + assign_4, + assign_5, + assign_6, + assign_7, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_11, + dropout_12, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_3, + dropout_4, + dropout_5, + dropout_6, + dropout_7, + dropout_8, + dropout_9, + embedding_0, + embedding_1, + embedding_2, + full_4, + full_5, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_2, + layer_norm_1, + layer_norm_10, + layer_norm_11, + layer_norm_12, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_3, + layer_norm_4, + layer_norm_5, + layer_norm_6, + layer_norm_7, + layer_norm_8, + layer_norm_9, + matmul_0, + matmul_1, + matmul_10, + matmul_11, + matmul_13, + matmul_14, + matmul_15, + matmul_16, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_3, + matmul_5, + matmul_6, + matmul_7, + matmul_8, + matmul_9, + reshape_11, + reshape_3, + reshape_7, + scale_1, + scale_2, + scale_3, + slice_0, + softmax_0, + softmax_1, + softmax_2, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_2, + transpose_3, + transpose_5, + transpose_6, + transpose_7, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/utc-pico/weight_meta.py b/paddle_samples/PaddleNLP/utc-pico/weight_meta.py new file mode 100644 index 0000000000..1e2d81ecd2 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-pico/weight_meta.py @@ -0,0 +1,599 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [128] + dtype = "float32" + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.0894764") + max_val = float("0.074456") + mean = float("7.02688e-05") + std = float("0.0201858") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [128] + dtype = "float32" + min_val = float("-0.481673") + max_val = float("0.265396") + mean = float("-0.0359457") + std = float("0.118022") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [128] + dtype = "float32" + min_val = float("0.584011") + max_val = float("1.11384") + mean = float("0.926008") + std = float("0.100531") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [128] + dtype = "float32" + min_val = float("-1.40425") + max_val = float("1.29651") + mean = float("-0.0204277") + std = float("0.285874") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [128] + dtype = "float32" + min_val = float("0.426312") + max_val = float("1.42198") + mean = float("0.692961") + std = float("0.210936") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [128] + dtype = "float32" + min_val = float("-0.100756") + max_val = float("0.107341") + mean = float("-0.000565233") + std = float("0.043857") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [512, 128] + dtype = "float32" + min_val = float("-1.46358") + max_val = float("1.38081") + mean = float("-0.000359137") + std = float("0.0951078") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [512] + dtype = "float32" + min_val = float("-0.479917") + max_val = float("0.294185") + mean = float("-0.0397457") + std = float("0.121173") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [128, 512] + dtype = "float32" + min_val = float("-0.948749") + max_val = float("0.978426") + mean = float("-0.000489643") + std = float("0.0980836") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [128] + dtype = "float32" + min_val = float("-0.239448") + max_val = float("0.336413") + mean = float("0.00221746") + std = float("0.0978731") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.725903") + max_val = float("0.675426") + mean = float("-0.000485941") + std = float("0.136797") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [128] + dtype = "float32" + min_val = float("-0.075481") + max_val = float("0.0648876") + mean = float("-0.00016778") + std = float("0.0274916") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.523573") + max_val = float("0.534229") + mean = float("0.00037848") + std = float("0.128823") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [128] + dtype = "float32" + min_val = float("-0.0183711") + max_val = float("0.0161526") + mean = float("-0.000209194") + std = float("0.00425061") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.346163") + max_val = float("0.393544") + mean = float("0.000381817") + std = float("0.0812794") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [128] + dtype = "float32" + min_val = float("-0.421504") + max_val = float("0.343198") + mean = float("-0.0156413") + std = float("0.17204") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.332314") + max_val = float("0.392144") + mean = float("0.000143792") + std = float("0.0847457") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [128] + dtype = "float32" + min_val = float("-1.25542") + max_val = float("0.507845") + mean = float("-0.0307349") + std = float("0.161958") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [128] + dtype = "float32" + min_val = float("0.862354") + max_val = float("1.41715") + mean = float("1.07468") + std = float("0.108879") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [128] + dtype = "float32" + min_val = float("-1.56436") + max_val = float("0.990784") + mean = float("-0.0133253") + std = float("0.24361") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [128] + dtype = "float32" + min_val = float("0.505788") + max_val = float("1.46729") + mean = float("0.774377") + std = float("0.177409") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [128] + dtype = "float32" + min_val = float("-0.103341") + max_val = float("0.221837") + mean = float("-0.000651507") + std = float("0.0462063") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [512, 128] + dtype = "float32" + min_val = float("-1.09225") + max_val = float("1.28354") + mean = float("4.47439e-05") + std = float("0.10856") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [512] + dtype = "float32" + min_val = float("-0.517859") + max_val = float("0.22234") + mean = float("-0.07209") + std = float("0.114001") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [128, 512] + dtype = "float32" + min_val = float("-0.735454") + max_val = float("0.51563") + mean = float("-0.000996402") + std = float("0.093894") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [128] + dtype = "float32" + min_val = float("-0.264685") + max_val = float("0.229589") + mean = float("0.00498905") + std = float("0.0924007") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.60702") + max_val = float("0.77302") + mean = float("4.37443e-05") + std = float("0.126654") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [128] + dtype = "float32" + min_val = float("-0.0920262") + max_val = float("0.113099") + mean = float("-0.000806105") + std = float("0.0394351") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.599091") + max_val = float("0.585946") + mean = float("-0.000436553") + std = float("0.120798") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [128] + dtype = "float32" + min_val = float("-0.0066025") + max_val = float("0.00984278") + mean = float("0.000313279") + std = float("0.00267699") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.409591") + max_val = float("0.388882") + mean = float("1.02789e-05") + std = float("0.080545") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [128] + dtype = "float32" + min_val = float("-0.555131") + max_val = float("0.462386") + mean = float("0.026468") + std = float("0.243017") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.393652") + max_val = float("0.408414") + mean = float("-0.000485072") + std = float("0.0801856") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [128] + dtype = "float32" + min_val = float("-0.804965") + max_val = float("0.3312") + mean = float("-0.013824") + std = float("0.106427") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [128] + dtype = "float32" + min_val = float("0.506928") + max_val = float("1.45294") + mean = float("1.14447") + std = float("0.141658") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [128] + dtype = "float32" + min_val = float("-2.24225") + max_val = float("1.26544") + mean = float("-0.00717608") + std = float("0.351675") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [128] + dtype = "float32" + min_val = float("0.703794") + max_val = float("1.33799") + mean = float("0.894856") + std = float("0.0928425") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [128] + dtype = "float32" + min_val = float("-0.229551") + max_val = float("0.190515") + mean = float("0.000243841") + std = float("0.06789") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [512, 128] + dtype = "float32" + min_val = float("-1.32487") + max_val = float("0.947839") + mean = float("-0.000476752") + std = float("0.0921034") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [512] + dtype = "float32" + min_val = float("-1.03925") + max_val = float("0.477011") + mean = float("-0.127793") + std = float("0.195286") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [128, 512] + dtype = "float32" + min_val = float("-0.806735") + max_val = float("0.647075") + mean = float("-0.000534848") + std = float("0.0879904") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [128] + dtype = "float32" + min_val = float("-0.370879") + max_val = float("0.346794") + mean = float("0.00475935") + std = float("0.0799808") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.478359") + max_val = float("0.553647") + mean = float("0.000146511") + std = float("0.113947") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [128] + dtype = "float32" + min_val = float("-0.13703") + max_val = float("0.100108") + mean = float("-0.00391159") + std = float("0.0456328") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.502291") + max_val = float("0.664631") + mean = float("-0.000300729") + std = float("0.1113") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [128] + dtype = "float32" + min_val = float("-0.00432805") + max_val = float("0.00635293") + mean = float("4.06391e-05") + std = float("0.00146384") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.386495") + max_val = float("0.561176") + mean = float("-0.00027594") + std = float("0.0788233") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [128] + dtype = "float32" + min_val = float("-0.445233") + max_val = float("0.473259") + mean = float("0.0243039") + std = float("0.20423") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [128, 128] + dtype = "float32" + min_val = float("-0.423254") + max_val = float("0.379967") + mean = float("0.00025603") + std = float("0.0807903") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [128] + dtype = "float32" + min_val = float("-0.723421") + max_val = float("0.53946") + mean = float("0.00419212") + std = float("0.116857") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [128] + dtype = "float32" + min_val = float("0.539714") + max_val = float("1.45135") + mean = float("1.11869") + std = float("0.121065") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [4, 128] + dtype = "float32" + min_val = float("-0.405423") + max_val = float("0.352553") + mean = float("0.000553635") + std = float("0.0429362") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [2048, 128] + dtype = "float32" + min_val = float("-0.322297") + max_val = float("0.242683") + mean = float("-1.7763e-05") + std = float("0.0412844") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [39981, 128] + dtype = "float32" + min_val = float("-0.530299") + max_val = float("0.413317") + mean = float("3.41833e-05") + std = float("0.0419273") + data = None diff --git a/paddle_samples/PaddleNLP/utc-xbase/graph_hash.txt b/paddle_samples/PaddleNLP/utc-xbase/graph_hash.txt new file mode 100644 index 0000000000..b7b340cede --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-xbase/graph_hash.txt @@ -0,0 +1 @@ +b9687d9e1c6a6a7d67ee0f33fa9986a36cec249c6f1f9cce3fb4e9e3ada9a8d0 \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-xbase/graph_net.json b/paddle_samples/PaddleNLP/utc-xbase/graph_net.json new file mode 100644 index 0000000000..0d07c022d7 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-xbase/graph_net.json @@ -0,0 +1,6 @@ +{ + "framework": "paddle", + "model_name": "utc-xbase", + "num_devices_required": 1, + "num_nodes_required": 1 +} \ No newline at end of file diff --git a/paddle_samples/PaddleNLP/utc-xbase/input_meta.py b/paddle_samples/PaddleNLP/utc-xbase/input_meta.py new file mode 100644 index 0000000000..4f25a05a9f --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-xbase/input_meta.py @@ -0,0 +1,34 @@ +class Program_weight_tensor_data_0: + name = "data_0" + shape = [1, 21] + dtype = "int64" + data = [ + 1, + 6368, + 30, + 3441, + 5254, + 2775, + 7208, + 42, + 1675, + 6433, + 7946, + 4640, + 31618, + 7476, + 34874, + 1662, + 4968, + 36810, + 9478, + 42, + 2, + ] + + +class Program_weight_tensor_data_1: + name = "data_1" + shape = [1, 21] + dtype = "int64" + data = [0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0, 0] diff --git a/paddle_samples/PaddleNLP/utc-xbase/model.py b/paddle_samples/PaddleNLP/utc-xbase/model.py new file mode 100644 index 0000000000..805cdb2ef5 --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-xbase/model.py @@ -0,0 +1,4382 @@ +import paddle + + +class GraphModule(paddle.nn.Layer): + def __init__(self): + super().__init__() + + def forward( + self, + parameter_0, + parameter_1, + parameter_2, + parameter_3, + parameter_4, + parameter_5, + parameter_6, + parameter_7, + parameter_8, + parameter_9, + parameter_10, + parameter_11, + parameter_12, + parameter_13, + parameter_14, + parameter_15, + parameter_16, + parameter_17, + parameter_18, + parameter_19, + parameter_20, + parameter_21, + parameter_22, + parameter_23, + parameter_24, + parameter_25, + parameter_26, + parameter_27, + parameter_28, + parameter_29, + parameter_30, + parameter_31, + parameter_32, + parameter_33, + parameter_34, + parameter_35, + parameter_36, + parameter_37, + parameter_38, + parameter_39, + parameter_40, + parameter_41, + parameter_42, + parameter_43, + parameter_44, + parameter_45, + parameter_46, + parameter_47, + parameter_48, + parameter_49, + parameter_50, + parameter_51, + parameter_52, + parameter_53, + parameter_54, + parameter_55, + parameter_56, + parameter_57, + parameter_58, + parameter_59, + parameter_60, + parameter_61, + parameter_62, + parameter_63, + parameter_64, + parameter_65, + parameter_66, + parameter_67, + parameter_68, + parameter_69, + parameter_70, + parameter_71, + parameter_72, + parameter_73, + parameter_74, + parameter_75, + parameter_76, + parameter_77, + parameter_78, + parameter_79, + parameter_80, + parameter_81, + parameter_82, + parameter_83, + parameter_84, + parameter_85, + parameter_86, + parameter_87, + parameter_88, + parameter_89, + parameter_90, + parameter_91, + parameter_92, + parameter_93, + parameter_94, + parameter_95, + parameter_96, + parameter_97, + parameter_98, + parameter_99, + parameter_100, + parameter_101, + parameter_102, + parameter_103, + parameter_104, + parameter_105, + parameter_106, + parameter_107, + parameter_108, + parameter_109, + parameter_110, + parameter_111, + parameter_112, + parameter_113, + parameter_114, + parameter_115, + parameter_116, + parameter_117, + parameter_118, + parameter_119, + parameter_120, + parameter_121, + parameter_122, + parameter_123, + parameter_124, + parameter_125, + parameter_126, + parameter_127, + parameter_128, + parameter_129, + parameter_130, + parameter_131, + parameter_132, + parameter_133, + parameter_134, + parameter_135, + parameter_136, + parameter_137, + parameter_138, + parameter_139, + parameter_140, + parameter_141, + parameter_142, + parameter_143, + parameter_144, + parameter_145, + parameter_146, + parameter_147, + parameter_148, + parameter_149, + parameter_150, + parameter_151, + parameter_152, + parameter_153, + parameter_154, + parameter_155, + parameter_156, + parameter_157, + parameter_158, + parameter_159, + parameter_160, + parameter_161, + parameter_162, + parameter_163, + parameter_164, + parameter_165, + parameter_166, + parameter_167, + parameter_168, + parameter_169, + parameter_170, + parameter_171, + parameter_172, + parameter_173, + parameter_174, + parameter_175, + parameter_176, + parameter_177, + parameter_178, + parameter_179, + parameter_180, + parameter_181, + parameter_182, + parameter_183, + parameter_184, + parameter_185, + parameter_186, + parameter_187, + parameter_188, + parameter_189, + parameter_190, + parameter_191, + parameter_192, + parameter_193, + parameter_194, + parameter_195, + parameter_196, + parameter_197, + parameter_198, + parameter_199, + parameter_200, + parameter_201, + parameter_202, + parameter_203, + parameter_204, + parameter_205, + parameter_206, + parameter_207, + parameter_208, + parameter_209, + parameter_210, + parameter_211, + parameter_212, + parameter_213, + parameter_214, + parameter_215, + parameter_216, + parameter_217, + parameter_218, + parameter_219, + parameter_220, + parameter_221, + parameter_222, + parameter_223, + parameter_224, + parameter_225, + parameter_226, + parameter_227, + parameter_228, + parameter_229, + parameter_230, + parameter_231, + parameter_232, + parameter_233, + parameter_234, + parameter_235, + parameter_236, + parameter_237, + parameter_238, + parameter_239, + parameter_240, + parameter_241, + parameter_242, + parameter_243, + parameter_244, + parameter_245, + parameter_246, + parameter_247, + parameter_248, + parameter_249, + parameter_250, + parameter_251, + parameter_252, + parameter_253, + parameter_254, + parameter_255, + parameter_256, + parameter_257, + parameter_258, + parameter_259, + parameter_260, + parameter_261, + parameter_262, + parameter_263, + parameter_264, + parameter_265, + parameter_266, + parameter_267, + parameter_268, + parameter_269, + parameter_270, + parameter_271, + parameter_272, + parameter_273, + parameter_274, + parameter_275, + parameter_276, + parameter_277, + parameter_278, + parameter_279, + parameter_280, + parameter_281, + parameter_282, + parameter_283, + parameter_284, + parameter_285, + parameter_286, + parameter_287, + parameter_288, + parameter_289, + parameter_290, + parameter_291, + parameter_292, + parameter_293, + parameter_294, + parameter_295, + parameter_296, + parameter_297, + parameter_298, + parameter_299, + parameter_300, + parameter_301, + parameter_302, + parameter_303, + parameter_304, + parameter_305, + parameter_306, + parameter_307, + parameter_308, + parameter_309, + parameter_310, + parameter_311, + parameter_312, + parameter_313, + parameter_314, + parameter_315, + parameter_316, + parameter_317, + parameter_318, + parameter_319, + parameter_320, + parameter_321, + parameter_322, + parameter_323, + parameter_324, + parameter_325, + parameter_326, + parameter_327, + data_0, + data_1, + ): + # pd_op.full: (xi64) <- () + full_0 = paddle._C_ops.full( + [], float("0"), paddle.int64, paddle.framework._current_expected_place() + ) + + # pd_op.equal: (1x21xb) <- (1x21xi64, xi64) + equal_0 = paddle._C_ops.equal(data_0, full_0) + del full_0 + + # pd_op.cast: (1x21xf32) <- (1x21xb) + cast_0 = paddle._C_ops.cast(equal_0, paddle.float32) + del equal_0 + + # pd_op.full: (1xf32) <- () + full_1 = paddle._C_ops.full( + [1], float("-10000"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xf32) <- (1x21xf32, 1xf32) + scale_0 = paddle._C_ops.scale(cast_0, full_1, float("0"), True) + del cast_0, full_1 + + # pd_op.full_int_array: (2xi64) <- () + full_int_array_0 = [1, 2] + + # pd_op.unsqueeze: (1x1x1x21xf32) <- (1x21xf32, 2xi64) + unsqueeze_0 = paddle._C_ops.unsqueeze(scale_0, full_int_array_0) + del full_int_array_0, scale_0 + + # pd_op.embedding: (1x21x1024xf32) <- (1x21xi64, 39981x1024xf32) + embedding_0 = paddle._C_ops.embedding(data_0, parameter_327, 0, False) + del data_0, parameter_327 + + # pd_op.full: (1x21xi64) <- () + full_2 = paddle._C_ops.full( + [1, 21], + float("1"), + paddle.int64, + paddle.framework._current_expected_place(), + ) + + # pd_op.full: (1xi32) <- () + full_3 = paddle._C_ops.full( + [1], float("1"), paddle.int32, paddle.core.CPUPlace() + ) + + # pd_op.cumsum: (1x21xi64) <- (1x21xi64, 1xi32) + cumsum_0 = paddle._C_ops.cumsum(full_2, full_3, False, False, False) + del full_3 + + # pd_op.subtract: (1x21xi64) <- (1x21xi64, 1x21xi64) + subtract_0 = paddle._C_ops.subtract(cumsum_0, full_2) + del cumsum_0 + + # pd_op.embedding: (1x21x1024xf32) <- (1x21xi64, 2048x1024xf32) + embedding_1 = paddle._C_ops.embedding(subtract_0, parameter_326, -1, False) + del parameter_326 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_0 = paddle._C_ops.add(embedding_0, embedding_1) + + # pd_op.embedding: (1x21x1024xf32) <- (1x21xi64, 4x1024xf32) + embedding_2 = paddle._C_ops.embedding(data_1, parameter_325, -1, False) + del data_1, parameter_325 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_1 = paddle._C_ops.add(add_0, embedding_2) + + # pd_op.full: (1xf32) <- () + full_4 = paddle._C_ops.full( + [1], float("0"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.scale: (1x21xi64) <- (1x21xi64, 1xf32) + scale_1 = paddle._C_ops.scale(full_2, full_4, float("0"), True) + del full_2, full_4 + + # pd_op.embedding: (1x21x1024xf32) <- (1x21xi64, 16x1024xf32) + embedding_3 = paddle._C_ops.embedding(scale_1, parameter_324, -1, False) + del parameter_324 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_2 = paddle._C_ops.add(add_1, embedding_3) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_0, layer_norm_1, layer_norm_2 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_2, parameter_323, parameter_322, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_322, parameter_323 + + # pd_op.full: (1xf32) <- () + full_5 = paddle._C_ops.full( + [1], float("0.1"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_0 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_1 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_2 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_3 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_4 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_5 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_6 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_7 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_8 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_9 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_10 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_11 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_12 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_13 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_14 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_15 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_16 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_17 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_18 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_19 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_20 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_21 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_22 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_23 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_24 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_25 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_26 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_27 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_28 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_29 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_30 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_31 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_32 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_33 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_34 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_35 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_36 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_37 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_38 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_39 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_40 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_41 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_42 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_43 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_44 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_45 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_46 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_47 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_48 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_49 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_50 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_51 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_52 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_53 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_54 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_55 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_56 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_57 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_58 = full_5 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_59 = full_5 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_0, dropout_1 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + layer_norm_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del layer_norm_0 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_0 = paddle._C_ops.matmul(dropout_0, parameter_321, False, False) + del parameter_321 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_3 = paddle._C_ops.add(matmul_0, parameter_320) + del parameter_320 + + # pd_op.full_int_array: (4xi64) <- () + full_int_array_1 = [0, 0, 16, 64] + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_0 = paddle._C_ops.reshape(add_3, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_0 = paddle._C_ops.transpose(reshape_0, [0, 2, 1, 3]) + del reshape_0 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_1 = paddle._C_ops.matmul(dropout_0, parameter_319, False, False) + del parameter_319 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_4 = paddle._C_ops.add(matmul_1, parameter_318) + del parameter_318 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_2 = paddle._C_ops.matmul(dropout_0, parameter_317, False, False) + del parameter_317 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_5 = paddle._C_ops.add(matmul_2, parameter_316) + del parameter_316 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_1 = paddle._C_ops.reshape(add_4, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_1 = paddle._C_ops.transpose(reshape_1, [0, 2, 1, 3]) + del reshape_1 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_2 = paddle._C_ops.reshape(add_5, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_2 = paddle._C_ops.transpose(reshape_2, [0, 2, 1, 3]) + del reshape_2 + + # pd_op.full: (1xf32) <- () + full_6 = paddle._C_ops.full( + [1], float("0.125"), paddle.float32, paddle.core.CPUPlace() + ) + + # pd_op.assign: (1xf32) <- (1xf32) + assign_60 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_61 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_62 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_63 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_64 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_65 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_66 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_67 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_68 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_69 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_70 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_71 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_72 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_73 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_74 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_75 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_76 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_77 = full_6 + + # pd_op.assign: (1xf32) <- (1xf32) + assign_78 = full_6 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_2 = paddle._C_ops.scale(transpose_0, full_6, float("0"), True) + del transpose_0 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_3 = paddle._C_ops.matmul(scale_2, transpose_1, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_6 = paddle._C_ops.add(matmul_3, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_0 = paddle._C_ops.softmax(add_6, -1) + del add_6 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_2, dropout_3 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_0, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_4 = paddle._C_ops.matmul(dropout_2, transpose_2, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_3 = paddle._C_ops.transpose(matmul_4, [0, 2, 1, 3]) + del matmul_4 + + # pd_op.full_int_array: (3xi64) <- () + full_int_array_2 = [0, 0, 1024] + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_3 = paddle._C_ops.reshape(transpose_3, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_5 = paddle._C_ops.matmul(reshape_3, parameter_315, False, False) + del parameter_315 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_7 = paddle._C_ops.add(matmul_5, parameter_314) + del parameter_314 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_4, dropout_5 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_7, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_7 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_8 = paddle._C_ops.add(dropout_0, dropout_4) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_3, layer_norm_4, layer_norm_5 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_8, parameter_309, parameter_308, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_308, parameter_309 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_6 = paddle._C_ops.matmul(layer_norm_3, parameter_313, False, False) + del parameter_313 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_9 = paddle._C_ops.add(matmul_6, parameter_312) + del parameter_312 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_0 = paddle._C_ops.gelu(add_9, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_7 = paddle._C_ops.matmul(gelu_0, parameter_311, False, False) + del parameter_311 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_10 = paddle._C_ops.add(matmul_7, parameter_310) + del parameter_310 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_6, dropout_7 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_10, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_10 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_11 = paddle._C_ops.add(layer_norm_3, dropout_6) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_6, layer_norm_7, layer_norm_8 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_11, parameter_307, parameter_306, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_306, parameter_307 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_8 = paddle._C_ops.matmul(layer_norm_6, parameter_305, False, False) + del parameter_305 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_12 = paddle._C_ops.add(matmul_8, parameter_304) + del parameter_304 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_4 = paddle._C_ops.reshape(add_12, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_4 = paddle._C_ops.transpose(reshape_4, [0, 2, 1, 3]) + del reshape_4 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_9 = paddle._C_ops.matmul(layer_norm_6, parameter_303, False, False) + del parameter_303 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_13 = paddle._C_ops.add(matmul_9, parameter_302) + del parameter_302 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_10 = paddle._C_ops.matmul(layer_norm_6, parameter_301, False, False) + del parameter_301 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_14 = paddle._C_ops.add(matmul_10, parameter_300) + del parameter_300 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_5 = paddle._C_ops.reshape(add_13, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_5 = paddle._C_ops.transpose(reshape_5, [0, 2, 1, 3]) + del reshape_5 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_6 = paddle._C_ops.reshape(add_14, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_6 = paddle._C_ops.transpose(reshape_6, [0, 2, 1, 3]) + del reshape_6 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_3 = paddle._C_ops.scale(transpose_4, full_6, float("0"), True) + del transpose_4 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_11 = paddle._C_ops.matmul(scale_3, transpose_5, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_15 = paddle._C_ops.add(matmul_11, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_1 = paddle._C_ops.softmax(add_15, -1) + del add_15 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_8, dropout_9 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_1, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_12 = paddle._C_ops.matmul(dropout_8, transpose_6, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_7 = paddle._C_ops.transpose(matmul_12, [0, 2, 1, 3]) + del matmul_12 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_7 = paddle._C_ops.reshape(transpose_7, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_13 = paddle._C_ops.matmul(reshape_7, parameter_299, False, False) + del parameter_299 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_16 = paddle._C_ops.add(matmul_13, parameter_298) + del parameter_298 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_10, dropout_11 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_16, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_16 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_17 = paddle._C_ops.add(layer_norm_6, dropout_10) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_9, layer_norm_10, layer_norm_11 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_17, parameter_293, parameter_292, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_292, parameter_293 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_14 = paddle._C_ops.matmul(layer_norm_9, parameter_297, False, False) + del parameter_297 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_18 = paddle._C_ops.add(matmul_14, parameter_296) + del parameter_296 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_1 = paddle._C_ops.gelu(add_18, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_15 = paddle._C_ops.matmul(gelu_1, parameter_295, False, False) + del parameter_295 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_19 = paddle._C_ops.add(matmul_15, parameter_294) + del parameter_294 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_12, dropout_13 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_19, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_19 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_20 = paddle._C_ops.add(layer_norm_9, dropout_12) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_12, layer_norm_13, layer_norm_14 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_20, parameter_291, parameter_290, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_290, parameter_291 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_16 = paddle._C_ops.matmul(layer_norm_12, parameter_289, False, False) + del parameter_289 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_21 = paddle._C_ops.add(matmul_16, parameter_288) + del parameter_288 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_8 = paddle._C_ops.reshape(add_21, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_8 = paddle._C_ops.transpose(reshape_8, [0, 2, 1, 3]) + del reshape_8 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_17 = paddle._C_ops.matmul(layer_norm_12, parameter_287, False, False) + del parameter_287 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_22 = paddle._C_ops.add(matmul_17, parameter_286) + del parameter_286 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_18 = paddle._C_ops.matmul(layer_norm_12, parameter_285, False, False) + del parameter_285 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_23 = paddle._C_ops.add(matmul_18, parameter_284) + del parameter_284 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_9 = paddle._C_ops.reshape(add_22, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_9 = paddle._C_ops.transpose(reshape_9, [0, 2, 1, 3]) + del reshape_9 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_10 = paddle._C_ops.reshape(add_23, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_10 = paddle._C_ops.transpose(reshape_10, [0, 2, 1, 3]) + del reshape_10 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_4 = paddle._C_ops.scale(transpose_8, full_6, float("0"), True) + del transpose_8 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_19 = paddle._C_ops.matmul(scale_4, transpose_9, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_24 = paddle._C_ops.add(matmul_19, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_2 = paddle._C_ops.softmax(add_24, -1) + del add_24 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_14, dropout_15 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_2, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_20 = paddle._C_ops.matmul(dropout_14, transpose_10, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_11 = paddle._C_ops.transpose(matmul_20, [0, 2, 1, 3]) + del matmul_20 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_11 = paddle._C_ops.reshape(transpose_11, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_21 = paddle._C_ops.matmul(reshape_11, parameter_283, False, False) + del parameter_283 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_25 = paddle._C_ops.add(matmul_21, parameter_282) + del parameter_282 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_16, dropout_17 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_25, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_25 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_26 = paddle._C_ops.add(layer_norm_12, dropout_16) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_15, layer_norm_16, layer_norm_17 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_26, parameter_277, parameter_276, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_276, parameter_277 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_22 = paddle._C_ops.matmul(layer_norm_15, parameter_281, False, False) + del parameter_281 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_27 = paddle._C_ops.add(matmul_22, parameter_280) + del parameter_280 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_2 = paddle._C_ops.gelu(add_27, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_23 = paddle._C_ops.matmul(gelu_2, parameter_279, False, False) + del parameter_279 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_28 = paddle._C_ops.add(matmul_23, parameter_278) + del parameter_278 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_18, dropout_19 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_28, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_28 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_29 = paddle._C_ops.add(layer_norm_15, dropout_18) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_18, layer_norm_19, layer_norm_20 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_29, parameter_275, parameter_274, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_274, parameter_275 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_24 = paddle._C_ops.matmul(layer_norm_18, parameter_273, False, False) + del parameter_273 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_30 = paddle._C_ops.add(matmul_24, parameter_272) + del parameter_272 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_12 = paddle._C_ops.reshape(add_30, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_12 = paddle._C_ops.transpose(reshape_12, [0, 2, 1, 3]) + del reshape_12 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_25 = paddle._C_ops.matmul(layer_norm_18, parameter_271, False, False) + del parameter_271 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_31 = paddle._C_ops.add(matmul_25, parameter_270) + del parameter_270 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_26 = paddle._C_ops.matmul(layer_norm_18, parameter_269, False, False) + del parameter_269 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_32 = paddle._C_ops.add(matmul_26, parameter_268) + del parameter_268 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_13 = paddle._C_ops.reshape(add_31, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_13 = paddle._C_ops.transpose(reshape_13, [0, 2, 1, 3]) + del reshape_13 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_14 = paddle._C_ops.reshape(add_32, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_14 = paddle._C_ops.transpose(reshape_14, [0, 2, 1, 3]) + del reshape_14 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_5 = paddle._C_ops.scale(transpose_12, full_6, float("0"), True) + del transpose_12 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_27 = paddle._C_ops.matmul(scale_5, transpose_13, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_33 = paddle._C_ops.add(matmul_27, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_3 = paddle._C_ops.softmax(add_33, -1) + del add_33 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_20, dropout_21 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_3, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_28 = paddle._C_ops.matmul(dropout_20, transpose_14, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_15 = paddle._C_ops.transpose(matmul_28, [0, 2, 1, 3]) + del matmul_28 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_15 = paddle._C_ops.reshape(transpose_15, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_29 = paddle._C_ops.matmul(reshape_15, parameter_267, False, False) + del parameter_267 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_34 = paddle._C_ops.add(matmul_29, parameter_266) + del parameter_266 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_22, dropout_23 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_34, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_34 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_35 = paddle._C_ops.add(layer_norm_18, dropout_22) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_21, layer_norm_22, layer_norm_23 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_35, parameter_261, parameter_260, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_260, parameter_261 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_30 = paddle._C_ops.matmul(layer_norm_21, parameter_265, False, False) + del parameter_265 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_36 = paddle._C_ops.add(matmul_30, parameter_264) + del parameter_264 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_3 = paddle._C_ops.gelu(add_36, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_31 = paddle._C_ops.matmul(gelu_3, parameter_263, False, False) + del parameter_263 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_37 = paddle._C_ops.add(matmul_31, parameter_262) + del parameter_262 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_24, dropout_25 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_37, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_37 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_38 = paddle._C_ops.add(layer_norm_21, dropout_24) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_24, layer_norm_25, layer_norm_26 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_38, parameter_259, parameter_258, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_258, parameter_259 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_32 = paddle._C_ops.matmul(layer_norm_24, parameter_257, False, False) + del parameter_257 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_39 = paddle._C_ops.add(matmul_32, parameter_256) + del parameter_256 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_16 = paddle._C_ops.reshape(add_39, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_16 = paddle._C_ops.transpose(reshape_16, [0, 2, 1, 3]) + del reshape_16 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_33 = paddle._C_ops.matmul(layer_norm_24, parameter_255, False, False) + del parameter_255 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_40 = paddle._C_ops.add(matmul_33, parameter_254) + del parameter_254 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_34 = paddle._C_ops.matmul(layer_norm_24, parameter_253, False, False) + del parameter_253 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_41 = paddle._C_ops.add(matmul_34, parameter_252) + del parameter_252 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_17 = paddle._C_ops.reshape(add_40, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_17 = paddle._C_ops.transpose(reshape_17, [0, 2, 1, 3]) + del reshape_17 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_18 = paddle._C_ops.reshape(add_41, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_18 = paddle._C_ops.transpose(reshape_18, [0, 2, 1, 3]) + del reshape_18 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_6 = paddle._C_ops.scale(transpose_16, full_6, float("0"), True) + del transpose_16 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_35 = paddle._C_ops.matmul(scale_6, transpose_17, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_42 = paddle._C_ops.add(matmul_35, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_4 = paddle._C_ops.softmax(add_42, -1) + del add_42 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_26, dropout_27 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_4, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_36 = paddle._C_ops.matmul(dropout_26, transpose_18, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_19 = paddle._C_ops.transpose(matmul_36, [0, 2, 1, 3]) + del matmul_36 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_19 = paddle._C_ops.reshape(transpose_19, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_37 = paddle._C_ops.matmul(reshape_19, parameter_251, False, False) + del parameter_251 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_43 = paddle._C_ops.add(matmul_37, parameter_250) + del parameter_250 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_28, dropout_29 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_43, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_43 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_44 = paddle._C_ops.add(layer_norm_24, dropout_28) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_27, layer_norm_28, layer_norm_29 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_44, parameter_245, parameter_244, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_244, parameter_245 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_38 = paddle._C_ops.matmul(layer_norm_27, parameter_249, False, False) + del parameter_249 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_45 = paddle._C_ops.add(matmul_38, parameter_248) + del parameter_248 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_4 = paddle._C_ops.gelu(add_45, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_39 = paddle._C_ops.matmul(gelu_4, parameter_247, False, False) + del parameter_247 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_46 = paddle._C_ops.add(matmul_39, parameter_246) + del parameter_246 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_30, dropout_31 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_46, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_46 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_47 = paddle._C_ops.add(layer_norm_27, dropout_30) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_30, layer_norm_31, layer_norm_32 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_47, parameter_243, parameter_242, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_242, parameter_243 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_40 = paddle._C_ops.matmul(layer_norm_30, parameter_241, False, False) + del parameter_241 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_48 = paddle._C_ops.add(matmul_40, parameter_240) + del parameter_240 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_20 = paddle._C_ops.reshape(add_48, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_20 = paddle._C_ops.transpose(reshape_20, [0, 2, 1, 3]) + del reshape_20 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_41 = paddle._C_ops.matmul(layer_norm_30, parameter_239, False, False) + del parameter_239 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_49 = paddle._C_ops.add(matmul_41, parameter_238) + del parameter_238 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_42 = paddle._C_ops.matmul(layer_norm_30, parameter_237, False, False) + del parameter_237 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_50 = paddle._C_ops.add(matmul_42, parameter_236) + del parameter_236 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_21 = paddle._C_ops.reshape(add_49, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_21 = paddle._C_ops.transpose(reshape_21, [0, 2, 1, 3]) + del reshape_21 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_22 = paddle._C_ops.reshape(add_50, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_22 = paddle._C_ops.transpose(reshape_22, [0, 2, 1, 3]) + del reshape_22 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_7 = paddle._C_ops.scale(transpose_20, full_6, float("0"), True) + del transpose_20 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_43 = paddle._C_ops.matmul(scale_7, transpose_21, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_51 = paddle._C_ops.add(matmul_43, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_5 = paddle._C_ops.softmax(add_51, -1) + del add_51 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_32, dropout_33 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_5, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_44 = paddle._C_ops.matmul(dropout_32, transpose_22, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_23 = paddle._C_ops.transpose(matmul_44, [0, 2, 1, 3]) + del matmul_44 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_23 = paddle._C_ops.reshape(transpose_23, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_45 = paddle._C_ops.matmul(reshape_23, parameter_235, False, False) + del parameter_235 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_52 = paddle._C_ops.add(matmul_45, parameter_234) + del parameter_234 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_34, dropout_35 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_52, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_52 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_53 = paddle._C_ops.add(layer_norm_30, dropout_34) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_33, layer_norm_34, layer_norm_35 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_53, parameter_229, parameter_228, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_228, parameter_229 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_46 = paddle._C_ops.matmul(layer_norm_33, parameter_233, False, False) + del parameter_233 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_54 = paddle._C_ops.add(matmul_46, parameter_232) + del parameter_232 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_5 = paddle._C_ops.gelu(add_54, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_47 = paddle._C_ops.matmul(gelu_5, parameter_231, False, False) + del parameter_231 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_55 = paddle._C_ops.add(matmul_47, parameter_230) + del parameter_230 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_36, dropout_37 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_55, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_55 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_56 = paddle._C_ops.add(layer_norm_33, dropout_36) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_36, layer_norm_37, layer_norm_38 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_56, parameter_227, parameter_226, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_226, parameter_227 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_48 = paddle._C_ops.matmul(layer_norm_36, parameter_225, False, False) + del parameter_225 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_57 = paddle._C_ops.add(matmul_48, parameter_224) + del parameter_224 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_24 = paddle._C_ops.reshape(add_57, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_24 = paddle._C_ops.transpose(reshape_24, [0, 2, 1, 3]) + del reshape_24 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_49 = paddle._C_ops.matmul(layer_norm_36, parameter_223, False, False) + del parameter_223 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_58 = paddle._C_ops.add(matmul_49, parameter_222) + del parameter_222 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_50 = paddle._C_ops.matmul(layer_norm_36, parameter_221, False, False) + del parameter_221 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_59 = paddle._C_ops.add(matmul_50, parameter_220) + del parameter_220 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_25 = paddle._C_ops.reshape(add_58, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_25 = paddle._C_ops.transpose(reshape_25, [0, 2, 1, 3]) + del reshape_25 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_26 = paddle._C_ops.reshape(add_59, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_26 = paddle._C_ops.transpose(reshape_26, [0, 2, 1, 3]) + del reshape_26 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_8 = paddle._C_ops.scale(transpose_24, full_6, float("0"), True) + del transpose_24 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_51 = paddle._C_ops.matmul(scale_8, transpose_25, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_60 = paddle._C_ops.add(matmul_51, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_6 = paddle._C_ops.softmax(add_60, -1) + del add_60 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_38, dropout_39 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_6, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_52 = paddle._C_ops.matmul(dropout_38, transpose_26, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_27 = paddle._C_ops.transpose(matmul_52, [0, 2, 1, 3]) + del matmul_52 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_27 = paddle._C_ops.reshape(transpose_27, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_53 = paddle._C_ops.matmul(reshape_27, parameter_219, False, False) + del parameter_219 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_61 = paddle._C_ops.add(matmul_53, parameter_218) + del parameter_218 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_40, dropout_41 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_61, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_61 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_62 = paddle._C_ops.add(layer_norm_36, dropout_40) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_39, layer_norm_40, layer_norm_41 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_62, parameter_213, parameter_212, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_212, parameter_213 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_54 = paddle._C_ops.matmul(layer_norm_39, parameter_217, False, False) + del parameter_217 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_63 = paddle._C_ops.add(matmul_54, parameter_216) + del parameter_216 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_6 = paddle._C_ops.gelu(add_63, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_55 = paddle._C_ops.matmul(gelu_6, parameter_215, False, False) + del parameter_215 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_64 = paddle._C_ops.add(matmul_55, parameter_214) + del parameter_214 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_42, dropout_43 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_64, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_64 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_65 = paddle._C_ops.add(layer_norm_39, dropout_42) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_42, layer_norm_43, layer_norm_44 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_65, parameter_211, parameter_210, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_210, parameter_211 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_56 = paddle._C_ops.matmul(layer_norm_42, parameter_209, False, False) + del parameter_209 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_66 = paddle._C_ops.add(matmul_56, parameter_208) + del parameter_208 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_28 = paddle._C_ops.reshape(add_66, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_28 = paddle._C_ops.transpose(reshape_28, [0, 2, 1, 3]) + del reshape_28 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_57 = paddle._C_ops.matmul(layer_norm_42, parameter_207, False, False) + del parameter_207 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_67 = paddle._C_ops.add(matmul_57, parameter_206) + del parameter_206 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_58 = paddle._C_ops.matmul(layer_norm_42, parameter_205, False, False) + del parameter_205 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_68 = paddle._C_ops.add(matmul_58, parameter_204) + del parameter_204 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_29 = paddle._C_ops.reshape(add_67, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_29 = paddle._C_ops.transpose(reshape_29, [0, 2, 1, 3]) + del reshape_29 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_30 = paddle._C_ops.reshape(add_68, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_30 = paddle._C_ops.transpose(reshape_30, [0, 2, 1, 3]) + del reshape_30 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_9 = paddle._C_ops.scale(transpose_28, full_6, float("0"), True) + del transpose_28 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_59 = paddle._C_ops.matmul(scale_9, transpose_29, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_69 = paddle._C_ops.add(matmul_59, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_7 = paddle._C_ops.softmax(add_69, -1) + del add_69 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_44, dropout_45 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_7, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_60 = paddle._C_ops.matmul(dropout_44, transpose_30, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_31 = paddle._C_ops.transpose(matmul_60, [0, 2, 1, 3]) + del matmul_60 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_31 = paddle._C_ops.reshape(transpose_31, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_61 = paddle._C_ops.matmul(reshape_31, parameter_203, False, False) + del parameter_203 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_70 = paddle._C_ops.add(matmul_61, parameter_202) + del parameter_202 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_46, dropout_47 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_70, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_70 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_71 = paddle._C_ops.add(layer_norm_42, dropout_46) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_45, layer_norm_46, layer_norm_47 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_71, parameter_197, parameter_196, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_196, parameter_197 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_62 = paddle._C_ops.matmul(layer_norm_45, parameter_201, False, False) + del parameter_201 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_72 = paddle._C_ops.add(matmul_62, parameter_200) + del parameter_200 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_7 = paddle._C_ops.gelu(add_72, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_63 = paddle._C_ops.matmul(gelu_7, parameter_199, False, False) + del parameter_199 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_73 = paddle._C_ops.add(matmul_63, parameter_198) + del parameter_198 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_48, dropout_49 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_73, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_73 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_74 = paddle._C_ops.add(layer_norm_45, dropout_48) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_48, layer_norm_49, layer_norm_50 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_74, parameter_195, parameter_194, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_194, parameter_195 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_64 = paddle._C_ops.matmul(layer_norm_48, parameter_193, False, False) + del parameter_193 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_75 = paddle._C_ops.add(matmul_64, parameter_192) + del parameter_192 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_32 = paddle._C_ops.reshape(add_75, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_32 = paddle._C_ops.transpose(reshape_32, [0, 2, 1, 3]) + del reshape_32 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_65 = paddle._C_ops.matmul(layer_norm_48, parameter_191, False, False) + del parameter_191 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_76 = paddle._C_ops.add(matmul_65, parameter_190) + del parameter_190 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_66 = paddle._C_ops.matmul(layer_norm_48, parameter_189, False, False) + del parameter_189 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_77 = paddle._C_ops.add(matmul_66, parameter_188) + del parameter_188 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_33 = paddle._C_ops.reshape(add_76, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_33 = paddle._C_ops.transpose(reshape_33, [0, 2, 1, 3]) + del reshape_33 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_34 = paddle._C_ops.reshape(add_77, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_34 = paddle._C_ops.transpose(reshape_34, [0, 2, 1, 3]) + del reshape_34 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_10 = paddle._C_ops.scale(transpose_32, full_6, float("0"), True) + del transpose_32 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_67 = paddle._C_ops.matmul(scale_10, transpose_33, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_78 = paddle._C_ops.add(matmul_67, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_8 = paddle._C_ops.softmax(add_78, -1) + del add_78 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_50, dropout_51 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_8, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_68 = paddle._C_ops.matmul(dropout_50, transpose_34, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_35 = paddle._C_ops.transpose(matmul_68, [0, 2, 1, 3]) + del matmul_68 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_35 = paddle._C_ops.reshape(transpose_35, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_69 = paddle._C_ops.matmul(reshape_35, parameter_187, False, False) + del parameter_187 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_79 = paddle._C_ops.add(matmul_69, parameter_186) + del parameter_186 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_52, dropout_53 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_79, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_79 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_80 = paddle._C_ops.add(layer_norm_48, dropout_52) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_51, layer_norm_52, layer_norm_53 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_80, parameter_181, parameter_180, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_180, parameter_181 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_70 = paddle._C_ops.matmul(layer_norm_51, parameter_185, False, False) + del parameter_185 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_81 = paddle._C_ops.add(matmul_70, parameter_184) + del parameter_184 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_8 = paddle._C_ops.gelu(add_81, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_71 = paddle._C_ops.matmul(gelu_8, parameter_183, False, False) + del parameter_183 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_82 = paddle._C_ops.add(matmul_71, parameter_182) + del parameter_182 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_54, dropout_55 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_82, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_82 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_83 = paddle._C_ops.add(layer_norm_51, dropout_54) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_54, layer_norm_55, layer_norm_56 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_83, parameter_179, parameter_178, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_178, parameter_179 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_72 = paddle._C_ops.matmul(layer_norm_54, parameter_177, False, False) + del parameter_177 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_84 = paddle._C_ops.add(matmul_72, parameter_176) + del parameter_176 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_36 = paddle._C_ops.reshape(add_84, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_36 = paddle._C_ops.transpose(reshape_36, [0, 2, 1, 3]) + del reshape_36 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_73 = paddle._C_ops.matmul(layer_norm_54, parameter_175, False, False) + del parameter_175 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_85 = paddle._C_ops.add(matmul_73, parameter_174) + del parameter_174 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_74 = paddle._C_ops.matmul(layer_norm_54, parameter_173, False, False) + del parameter_173 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_86 = paddle._C_ops.add(matmul_74, parameter_172) + del parameter_172 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_37 = paddle._C_ops.reshape(add_85, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_37 = paddle._C_ops.transpose(reshape_37, [0, 2, 1, 3]) + del reshape_37 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_38 = paddle._C_ops.reshape(add_86, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_38 = paddle._C_ops.transpose(reshape_38, [0, 2, 1, 3]) + del reshape_38 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_11 = paddle._C_ops.scale(transpose_36, full_6, float("0"), True) + del transpose_36 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_75 = paddle._C_ops.matmul(scale_11, transpose_37, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_87 = paddle._C_ops.add(matmul_75, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_9 = paddle._C_ops.softmax(add_87, -1) + del add_87 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_56, dropout_57 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_9, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_76 = paddle._C_ops.matmul(dropout_56, transpose_38, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_39 = paddle._C_ops.transpose(matmul_76, [0, 2, 1, 3]) + del matmul_76 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_39 = paddle._C_ops.reshape(transpose_39, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_77 = paddle._C_ops.matmul(reshape_39, parameter_171, False, False) + del parameter_171 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_88 = paddle._C_ops.add(matmul_77, parameter_170) + del parameter_170 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_58, dropout_59 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_88, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_88 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_89 = paddle._C_ops.add(layer_norm_54, dropout_58) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_57, layer_norm_58, layer_norm_59 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_89, parameter_165, parameter_164, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_164, parameter_165 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_78 = paddle._C_ops.matmul(layer_norm_57, parameter_169, False, False) + del parameter_169 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_90 = paddle._C_ops.add(matmul_78, parameter_168) + del parameter_168 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_9 = paddle._C_ops.gelu(add_90, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_79 = paddle._C_ops.matmul(gelu_9, parameter_167, False, False) + del parameter_167 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_91 = paddle._C_ops.add(matmul_79, parameter_166) + del parameter_166 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_60, dropout_61 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_91, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_91 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_92 = paddle._C_ops.add(layer_norm_57, dropout_60) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_60, layer_norm_61, layer_norm_62 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_92, parameter_163, parameter_162, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_162, parameter_163 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_80 = paddle._C_ops.matmul(layer_norm_60, parameter_161, False, False) + del parameter_161 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_93 = paddle._C_ops.add(matmul_80, parameter_160) + del parameter_160 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_40 = paddle._C_ops.reshape(add_93, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_40 = paddle._C_ops.transpose(reshape_40, [0, 2, 1, 3]) + del reshape_40 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_81 = paddle._C_ops.matmul(layer_norm_60, parameter_159, False, False) + del parameter_159 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_94 = paddle._C_ops.add(matmul_81, parameter_158) + del parameter_158 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_82 = paddle._C_ops.matmul(layer_norm_60, parameter_157, False, False) + del parameter_157 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_95 = paddle._C_ops.add(matmul_82, parameter_156) + del parameter_156 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_41 = paddle._C_ops.reshape(add_94, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_41 = paddle._C_ops.transpose(reshape_41, [0, 2, 1, 3]) + del reshape_41 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_42 = paddle._C_ops.reshape(add_95, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_42 = paddle._C_ops.transpose(reshape_42, [0, 2, 1, 3]) + del reshape_42 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_12 = paddle._C_ops.scale(transpose_40, full_6, float("0"), True) + del transpose_40 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_83 = paddle._C_ops.matmul(scale_12, transpose_41, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_96 = paddle._C_ops.add(matmul_83, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_10 = paddle._C_ops.softmax(add_96, -1) + del add_96 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_62, dropout_63 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_10, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_84 = paddle._C_ops.matmul(dropout_62, transpose_42, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_43 = paddle._C_ops.transpose(matmul_84, [0, 2, 1, 3]) + del matmul_84 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_43 = paddle._C_ops.reshape(transpose_43, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_85 = paddle._C_ops.matmul(reshape_43, parameter_155, False, False) + del parameter_155 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_97 = paddle._C_ops.add(matmul_85, parameter_154) + del parameter_154 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_64, dropout_65 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_97, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_97 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_98 = paddle._C_ops.add(layer_norm_60, dropout_64) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_63, layer_norm_64, layer_norm_65 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_98, parameter_149, parameter_148, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_148, parameter_149 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_86 = paddle._C_ops.matmul(layer_norm_63, parameter_153, False, False) + del parameter_153 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_99 = paddle._C_ops.add(matmul_86, parameter_152) + del parameter_152 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_10 = paddle._C_ops.gelu(add_99, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_87 = paddle._C_ops.matmul(gelu_10, parameter_151, False, False) + del parameter_151 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_100 = paddle._C_ops.add(matmul_87, parameter_150) + del parameter_150 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_66, dropout_67 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_100, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_100 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_101 = paddle._C_ops.add(layer_norm_63, dropout_66) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_66, layer_norm_67, layer_norm_68 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_101, parameter_147, parameter_146, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_146, parameter_147 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_88 = paddle._C_ops.matmul(layer_norm_66, parameter_145, False, False) + del parameter_145 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_102 = paddle._C_ops.add(matmul_88, parameter_144) + del parameter_144 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_44 = paddle._C_ops.reshape(add_102, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_44 = paddle._C_ops.transpose(reshape_44, [0, 2, 1, 3]) + del reshape_44 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_89 = paddle._C_ops.matmul(layer_norm_66, parameter_143, False, False) + del parameter_143 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_103 = paddle._C_ops.add(matmul_89, parameter_142) + del parameter_142 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_90 = paddle._C_ops.matmul(layer_norm_66, parameter_141, False, False) + del parameter_141 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_104 = paddle._C_ops.add(matmul_90, parameter_140) + del parameter_140 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_45 = paddle._C_ops.reshape(add_103, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_45 = paddle._C_ops.transpose(reshape_45, [0, 2, 1, 3]) + del reshape_45 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_46 = paddle._C_ops.reshape(add_104, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_46 = paddle._C_ops.transpose(reshape_46, [0, 2, 1, 3]) + del reshape_46 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_13 = paddle._C_ops.scale(transpose_44, full_6, float("0"), True) + del transpose_44 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_91 = paddle._C_ops.matmul(scale_13, transpose_45, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_105 = paddle._C_ops.add(matmul_91, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_11 = paddle._C_ops.softmax(add_105, -1) + del add_105 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_68, dropout_69 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_11, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_92 = paddle._C_ops.matmul(dropout_68, transpose_46, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_47 = paddle._C_ops.transpose(matmul_92, [0, 2, 1, 3]) + del matmul_92 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_47 = paddle._C_ops.reshape(transpose_47, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_93 = paddle._C_ops.matmul(reshape_47, parameter_139, False, False) + del parameter_139 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_106 = paddle._C_ops.add(matmul_93, parameter_138) + del parameter_138 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_70, dropout_71 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_106, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_106 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_107 = paddle._C_ops.add(layer_norm_66, dropout_70) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_69, layer_norm_70, layer_norm_71 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_107, parameter_133, parameter_132, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_132, parameter_133 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_94 = paddle._C_ops.matmul(layer_norm_69, parameter_137, False, False) + del parameter_137 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_108 = paddle._C_ops.add(matmul_94, parameter_136) + del parameter_136 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_11 = paddle._C_ops.gelu(add_108, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_95 = paddle._C_ops.matmul(gelu_11, parameter_135, False, False) + del parameter_135 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_109 = paddle._C_ops.add(matmul_95, parameter_134) + del parameter_134 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_72, dropout_73 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_109, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_109 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_110 = paddle._C_ops.add(layer_norm_69, dropout_72) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_72, layer_norm_73, layer_norm_74 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_110, parameter_131, parameter_130, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_130, parameter_131 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_96 = paddle._C_ops.matmul(layer_norm_72, parameter_129, False, False) + del parameter_129 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_111 = paddle._C_ops.add(matmul_96, parameter_128) + del parameter_128 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_48 = paddle._C_ops.reshape(add_111, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_48 = paddle._C_ops.transpose(reshape_48, [0, 2, 1, 3]) + del reshape_48 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_97 = paddle._C_ops.matmul(layer_norm_72, parameter_127, False, False) + del parameter_127 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_112 = paddle._C_ops.add(matmul_97, parameter_126) + del parameter_126 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_98 = paddle._C_ops.matmul(layer_norm_72, parameter_125, False, False) + del parameter_125 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_113 = paddle._C_ops.add(matmul_98, parameter_124) + del parameter_124 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_49 = paddle._C_ops.reshape(add_112, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_49 = paddle._C_ops.transpose(reshape_49, [0, 2, 1, 3]) + del reshape_49 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_50 = paddle._C_ops.reshape(add_113, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_50 = paddle._C_ops.transpose(reshape_50, [0, 2, 1, 3]) + del reshape_50 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_14 = paddle._C_ops.scale(transpose_48, full_6, float("0"), True) + del transpose_48 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_99 = paddle._C_ops.matmul(scale_14, transpose_49, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_114 = paddle._C_ops.add(matmul_99, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_12 = paddle._C_ops.softmax(add_114, -1) + del add_114 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_74, dropout_75 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_12, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_100 = paddle._C_ops.matmul(dropout_74, transpose_50, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_51 = paddle._C_ops.transpose(matmul_100, [0, 2, 1, 3]) + del matmul_100 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_51 = paddle._C_ops.reshape(transpose_51, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_101 = paddle._C_ops.matmul(reshape_51, parameter_123, False, False) + del parameter_123 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_115 = paddle._C_ops.add(matmul_101, parameter_122) + del parameter_122 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_76, dropout_77 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_115, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_115 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_116 = paddle._C_ops.add(layer_norm_72, dropout_76) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_75, layer_norm_76, layer_norm_77 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_116, parameter_117, parameter_116, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_116, parameter_117 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_102 = paddle._C_ops.matmul(layer_norm_75, parameter_121, False, False) + del parameter_121 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_117 = paddle._C_ops.add(matmul_102, parameter_120) + del parameter_120 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_12 = paddle._C_ops.gelu(add_117, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_103 = paddle._C_ops.matmul(gelu_12, parameter_119, False, False) + del parameter_119 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_118 = paddle._C_ops.add(matmul_103, parameter_118) + del parameter_118 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_78, dropout_79 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_118, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_118 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_119 = paddle._C_ops.add(layer_norm_75, dropout_78) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_78, layer_norm_79, layer_norm_80 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_119, parameter_115, parameter_114, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_114, parameter_115 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_104 = paddle._C_ops.matmul(layer_norm_78, parameter_113, False, False) + del parameter_113 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_120 = paddle._C_ops.add(matmul_104, parameter_112) + del parameter_112 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_52 = paddle._C_ops.reshape(add_120, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_52 = paddle._C_ops.transpose(reshape_52, [0, 2, 1, 3]) + del reshape_52 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_105 = paddle._C_ops.matmul(layer_norm_78, parameter_111, False, False) + del parameter_111 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_121 = paddle._C_ops.add(matmul_105, parameter_110) + del parameter_110 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_106 = paddle._C_ops.matmul(layer_norm_78, parameter_109, False, False) + del parameter_109 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_122 = paddle._C_ops.add(matmul_106, parameter_108) + del parameter_108 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_53 = paddle._C_ops.reshape(add_121, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_53 = paddle._C_ops.transpose(reshape_53, [0, 2, 1, 3]) + del reshape_53 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_54 = paddle._C_ops.reshape(add_122, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_54 = paddle._C_ops.transpose(reshape_54, [0, 2, 1, 3]) + del reshape_54 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_15 = paddle._C_ops.scale(transpose_52, full_6, float("0"), True) + del transpose_52 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_107 = paddle._C_ops.matmul(scale_15, transpose_53, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_123 = paddle._C_ops.add(matmul_107, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_13 = paddle._C_ops.softmax(add_123, -1) + del add_123 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_80, dropout_81 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_13, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_108 = paddle._C_ops.matmul(dropout_80, transpose_54, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_55 = paddle._C_ops.transpose(matmul_108, [0, 2, 1, 3]) + del matmul_108 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_55 = paddle._C_ops.reshape(transpose_55, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_109 = paddle._C_ops.matmul(reshape_55, parameter_107, False, False) + del parameter_107 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_124 = paddle._C_ops.add(matmul_109, parameter_106) + del parameter_106 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_82, dropout_83 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_124, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_124 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_125 = paddle._C_ops.add(layer_norm_78, dropout_82) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_81, layer_norm_82, layer_norm_83 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_125, parameter_101, parameter_100, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_100, parameter_101 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_110 = paddle._C_ops.matmul(layer_norm_81, parameter_105, False, False) + del parameter_105 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_126 = paddle._C_ops.add(matmul_110, parameter_104) + del parameter_104 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_13 = paddle._C_ops.gelu(add_126, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_111 = paddle._C_ops.matmul(gelu_13, parameter_103, False, False) + del parameter_103 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_127 = paddle._C_ops.add(matmul_111, parameter_102) + del parameter_102 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_84, dropout_85 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_127, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_127 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_128 = paddle._C_ops.add(layer_norm_81, dropout_84) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_84, layer_norm_85, layer_norm_86 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_128, parameter_99, parameter_98, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_98, parameter_99 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_112 = paddle._C_ops.matmul(layer_norm_84, parameter_97, False, False) + del parameter_97 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_129 = paddle._C_ops.add(matmul_112, parameter_96) + del parameter_96 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_56 = paddle._C_ops.reshape(add_129, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_56 = paddle._C_ops.transpose(reshape_56, [0, 2, 1, 3]) + del reshape_56 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_113 = paddle._C_ops.matmul(layer_norm_84, parameter_95, False, False) + del parameter_95 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_130 = paddle._C_ops.add(matmul_113, parameter_94) + del parameter_94 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_114 = paddle._C_ops.matmul(layer_norm_84, parameter_93, False, False) + del parameter_93 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_131 = paddle._C_ops.add(matmul_114, parameter_92) + del parameter_92 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_57 = paddle._C_ops.reshape(add_130, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_57 = paddle._C_ops.transpose(reshape_57, [0, 2, 1, 3]) + del reshape_57 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_58 = paddle._C_ops.reshape(add_131, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_58 = paddle._C_ops.transpose(reshape_58, [0, 2, 1, 3]) + del reshape_58 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_16 = paddle._C_ops.scale(transpose_56, full_6, float("0"), True) + del transpose_56 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_115 = paddle._C_ops.matmul(scale_16, transpose_57, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_132 = paddle._C_ops.add(matmul_115, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_14 = paddle._C_ops.softmax(add_132, -1) + del add_132 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_86, dropout_87 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_14, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_116 = paddle._C_ops.matmul(dropout_86, transpose_58, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_59 = paddle._C_ops.transpose(matmul_116, [0, 2, 1, 3]) + del matmul_116 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_59 = paddle._C_ops.reshape(transpose_59, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_117 = paddle._C_ops.matmul(reshape_59, parameter_91, False, False) + del parameter_91 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_133 = paddle._C_ops.add(matmul_117, parameter_90) + del parameter_90 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_88, dropout_89 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_133, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_133 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_134 = paddle._C_ops.add(layer_norm_84, dropout_88) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_87, layer_norm_88, layer_norm_89 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_134, parameter_85, parameter_84, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_84, parameter_85 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_118 = paddle._C_ops.matmul(layer_norm_87, parameter_89, False, False) + del parameter_89 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_135 = paddle._C_ops.add(matmul_118, parameter_88) + del parameter_88 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_14 = paddle._C_ops.gelu(add_135, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_119 = paddle._C_ops.matmul(gelu_14, parameter_87, False, False) + del parameter_87 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_136 = paddle._C_ops.add(matmul_119, parameter_86) + del parameter_86 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_90, dropout_91 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_136, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_136 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_137 = paddle._C_ops.add(layer_norm_87, dropout_90) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_90, layer_norm_91, layer_norm_92 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_137, parameter_83, parameter_82, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_82, parameter_83 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_120 = paddle._C_ops.matmul(layer_norm_90, parameter_81, False, False) + del parameter_81 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_138 = paddle._C_ops.add(matmul_120, parameter_80) + del parameter_80 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_60 = paddle._C_ops.reshape(add_138, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_60 = paddle._C_ops.transpose(reshape_60, [0, 2, 1, 3]) + del reshape_60 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_121 = paddle._C_ops.matmul(layer_norm_90, parameter_79, False, False) + del parameter_79 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_139 = paddle._C_ops.add(matmul_121, parameter_78) + del parameter_78 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_122 = paddle._C_ops.matmul(layer_norm_90, parameter_77, False, False) + del parameter_77 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_140 = paddle._C_ops.add(matmul_122, parameter_76) + del parameter_76 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_61 = paddle._C_ops.reshape(add_139, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_61 = paddle._C_ops.transpose(reshape_61, [0, 2, 1, 3]) + del reshape_61 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_62 = paddle._C_ops.reshape(add_140, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_62 = paddle._C_ops.transpose(reshape_62, [0, 2, 1, 3]) + del reshape_62 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_17 = paddle._C_ops.scale(transpose_60, full_6, float("0"), True) + del transpose_60 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_123 = paddle._C_ops.matmul(scale_17, transpose_61, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_141 = paddle._C_ops.add(matmul_123, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_15 = paddle._C_ops.softmax(add_141, -1) + del add_141 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_92, dropout_93 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_15, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_124 = paddle._C_ops.matmul(dropout_92, transpose_62, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_63 = paddle._C_ops.transpose(matmul_124, [0, 2, 1, 3]) + del matmul_124 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_63 = paddle._C_ops.reshape(transpose_63, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_125 = paddle._C_ops.matmul(reshape_63, parameter_75, False, False) + del parameter_75 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_142 = paddle._C_ops.add(matmul_125, parameter_74) + del parameter_74 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_94, dropout_95 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_142, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_142 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_143 = paddle._C_ops.add(layer_norm_90, dropout_94) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_93, layer_norm_94, layer_norm_95 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_143, parameter_69, parameter_68, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_68, parameter_69 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_126 = paddle._C_ops.matmul(layer_norm_93, parameter_73, False, False) + del parameter_73 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_144 = paddle._C_ops.add(matmul_126, parameter_72) + del parameter_72 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_15 = paddle._C_ops.gelu(add_144, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_127 = paddle._C_ops.matmul(gelu_15, parameter_71, False, False) + del parameter_71 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_145 = paddle._C_ops.add(matmul_127, parameter_70) + del parameter_70 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_96, dropout_97 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_145, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_145 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_146 = paddle._C_ops.add(layer_norm_93, dropout_96) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_96, layer_norm_97, layer_norm_98 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_146, parameter_67, parameter_66, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_66, parameter_67 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_128 = paddle._C_ops.matmul(layer_norm_96, parameter_65, False, False) + del parameter_65 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_147 = paddle._C_ops.add(matmul_128, parameter_64) + del parameter_64 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_64 = paddle._C_ops.reshape(add_147, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_64 = paddle._C_ops.transpose(reshape_64, [0, 2, 1, 3]) + del reshape_64 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_129 = paddle._C_ops.matmul(layer_norm_96, parameter_63, False, False) + del parameter_63 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_148 = paddle._C_ops.add(matmul_129, parameter_62) + del parameter_62 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_130 = paddle._C_ops.matmul(layer_norm_96, parameter_61, False, False) + del parameter_61 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_149 = paddle._C_ops.add(matmul_130, parameter_60) + del parameter_60 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_65 = paddle._C_ops.reshape(add_148, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_65 = paddle._C_ops.transpose(reshape_65, [0, 2, 1, 3]) + del reshape_65 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_66 = paddle._C_ops.reshape(add_149, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_66 = paddle._C_ops.transpose(reshape_66, [0, 2, 1, 3]) + del reshape_66 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_18 = paddle._C_ops.scale(transpose_64, full_6, float("0"), True) + del transpose_64 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_131 = paddle._C_ops.matmul(scale_18, transpose_65, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_150 = paddle._C_ops.add(matmul_131, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_16 = paddle._C_ops.softmax(add_150, -1) + del add_150 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_98, dropout_99 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_16, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_132 = paddle._C_ops.matmul(dropout_98, transpose_66, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_67 = paddle._C_ops.transpose(matmul_132, [0, 2, 1, 3]) + del matmul_132 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_67 = paddle._C_ops.reshape(transpose_67, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_133 = paddle._C_ops.matmul(reshape_67, parameter_59, False, False) + del parameter_59 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_151 = paddle._C_ops.add(matmul_133, parameter_58) + del parameter_58 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_100, dropout_101 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_151, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_151 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_152 = paddle._C_ops.add(layer_norm_96, dropout_100) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_99, layer_norm_100, layer_norm_101 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_152, parameter_53, parameter_52, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_52, parameter_53 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_134 = paddle._C_ops.matmul(layer_norm_99, parameter_57, False, False) + del parameter_57 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_153 = paddle._C_ops.add(matmul_134, parameter_56) + del parameter_56 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_16 = paddle._C_ops.gelu(add_153, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_135 = paddle._C_ops.matmul(gelu_16, parameter_55, False, False) + del parameter_55 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_154 = paddle._C_ops.add(matmul_135, parameter_54) + del parameter_54 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_102, dropout_103 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_154, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_154 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_155 = paddle._C_ops.add(layer_norm_99, dropout_102) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_102, layer_norm_103, layer_norm_104 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_155, parameter_51, parameter_50, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_50, parameter_51 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_136 = paddle._C_ops.matmul(layer_norm_102, parameter_49, False, False) + del parameter_49 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_156 = paddle._C_ops.add(matmul_136, parameter_48) + del parameter_48 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_68 = paddle._C_ops.reshape(add_156, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_68 = paddle._C_ops.transpose(reshape_68, [0, 2, 1, 3]) + del reshape_68 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_137 = paddle._C_ops.matmul(layer_norm_102, parameter_47, False, False) + del parameter_47 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_157 = paddle._C_ops.add(matmul_137, parameter_46) + del parameter_46 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_138 = paddle._C_ops.matmul(layer_norm_102, parameter_45, False, False) + del parameter_45 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_158 = paddle._C_ops.add(matmul_138, parameter_44) + del parameter_44 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_69 = paddle._C_ops.reshape(add_157, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_69 = paddle._C_ops.transpose(reshape_69, [0, 2, 1, 3]) + del reshape_69 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_70 = paddle._C_ops.reshape(add_158, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_70 = paddle._C_ops.transpose(reshape_70, [0, 2, 1, 3]) + del reshape_70 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_19 = paddle._C_ops.scale(transpose_68, full_6, float("0"), True) + del transpose_68 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_139 = paddle._C_ops.matmul(scale_19, transpose_69, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_159 = paddle._C_ops.add(matmul_139, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_17 = paddle._C_ops.softmax(add_159, -1) + del add_159 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_104, dropout_105 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_17, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_140 = paddle._C_ops.matmul(dropout_104, transpose_70, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_71 = paddle._C_ops.transpose(matmul_140, [0, 2, 1, 3]) + del matmul_140 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_71 = paddle._C_ops.reshape(transpose_71, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_141 = paddle._C_ops.matmul(reshape_71, parameter_43, False, False) + del parameter_43 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_160 = paddle._C_ops.add(matmul_141, parameter_42) + del parameter_42 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_106, dropout_107 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_160, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_160 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_161 = paddle._C_ops.add(layer_norm_102, dropout_106) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_105, layer_norm_106, layer_norm_107 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_161, parameter_37, parameter_36, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_36, parameter_37 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_142 = paddle._C_ops.matmul(layer_norm_105, parameter_41, False, False) + del parameter_41 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_162 = paddle._C_ops.add(matmul_142, parameter_40) + del parameter_40 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_17 = paddle._C_ops.gelu(add_162, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_143 = paddle._C_ops.matmul(gelu_17, parameter_39, False, False) + del parameter_39 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_163 = paddle._C_ops.add(matmul_143, parameter_38) + del parameter_38 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_108, dropout_109 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_163, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_163 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_164 = paddle._C_ops.add(layer_norm_105, dropout_108) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_108, layer_norm_109, layer_norm_110 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_164, parameter_35, parameter_34, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_34, parameter_35 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_144 = paddle._C_ops.matmul(layer_norm_108, parameter_33, False, False) + del parameter_33 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_165 = paddle._C_ops.add(matmul_144, parameter_32) + del parameter_32 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_72 = paddle._C_ops.reshape(add_165, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_72 = paddle._C_ops.transpose(reshape_72, [0, 2, 1, 3]) + del reshape_72 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_145 = paddle._C_ops.matmul(layer_norm_108, parameter_31, False, False) + del parameter_31 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_166 = paddle._C_ops.add(matmul_145, parameter_30) + del parameter_30 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_146 = paddle._C_ops.matmul(layer_norm_108, parameter_29, False, False) + del parameter_29 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_167 = paddle._C_ops.add(matmul_146, parameter_28) + del parameter_28 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_73 = paddle._C_ops.reshape(add_166, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_73 = paddle._C_ops.transpose(reshape_73, [0, 2, 1, 3]) + del reshape_73 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_74 = paddle._C_ops.reshape(add_167, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_74 = paddle._C_ops.transpose(reshape_74, [0, 2, 1, 3]) + del reshape_74 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_20 = paddle._C_ops.scale(transpose_72, full_6, float("0"), True) + del transpose_72 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_147 = paddle._C_ops.matmul(scale_20, transpose_73, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_168 = paddle._C_ops.add(matmul_147, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_18 = paddle._C_ops.softmax(add_168, -1) + del add_168 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_110, dropout_111 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_18, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_148 = paddle._C_ops.matmul(dropout_110, transpose_74, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_75 = paddle._C_ops.transpose(matmul_148, [0, 2, 1, 3]) + del matmul_148 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_75 = paddle._C_ops.reshape(transpose_75, full_int_array_2) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_149 = paddle._C_ops.matmul(reshape_75, parameter_27, False, False) + del parameter_27 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_169 = paddle._C_ops.add(matmul_149, parameter_26) + del parameter_26 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_112, dropout_113 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_169, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_169 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_170 = paddle._C_ops.add(layer_norm_108, dropout_112) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_111, layer_norm_112, layer_norm_113 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_170, parameter_21, parameter_20, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_20, parameter_21 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_150 = paddle._C_ops.matmul(layer_norm_111, parameter_25, False, False) + del parameter_25 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_171 = paddle._C_ops.add(matmul_150, parameter_24) + del parameter_24 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_18 = paddle._C_ops.gelu(add_171, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_151 = paddle._C_ops.matmul(gelu_18, parameter_23, False, False) + del parameter_23 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_172 = paddle._C_ops.add(matmul_151, parameter_22) + del parameter_22 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_114, dropout_115 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_172, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_172 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_173 = paddle._C_ops.add(layer_norm_111, dropout_114) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_114, layer_norm_115, layer_norm_116 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_173, parameter_19, parameter_18, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_18, parameter_19 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_152 = paddle._C_ops.matmul(layer_norm_114, parameter_17, False, False) + del parameter_17 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_174 = paddle._C_ops.add(matmul_152, parameter_16) + del parameter_16 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_76 = paddle._C_ops.reshape(add_174, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_76 = paddle._C_ops.transpose(reshape_76, [0, 2, 1, 3]) + del reshape_76 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_153 = paddle._C_ops.matmul(layer_norm_114, parameter_15, False, False) + del parameter_15 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_175 = paddle._C_ops.add(matmul_153, parameter_14) + del parameter_14 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_154 = paddle._C_ops.matmul(layer_norm_114, parameter_13, False, False) + del parameter_13 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_176 = paddle._C_ops.add(matmul_154, parameter_12) + del parameter_12 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_77 = paddle._C_ops.reshape(add_175, full_int_array_1) + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_77 = paddle._C_ops.transpose(reshape_77, [0, 2, 1, 3]) + del reshape_77 + + # pd_op.reshape: (1x21x16x64xf32) <- (1x21x1024xf32, 4xi64) + reshape_78 = paddle._C_ops.reshape(add_176, full_int_array_1) + del full_int_array_1 + + # pd_op.transpose: (1x16x21x64xf32) <- (1x21x16x64xf32) + transpose_78 = paddle._C_ops.transpose(reshape_78, [0, 2, 1, 3]) + del reshape_78 + + # pd_op.scale: (1x16x21x64xf32) <- (1x16x21x64xf32, 1xf32) + scale_21 = paddle._C_ops.scale(transpose_76, full_6, float("0"), True) + del transpose_76 + + # pd_op.matmul: (1x16x21x21xf32) <- (1x16x21x64xf32, 1x16x21x64xf32) + matmul_155 = paddle._C_ops.matmul(scale_21, transpose_77, False, True) + + # pd_op.add: (1x16x21x21xf32) <- (1x16x21x21xf32, 1x1x1x21xf32) + add_177 = paddle._C_ops.add(matmul_155, unsqueeze_0) + + # pd_op.softmax: (1x16x21x21xf32) <- (1x16x21x21xf32) + softmax_19 = paddle._C_ops.softmax(add_177, -1) + del add_177 + + # pd_op.dropout: (1x16x21x21xf32, 1x16x21x21xui8) <- (1x16x21x21xf32, None, 1xf32) + dropout_116, dropout_117 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + softmax_19, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + + # pd_op.matmul: (1x16x21x64xf32) <- (1x16x21x21xf32, 1x16x21x64xf32) + matmul_156 = paddle._C_ops.matmul(dropout_116, transpose_78, False, False) + + # pd_op.transpose: (1x21x16x64xf32) <- (1x16x21x64xf32) + transpose_79 = paddle._C_ops.transpose(matmul_156, [0, 2, 1, 3]) + del matmul_156 + + # pd_op.reshape: (1x21x1024xf32) <- (1x21x16x64xf32, 3xi64) + reshape_79 = paddle._C_ops.reshape(transpose_79, full_int_array_2) + del full_int_array_2 + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x1024xf32, 1024x1024xf32) + matmul_157 = paddle._C_ops.matmul(reshape_79, parameter_11, False, False) + del parameter_11 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_178 = paddle._C_ops.add(matmul_157, parameter_10) + del parameter_10 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_118, dropout_119 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_178, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_178 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_179 = paddle._C_ops.add(layer_norm_114, dropout_118) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_117, layer_norm_118, layer_norm_119 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_179, parameter_5, parameter_4, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_4, parameter_5 + + # pd_op.matmul: (1x21x4096xf32) <- (1x21x1024xf32, 1024x4096xf32) + matmul_158 = paddle._C_ops.matmul(layer_norm_117, parameter_9, False, False) + del parameter_9 + + # pd_op.add: (1x21x4096xf32) <- (1x21x4096xf32, 4096xf32) + add_180 = paddle._C_ops.add(matmul_158, parameter_8) + del parameter_8 + + # pd_op.gelu: (1x21x4096xf32) <- (1x21x4096xf32) + gelu_19 = paddle._C_ops.gelu(add_180, False) + + # pd_op.matmul: (1x21x1024xf32) <- (1x21x4096xf32, 4096x1024xf32) + matmul_159 = paddle._C_ops.matmul(gelu_19, parameter_7, False, False) + del parameter_7 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1024xf32) + add_181 = paddle._C_ops.add(matmul_159, parameter_6) + del parameter_6 + + # pd_op.dropout: (1x21x1024xf32, 1x21x1024xui8) <- (1x21x1024xf32, None, 1xf32) + dropout_120, dropout_121 = (lambda x, f: f(x))( + paddle._C_ops.dropout( + add_181, None, full_5, False, "upscale_in_train", 0, False + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None), + ) + del add_181 + + # pd_op.add: (1x21x1024xf32) <- (1x21x1024xf32, 1x21x1024xf32) + add_182 = paddle._C_ops.add(layer_norm_117, dropout_120) + + # pd_op.layer_norm: (1x21x1024xf32, 1x21xf32, 1x21xf32) <- (1x21x1024xf32, 1024xf32, 1024xf32) + layer_norm_120, layer_norm_121, layer_norm_122 = (lambda x, f: f(x))( + paddle._C_ops.layer_norm( + add_182, parameter_3, parameter_2, float("1e-12"), 2 + ), + lambda out: out if isinstance(out, (list, tuple)) else (out, None, None), + ) + del parameter_2, parameter_3 + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_3 = [0] + + # pd_op.full_int_array: (1xi64) <- () + full_int_array_4 = [1] + + # pd_op.slice: (1x1024xf32) <- (1x21x1024xf32, 1xi64, 1xi64) + slice_0 = paddle._C_ops.slice( + layer_norm_120, [1], full_int_array_3, full_int_array_4, [1], [1] + ) + + # pd_op.matmul: (1x1024xf32) <- (1x1024xf32, 1024x1024xf32) + matmul_160 = paddle._C_ops.matmul(slice_0, parameter_1, False, False) + del parameter_1 + + # pd_op.add: (1x1024xf32) <- (1x1024xf32, 1024xf32) + add_183 = paddle._C_ops.add(matmul_160, parameter_0) + del parameter_0 + + # pd_op.tanh: (1x1024xf32) <- (1x1024xf32) + tanh_0 = paddle._C_ops.tanh(add_183) + del ( + add_0, + add_1, + add_101, + add_102, + add_103, + add_104, + add_107, + add_108, + add_11, + add_110, + add_111, + add_112, + add_113, + add_116, + add_117, + add_119, + add_12, + add_120, + add_121, + add_122, + add_125, + add_126, + add_128, + add_129, + add_13, + add_130, + add_131, + add_134, + add_135, + add_137, + add_138, + add_139, + add_14, + add_140, + add_143, + add_144, + add_146, + add_147, + add_148, + add_149, + add_152, + add_153, + add_155, + add_156, + add_157, + add_158, + add_161, + add_162, + add_164, + add_165, + add_166, + add_167, + add_17, + add_170, + add_171, + add_173, + add_174, + add_175, + add_176, + add_179, + add_18, + add_180, + add_182, + add_183, + add_2, + add_20, + add_21, + add_22, + add_23, + add_26, + add_27, + add_29, + add_3, + add_30, + add_31, + add_32, + add_35, + add_36, + add_38, + add_39, + add_4, + add_40, + add_41, + add_44, + add_45, + add_47, + add_48, + add_49, + add_5, + add_50, + add_53, + add_54, + add_56, + add_57, + add_58, + add_59, + add_62, + add_63, + add_65, + add_66, + add_67, + add_68, + add_71, + add_72, + add_74, + add_75, + add_76, + add_77, + add_8, + add_80, + add_81, + add_83, + add_84, + add_85, + add_86, + add_89, + add_9, + add_90, + add_92, + add_93, + add_94, + add_95, + add_98, + add_99, + assign_0, + assign_1, + assign_10, + assign_11, + assign_12, + assign_13, + assign_14, + assign_15, + assign_16, + assign_17, + assign_18, + assign_19, + assign_2, + assign_20, + assign_21, + assign_22, + assign_23, + assign_24, + assign_25, + assign_26, + assign_27, + assign_28, + assign_29, + assign_3, + assign_30, + assign_31, + assign_32, + assign_33, + assign_34, + assign_35, + assign_36, + assign_37, + assign_38, + assign_39, + assign_4, + assign_40, + assign_41, + assign_42, + assign_43, + assign_44, + assign_45, + assign_46, + assign_47, + assign_48, + assign_49, + assign_5, + assign_50, + assign_51, + assign_52, + assign_53, + assign_54, + assign_55, + assign_56, + assign_57, + assign_58, + assign_59, + assign_6, + assign_60, + assign_61, + assign_62, + assign_63, + assign_64, + assign_65, + assign_66, + assign_67, + assign_68, + assign_69, + assign_7, + assign_70, + assign_71, + assign_72, + assign_73, + assign_74, + assign_75, + assign_76, + assign_77, + assign_78, + assign_8, + assign_9, + dropout_0, + dropout_1, + dropout_10, + dropout_100, + dropout_101, + dropout_102, + dropout_103, + dropout_104, + dropout_105, + dropout_106, + dropout_107, + dropout_108, + dropout_109, + dropout_11, + dropout_110, + dropout_111, + dropout_112, + dropout_113, + dropout_114, + dropout_115, + dropout_116, + dropout_117, + dropout_118, + dropout_119, + dropout_12, + dropout_120, + dropout_121, + dropout_13, + dropout_14, + dropout_15, + dropout_16, + dropout_17, + dropout_18, + dropout_19, + dropout_2, + dropout_20, + dropout_21, + dropout_22, + dropout_23, + dropout_24, + dropout_25, + dropout_26, + dropout_27, + dropout_28, + dropout_29, + dropout_3, + dropout_30, + dropout_31, + dropout_32, + dropout_33, + dropout_34, + dropout_35, + dropout_36, + dropout_37, + dropout_38, + dropout_39, + dropout_4, + dropout_40, + dropout_41, + dropout_42, + dropout_43, + dropout_44, + dropout_45, + dropout_46, + dropout_47, + dropout_48, + dropout_49, + dropout_5, + dropout_50, + dropout_51, + dropout_52, + dropout_53, + dropout_54, + dropout_55, + dropout_56, + dropout_57, + dropout_58, + dropout_59, + dropout_6, + dropout_60, + dropout_61, + dropout_62, + dropout_63, + dropout_64, + dropout_65, + dropout_66, + dropout_67, + dropout_68, + dropout_69, + dropout_7, + dropout_70, + dropout_71, + dropout_72, + dropout_73, + dropout_74, + dropout_75, + dropout_76, + dropout_77, + dropout_78, + dropout_79, + dropout_8, + dropout_80, + dropout_81, + dropout_82, + dropout_83, + dropout_84, + dropout_85, + dropout_86, + dropout_87, + dropout_88, + dropout_89, + dropout_9, + dropout_90, + dropout_91, + dropout_92, + dropout_93, + dropout_94, + dropout_95, + dropout_96, + dropout_97, + dropout_98, + dropout_99, + embedding_0, + embedding_1, + embedding_2, + embedding_3, + full_5, + full_6, + full_int_array_3, + full_int_array_4, + gelu_0, + gelu_1, + gelu_10, + gelu_11, + gelu_12, + gelu_13, + gelu_14, + gelu_15, + gelu_16, + gelu_17, + gelu_18, + gelu_19, + gelu_2, + gelu_3, + gelu_4, + gelu_5, + gelu_6, + gelu_7, + gelu_8, + gelu_9, + layer_norm_1, + layer_norm_10, + layer_norm_100, + layer_norm_101, + layer_norm_102, + layer_norm_103, + layer_norm_104, + layer_norm_105, + layer_norm_106, + layer_norm_107, + layer_norm_108, + layer_norm_109, + layer_norm_11, + layer_norm_110, + layer_norm_111, + layer_norm_112, + layer_norm_113, + layer_norm_114, + layer_norm_115, + layer_norm_116, + layer_norm_117, + layer_norm_118, + layer_norm_119, + layer_norm_12, + layer_norm_120, + layer_norm_121, + layer_norm_122, + layer_norm_13, + layer_norm_14, + layer_norm_15, + layer_norm_16, + layer_norm_17, + layer_norm_18, + layer_norm_19, + layer_norm_2, + layer_norm_20, + layer_norm_21, + layer_norm_22, + layer_norm_23, + layer_norm_24, + layer_norm_25, + layer_norm_26, + layer_norm_27, + layer_norm_28, + layer_norm_29, + layer_norm_3, + layer_norm_30, + layer_norm_31, + layer_norm_32, + layer_norm_33, + layer_norm_34, + layer_norm_35, + layer_norm_36, + layer_norm_37, + layer_norm_38, + layer_norm_39, + layer_norm_4, + layer_norm_40, + layer_norm_41, + layer_norm_42, + layer_norm_43, + layer_norm_44, + layer_norm_45, + layer_norm_46, + layer_norm_47, + layer_norm_48, + layer_norm_49, + layer_norm_5, + layer_norm_50, + layer_norm_51, + layer_norm_52, + layer_norm_53, + layer_norm_54, + layer_norm_55, + layer_norm_56, + layer_norm_57, + layer_norm_58, + layer_norm_59, + layer_norm_6, + layer_norm_60, + layer_norm_61, + layer_norm_62, + layer_norm_63, + layer_norm_64, + layer_norm_65, + layer_norm_66, + layer_norm_67, + layer_norm_68, + layer_norm_69, + layer_norm_7, + layer_norm_70, + layer_norm_71, + layer_norm_72, + layer_norm_73, + layer_norm_74, + layer_norm_75, + layer_norm_76, + layer_norm_77, + layer_norm_78, + layer_norm_79, + layer_norm_8, + layer_norm_80, + layer_norm_81, + layer_norm_82, + layer_norm_83, + layer_norm_84, + layer_norm_85, + layer_norm_86, + layer_norm_87, + layer_norm_88, + layer_norm_89, + layer_norm_9, + layer_norm_90, + layer_norm_91, + layer_norm_92, + layer_norm_93, + layer_norm_94, + layer_norm_95, + layer_norm_96, + layer_norm_97, + layer_norm_98, + layer_norm_99, + matmul_0, + matmul_1, + matmul_10, + matmul_101, + matmul_102, + matmul_103, + matmul_104, + matmul_105, + matmul_106, + matmul_107, + matmul_109, + matmul_11, + matmul_110, + matmul_111, + matmul_112, + matmul_113, + matmul_114, + matmul_115, + matmul_117, + matmul_118, + matmul_119, + matmul_120, + matmul_121, + matmul_122, + matmul_123, + matmul_125, + matmul_126, + matmul_127, + matmul_128, + matmul_129, + matmul_13, + matmul_130, + matmul_131, + matmul_133, + matmul_134, + matmul_135, + matmul_136, + matmul_137, + matmul_138, + matmul_139, + matmul_14, + matmul_141, + matmul_142, + matmul_143, + matmul_144, + matmul_145, + matmul_146, + matmul_147, + matmul_149, + matmul_15, + matmul_150, + matmul_151, + matmul_152, + matmul_153, + matmul_154, + matmul_155, + matmul_157, + matmul_158, + matmul_159, + matmul_16, + matmul_160, + matmul_17, + matmul_18, + matmul_19, + matmul_2, + matmul_21, + matmul_22, + matmul_23, + matmul_24, + matmul_25, + matmul_26, + matmul_27, + matmul_29, + matmul_3, + matmul_30, + matmul_31, + matmul_32, + matmul_33, + matmul_34, + matmul_35, + matmul_37, + matmul_38, + matmul_39, + matmul_40, + matmul_41, + matmul_42, + matmul_43, + matmul_45, + matmul_46, + matmul_47, + matmul_48, + matmul_49, + matmul_5, + matmul_50, + matmul_51, + matmul_53, + matmul_54, + matmul_55, + matmul_56, + matmul_57, + matmul_58, + matmul_59, + matmul_6, + matmul_61, + matmul_62, + matmul_63, + matmul_64, + matmul_65, + matmul_66, + matmul_67, + matmul_69, + matmul_7, + matmul_70, + matmul_71, + matmul_72, + matmul_73, + matmul_74, + matmul_75, + matmul_77, + matmul_78, + matmul_79, + matmul_8, + matmul_80, + matmul_81, + matmul_82, + matmul_83, + matmul_85, + matmul_86, + matmul_87, + matmul_88, + matmul_89, + matmul_9, + matmul_90, + matmul_91, + matmul_93, + matmul_94, + matmul_95, + matmul_96, + matmul_97, + matmul_98, + matmul_99, + reshape_11, + reshape_15, + reshape_19, + reshape_23, + reshape_27, + reshape_3, + reshape_31, + reshape_35, + reshape_39, + reshape_43, + reshape_47, + reshape_51, + reshape_55, + reshape_59, + reshape_63, + reshape_67, + reshape_7, + reshape_71, + reshape_75, + reshape_79, + scale_1, + scale_10, + scale_11, + scale_12, + scale_13, + scale_14, + scale_15, + scale_16, + scale_17, + scale_18, + scale_19, + scale_2, + scale_20, + scale_21, + scale_3, + scale_4, + scale_5, + scale_6, + scale_7, + scale_8, + scale_9, + slice_0, + softmax_0, + softmax_1, + softmax_10, + softmax_11, + softmax_12, + softmax_13, + softmax_14, + softmax_15, + softmax_16, + softmax_17, + softmax_18, + softmax_19, + softmax_2, + softmax_3, + softmax_4, + softmax_5, + softmax_6, + softmax_7, + softmax_8, + softmax_9, + subtract_0, + transpose_1, + transpose_10, + transpose_11, + transpose_13, + transpose_14, + transpose_15, + transpose_17, + transpose_18, + transpose_19, + transpose_2, + transpose_21, + transpose_22, + transpose_23, + transpose_25, + transpose_26, + transpose_27, + transpose_29, + transpose_3, + transpose_30, + transpose_31, + transpose_33, + transpose_34, + transpose_35, + transpose_37, + transpose_38, + transpose_39, + transpose_41, + transpose_42, + transpose_43, + transpose_45, + transpose_46, + transpose_47, + transpose_49, + transpose_5, + transpose_50, + transpose_51, + transpose_53, + transpose_54, + transpose_55, + transpose_57, + transpose_58, + transpose_59, + transpose_6, + transpose_61, + transpose_62, + transpose_63, + transpose_65, + transpose_66, + transpose_67, + transpose_69, + transpose_7, + transpose_70, + transpose_71, + transpose_73, + transpose_74, + transpose_75, + transpose_77, + transpose_78, + transpose_79, + transpose_9, + unsqueeze_0, + ) + + return tanh_0 diff --git a/paddle_samples/PaddleNLP/utc-xbase/weight_meta.py b/paddle_samples/PaddleNLP/utc-xbase/weight_meta.py new file mode 100644 index 0000000000..bdfb4d269e --- /dev/null +++ b/paddle_samples/PaddleNLP/utc-xbase/weight_meta.py @@ -0,0 +1,3606 @@ +class Program_weight_tensor_parameter_0: + name = "parameter_0" + shape = [1024] + dtype = "float32" + min_val = float("-0.109667") + max_val = float("0.12303") + mean = float("-0.000310284") + std = float("0.0348649") + data = None + + +class Program_weight_tensor_parameter_1: + name = "parameter_1" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.228068") + max_val = float("0.26728") + mean = float("-1.47218e-05") + std = float("0.0394229") + data = None + + +class Program_weight_tensor_parameter_2: + name = "parameter_2" + shape = [1024] + dtype = "float32" + min_val = float("-0.828803") + max_val = float("1.09272") + mean = float("0.0272909") + std = float("0.0558877") + data = None + + +class Program_weight_tensor_parameter_3: + name = "parameter_3" + shape = [1024] + dtype = "float32" + min_val = float("0.133532") + max_val = float("1.0233") + mean = float("0.858187") + std = float("0.0332869") + data = None + + +class Program_weight_tensor_parameter_4: + name = "parameter_4" + shape = [1024] + dtype = "float32" + min_val = float("-1.44178") + max_val = float("1.65127") + mean = float("-0.00812931") + std = float("0.146645") + data = None + + +class Program_weight_tensor_parameter_5: + name = "parameter_5" + shape = [1024] + dtype = "float32" + min_val = float("0.756563") + max_val = float("2.48717") + mean = float("0.875208") + std = float("0.0741845") + data = None + + +class Program_weight_tensor_parameter_6: + name = "parameter_6" + shape = [1024] + dtype = "float32" + min_val = float("-0.224701") + max_val = float("0.838322") + mean = float("0.000279913") + std = float("0.0600961") + data = None + + +class Program_weight_tensor_parameter_7: + name = "parameter_7" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-0.960493") + max_val = float("2.63798") + mean = float("-5.08755e-05") + std = float("0.0396145") + data = None + + +class Program_weight_tensor_parameter_8: + name = "parameter_8" + shape = [4096] + dtype = "float32" + min_val = float("-0.287533") + max_val = float("0.230884") + mean = float("-0.066034") + std = float("0.0346714") + data = None + + +class Program_weight_tensor_parameter_9: + name = "parameter_9" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.505827") + max_val = float("0.454849") + mean = float("4.74701e-05") + std = float("0.0410264") + data = None + + +class Program_weight_tensor_parameter_10: + name = "parameter_10" + shape = [1024] + dtype = "float32" + min_val = float("-0.671723") + max_val = float("0.210119") + mean = float("-0.000993608") + std = float("0.0395049") + data = None + + +class Program_weight_tensor_parameter_11: + name = "parameter_11" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-1.02") + max_val = float("1.08613") + mean = float("7.32043e-06") + std = float("0.0353247") + data = None + + +class Program_weight_tensor_parameter_12: + name = "parameter_12" + shape = [1024] + dtype = "float32" + min_val = float("-0.0925895") + max_val = float("0.105828") + mean = float("-0.000621844") + std = float("0.0261636") + data = None + + +class Program_weight_tensor_parameter_13: + name = "parameter_13" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.291031") + max_val = float("0.213538") + mean = float("-5.13288e-05") + std = float("0.0373407") + data = None + + +class Program_weight_tensor_parameter_14: + name = "parameter_14" + shape = [1024] + dtype = "float32" + min_val = float("-20.2271") + max_val = float("18.059") + mean = float("0.120436") + std = float("5.21199") + data = None + + +class Program_weight_tensor_parameter_15: + name = "parameter_15" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.569125") + max_val = float("0.436485") + mean = float("-1.17772e-06") + std = float("0.0464604") + data = None + + +class Program_weight_tensor_parameter_16: + name = "parameter_16" + shape = [1024] + dtype = "float32" + min_val = float("-0.566006") + max_val = float("0.554621") + mean = float("0.00176073") + std = float("0.104797") + data = None + + +class Program_weight_tensor_parameter_17: + name = "parameter_17" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.279315") + max_val = float("0.289382") + mean = float("2.31019e-05") + std = float("0.049205") + data = None + + +class Program_weight_tensor_parameter_18: + name = "parameter_18" + shape = [1024] + dtype = "float32" + min_val = float("-1.16011") + max_val = float("0.721698") + mean = float("0.0196586") + std = float("0.0633994") + data = None + + +class Program_weight_tensor_parameter_19: + name = "parameter_19" + shape = [1024] + dtype = "float32" + min_val = float("0.303703") + max_val = float("1.02262") + mean = float("0.871917") + std = float("0.032298") + data = None + + +class Program_weight_tensor_parameter_20: + name = "parameter_20" + shape = [1024] + dtype = "float32" + min_val = float("-1.91225") + max_val = float("1.56845") + mean = float("0.0121872") + std = float("0.163252") + data = None + + +class Program_weight_tensor_parameter_21: + name = "parameter_21" + shape = [1024] + dtype = "float32" + min_val = float("0.733577") + max_val = float("1.65157") + mean = float("0.851182") + std = float("0.0522935") + data = None + + +class Program_weight_tensor_parameter_22: + name = "parameter_22" + shape = [1024] + dtype = "float32" + min_val = float("-0.32819") + max_val = float("0.410076") + mean = float("-1.09304e-05") + std = float("0.050747") + data = None + + +class Program_weight_tensor_parameter_23: + name = "parameter_23" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-0.758702") + max_val = float("2.66932") + mean = float("-1.34056e-05") + std = float("0.0399517") + data = None + + +class Program_weight_tensor_parameter_24: + name = "parameter_24" + shape = [4096] + dtype = "float32" + min_val = float("-0.265841") + max_val = float("0.167564") + mean = float("-0.0604884") + std = float("0.0391023") + data = None + + +class Program_weight_tensor_parameter_25: + name = "parameter_25" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.568146") + max_val = float("0.442915") + mean = float("-3.39941e-05") + std = float("0.042283") + data = None + + +class Program_weight_tensor_parameter_26: + name = "parameter_26" + shape = [1024] + dtype = "float32" + min_val = float("-0.797868") + max_val = float("0.484688") + mean = float("-0.000638106") + std = float("0.0500454") + data = None + + +class Program_weight_tensor_parameter_27: + name = "parameter_27" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.52824") + max_val = float("0.595446") + mean = float("-8.73279e-06") + std = float("0.0330133") + data = None + + +class Program_weight_tensor_parameter_28: + name = "parameter_28" + shape = [1024] + dtype = "float32" + min_val = float("-0.138759") + max_val = float("0.122495") + mean = float("0.000476156") + std = float("0.029288") + data = None + + +class Program_weight_tensor_parameter_29: + name = "parameter_29" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.200107") + max_val = float("0.178461") + mean = float("3.45385e-05") + std = float("0.0355515") + data = None + + +class Program_weight_tensor_parameter_30: + name = "parameter_30" + shape = [1024] + dtype = "float32" + min_val = float("-13.1723") + max_val = float("14.4558") + mean = float("0.223718") + std = float("3.7208") + data = None + + +class Program_weight_tensor_parameter_31: + name = "parameter_31" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.474989") + max_val = float("0.484521") + mean = float("-5.07499e-06") + std = float("0.0477928") + data = None + + +class Program_weight_tensor_parameter_32: + name = "parameter_32" + shape = [1024] + dtype = "float32" + min_val = float("-0.506805") + max_val = float("0.656387") + mean = float("0.00308268") + std = float("0.0972508") + data = None + + +class Program_weight_tensor_parameter_33: + name = "parameter_33" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.268329") + max_val = float("0.308928") + mean = float("5.96224e-06") + std = float("0.049251") + data = None + + +class Program_weight_tensor_parameter_34: + name = "parameter_34" + shape = [1024] + dtype = "float32" + min_val = float("-1.09385") + max_val = float("0.680655") + mean = float("0.0245246") + std = float("0.0622288") + data = None + + +class Program_weight_tensor_parameter_35: + name = "parameter_35" + shape = [1024] + dtype = "float32" + min_val = float("0.406052") + max_val = float("1.01752") + mean = float("0.871215") + std = float("0.0331038") + data = None + + +class Program_weight_tensor_parameter_36: + name = "parameter_36" + shape = [1024] + dtype = "float32" + min_val = float("-2.05657") + max_val = float("1.70446") + mean = float("0.021261") + std = float("0.167496") + data = None + + +class Program_weight_tensor_parameter_37: + name = "parameter_37" + shape = [1024] + dtype = "float32" + min_val = float("0.762874") + max_val = float("1.97898") + mean = float("0.865966") + std = float("0.0587441") + data = None + + +class Program_weight_tensor_parameter_38: + name = "parameter_38" + shape = [1024] + dtype = "float32" + min_val = float("-0.449178") + max_val = float("0.56253") + mean = float("-0.000450146") + std = float("0.0537242") + data = None + + +class Program_weight_tensor_parameter_39: + name = "parameter_39" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-0.684172") + max_val = float("2.66828") + mean = float("-2.2996e-06") + std = float("0.0393385") + data = None + + +class Program_weight_tensor_parameter_40: + name = "parameter_40" + shape = [4096] + dtype = "float32" + min_val = float("-0.252285") + max_val = float("0.198122") + mean = float("-0.0614744") + std = float("0.040616") + data = None + + +class Program_weight_tensor_parameter_41: + name = "parameter_41" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.517035") + max_val = float("0.431703") + mean = float("4.25756e-05") + std = float("0.0418044") + data = None + + +class Program_weight_tensor_parameter_42: + name = "parameter_42" + shape = [1024] + dtype = "float32" + min_val = float("-0.119642") + max_val = float("0.672734") + mean = float("-0.000773515") + std = float("0.043217") + data = None + + +class Program_weight_tensor_parameter_43: + name = "parameter_43" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.680798") + max_val = float("0.733653") + mean = float("1.42445e-05") + std = float("0.0363595") + data = None + + +class Program_weight_tensor_parameter_44: + name = "parameter_44" + shape = [1024] + dtype = "float32" + min_val = float("-0.116182") + max_val = float("0.101519") + mean = float("-0.00183285") + std = float("0.0256833") + data = None + + +class Program_weight_tensor_parameter_45: + name = "parameter_45" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.214823") + max_val = float("0.2239") + mean = float("4.89658e-06") + std = float("0.0383135") + data = None + + +class Program_weight_tensor_parameter_46: + name = "parameter_46" + shape = [1024] + dtype = "float32" + min_val = float("-10.8041") + max_val = float("10.6571") + mean = float("-0.0399811") + std = float("3.17404") + data = None + + +class Program_weight_tensor_parameter_47: + name = "parameter_47" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.469957") + max_val = float("0.429592") + mean = float("3.45267e-05") + std = float("0.0457953") + data = None + + +class Program_weight_tensor_parameter_48: + name = "parameter_48" + shape = [1024] + dtype = "float32" + min_val = float("-0.559159") + max_val = float("0.545465") + mean = float("0.000903577") + std = float("0.0974717") + data = None + + +class Program_weight_tensor_parameter_49: + name = "parameter_49" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.251893") + max_val = float("0.306874") + mean = float("-2.28528e-05") + std = float("0.0468427") + data = None + + +class Program_weight_tensor_parameter_50: + name = "parameter_50" + shape = [1024] + dtype = "float32" + min_val = float("-0.732306") + max_val = float("0.554004") + mean = float("0.0237684") + std = float("0.0497968") + data = None + + +class Program_weight_tensor_parameter_51: + name = "parameter_51" + shape = [1024] + dtype = "float32" + min_val = float("0.406368") + max_val = float("1.07838") + mean = float("0.865294") + std = float("0.0354385") + data = None + + +class Program_weight_tensor_parameter_52: + name = "parameter_52" + shape = [1024] + dtype = "float32" + min_val = float("-1.95255") + max_val = float("1.64872") + mean = float("0.0202454") + std = float("0.157618") + data = None + + +class Program_weight_tensor_parameter_53: + name = "parameter_53" + shape = [1024] + dtype = "float32" + min_val = float("0.729948") + max_val = float("2.1483") + mean = float("0.87337") + std = float("0.0747648") + data = None + + +class Program_weight_tensor_parameter_54: + name = "parameter_54" + shape = [1024] + dtype = "float32" + min_val = float("-0.398544") + max_val = float("0.843633") + mean = float("-0.000593114") + std = float("0.0637866") + data = None + + +class Program_weight_tensor_parameter_55: + name = "parameter_55" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-1.44077") + max_val = float("2.76295") + mean = float("-1.46834e-06") + std = float("0.0398615") + data = None + + +class Program_weight_tensor_parameter_56: + name = "parameter_56" + shape = [4096] + dtype = "float32" + min_val = float("-0.209874") + max_val = float("0.106413") + mean = float("-0.0620237") + std = float("0.0403566") + data = None + + +class Program_weight_tensor_parameter_57: + name = "parameter_57" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.698412") + max_val = float("0.498706") + mean = float("5.68828e-05") + std = float("0.0432223") + data = None + + +class Program_weight_tensor_parameter_58: + name = "parameter_58" + shape = [1024] + dtype = "float32" + min_val = float("-0.143755") + max_val = float("0.597615") + mean = float("-0.00062107") + std = float("0.0382264") + data = None + + +class Program_weight_tensor_parameter_59: + name = "parameter_59" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.460259") + max_val = float("0.71463") + mean = float("-2.41339e-06") + std = float("0.0337098") + data = None + + +class Program_weight_tensor_parameter_60: + name = "parameter_60" + shape = [1024] + dtype = "float32" + min_val = float("-0.0919018") + max_val = float("0.0955784") + mean = float("-0.000391972") + std = float("0.0218029") + data = None + + +class Program_weight_tensor_parameter_61: + name = "parameter_61" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.22218") + max_val = float("0.232871") + mean = float("-2.38141e-05") + std = float("0.03575") + data = None + + +class Program_weight_tensor_parameter_62: + name = "parameter_62" + shape = [1024] + dtype = "float32" + min_val = float("-8.23645") + max_val = float("8.62211") + mean = float("-0.063479") + std = float("2.79473") + data = None + + +class Program_weight_tensor_parameter_63: + name = "parameter_63" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.46862") + max_val = float("0.571056") + mean = float("-1.2659e-05") + std = float("0.0485") + data = None + + +class Program_weight_tensor_parameter_64: + name = "parameter_64" + shape = [1024] + dtype = "float32" + min_val = float("-0.407792") + max_val = float("0.533543") + mean = float("-0.000836271") + std = float("0.0875412") + data = None + + +class Program_weight_tensor_parameter_65: + name = "parameter_65" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.342689") + max_val = float("0.368896") + mean = float("2.60771e-06") + std = float("0.0499286") + data = None + + +class Program_weight_tensor_parameter_66: + name = "parameter_66" + shape = [1024] + dtype = "float32" + min_val = float("-0.651139") + max_val = float("0.475482") + mean = float("0.0244089") + std = float("0.0476016") + data = None + + +class Program_weight_tensor_parameter_67: + name = "parameter_67" + shape = [1024] + dtype = "float32" + min_val = float("0.4407") + max_val = float("1.05511") + mean = float("0.88698") + std = float("0.0402825") + data = None + + +class Program_weight_tensor_parameter_68: + name = "parameter_68" + shape = [1024] + dtype = "float32" + min_val = float("-1.27358") + max_val = float("1.23507") + mean = float("0.0222017") + std = float("0.140361") + data = None + + +class Program_weight_tensor_parameter_69: + name = "parameter_69" + shape = [1024] + dtype = "float32" + min_val = float("0.779986") + max_val = float("1.81463") + mean = float("0.916117") + std = float("0.0654241") + data = None + + +class Program_weight_tensor_parameter_70: + name = "parameter_70" + shape = [1024] + dtype = "float32" + min_val = float("-0.504222") + max_val = float("0.750932") + mean = float("-0.000736501") + std = float("0.0613394") + data = None + + +class Program_weight_tensor_parameter_71: + name = "parameter_71" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-1.09472") + max_val = float("2.48228") + mean = float("3.826e-05") + std = float("0.0391324") + data = None + + +class Program_weight_tensor_parameter_72: + name = "parameter_72" + shape = [4096] + dtype = "float32" + min_val = float("-0.212922") + max_val = float("0.345054") + mean = float("-0.0601406") + std = float("0.0357403") + data = None + + +class Program_weight_tensor_parameter_73: + name = "parameter_73" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.583319") + max_val = float("0.425219") + mean = float("9.5263e-05") + std = float("0.0429137") + data = None + + +class Program_weight_tensor_parameter_74: + name = "parameter_74" + shape = [1024] + dtype = "float32" + min_val = float("-0.194831") + max_val = float("0.493957") + mean = float("-0.000476783") + std = float("0.0376055") + data = None + + +class Program_weight_tensor_parameter_75: + name = "parameter_75" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.787399") + max_val = float("0.603686") + mean = float("-2.22993e-06") + std = float("0.034805") + data = None + + +class Program_weight_tensor_parameter_76: + name = "parameter_76" + shape = [1024] + dtype = "float32" + min_val = float("-0.0767059") + max_val = float("0.0891327") + mean = float("-0.000275383") + std = float("0.0208885") + data = None + + +class Program_weight_tensor_parameter_77: + name = "parameter_77" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.208358") + max_val = float("0.2074") + mean = float("2.17082e-05") + std = float("0.0368688") + data = None + + +class Program_weight_tensor_parameter_78: + name = "parameter_78" + shape = [1024] + dtype = "float32" + min_val = float("-15.9508") + max_val = float("15.2001") + mean = float("-0.0481218") + std = float("3.25305") + data = None + + +class Program_weight_tensor_parameter_79: + name = "parameter_79" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.543048") + max_val = float("0.643943") + mean = float("-2.73886e-05") + std = float("0.048817") + data = None + + +class Program_weight_tensor_parameter_80: + name = "parameter_80" + shape = [1024] + dtype = "float32" + min_val = float("-0.327272") + max_val = float("0.484995") + mean = float("0.00442531") + std = float("0.0762732") + data = None + + +class Program_weight_tensor_parameter_81: + name = "parameter_81" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.341118") + max_val = float("0.379088") + mean = float("2.43307e-05") + std = float("0.0500873") + data = None + + +class Program_weight_tensor_parameter_82: + name = "parameter_82" + shape = [1024] + dtype = "float32" + min_val = float("-0.349151") + max_val = float("1.16416") + mean = float("0.028211") + std = float("0.0524169") + data = None + + +class Program_weight_tensor_parameter_83: + name = "parameter_83" + shape = [1024] + dtype = "float32" + min_val = float("0.467617") + max_val = float("1.04764") + mean = float("0.928781") + std = float("0.0428357") + data = None + + +class Program_weight_tensor_parameter_84: + name = "parameter_84" + shape = [1024] + dtype = "float32" + min_val = float("-0.877464") + max_val = float("1.86832") + mean = float("0.0207404") + std = float("0.149934") + data = None + + +class Program_weight_tensor_parameter_85: + name = "parameter_85" + shape = [1024] + dtype = "float32" + min_val = float("0.74926") + max_val = float("1.94937") + mean = float("0.880244") + std = float("0.0636873") + data = None + + +class Program_weight_tensor_parameter_86: + name = "parameter_86" + shape = [1024] + dtype = "float32" + min_val = float("-0.318582") + max_val = float("0.517164") + mean = float("-0.000244457") + std = float("0.0567782") + data = None + + +class Program_weight_tensor_parameter_87: + name = "parameter_87" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-0.978036") + max_val = float("2.24416") + mean = float("-2.02552e-05") + std = float("0.039108") + data = None + + +class Program_weight_tensor_parameter_88: + name = "parameter_88" + shape = [4096] + dtype = "float32" + min_val = float("-0.246747") + max_val = float("0.508359") + mean = float("-0.0537877") + std = float("0.0345854") + data = None + + +class Program_weight_tensor_parameter_89: + name = "parameter_89" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.458404") + max_val = float("0.470342") + mean = float("8.05214e-05") + std = float("0.043129") + data = None + + +class Program_weight_tensor_parameter_90: + name = "parameter_90" + shape = [1024] + dtype = "float32" + min_val = float("-0.225243") + max_val = float("0.815776") + mean = float("-0.000779974") + std = float("0.0453249") + data = None + + +class Program_weight_tensor_parameter_91: + name = "parameter_91" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.595827") + max_val = float("0.56934") + mean = float("3.52122e-07") + std = float("0.0337109") + data = None + + +class Program_weight_tensor_parameter_92: + name = "parameter_92" + shape = [1024] + dtype = "float32" + min_val = float("-0.10175") + max_val = float("0.112869") + mean = float("-0.000243365") + std = float("0.024408") + data = None + + +class Program_weight_tensor_parameter_93: + name = "parameter_93" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.203108") + max_val = float("0.199607") + mean = float("-7.88851e-05") + std = float("0.0363058") + data = None + + +class Program_weight_tensor_parameter_94: + name = "parameter_94" + shape = [1024] + dtype = "float32" + min_val = float("-6.20397") + max_val = float("6.75067") + mean = float("0.020526") + std = float("1.87858") + data = None + + +class Program_weight_tensor_parameter_95: + name = "parameter_95" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.390288") + max_val = float("0.399946") + mean = float("-1.80559e-05") + std = float("0.047051") + data = None + + +class Program_weight_tensor_parameter_96: + name = "parameter_96" + shape = [1024] + dtype = "float32" + min_val = float("-0.425979") + max_val = float("0.469562") + mean = float("0.00458326") + std = float("0.0878673") + data = None + + +class Program_weight_tensor_parameter_97: + name = "parameter_97" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.348547") + max_val = float("0.362461") + mean = float("6.3419e-05") + std = float("0.0476552") + data = None + + +class Program_weight_tensor_parameter_98: + name = "parameter_98" + shape = [1024] + dtype = "float32" + min_val = float("-0.125942") + max_val = float("0.772703") + mean = float("0.0271556") + std = float("0.0505859") + data = None + + +class Program_weight_tensor_parameter_99: + name = "parameter_99" + shape = [1024] + dtype = "float32" + min_val = float("0.526406") + max_val = float("1.00378") + mean = float("0.854921") + std = float("0.0464374") + data = None + + +class Program_weight_tensor_parameter_100: + name = "parameter_100" + shape = [1024] + dtype = "float32" + min_val = float("-0.641643") + max_val = float("2.03184") + mean = float("0.0144202") + std = float("0.164012") + data = None + + +class Program_weight_tensor_parameter_101: + name = "parameter_101" + shape = [1024] + dtype = "float32" + min_val = float("0.76041") + max_val = float("1.90432") + mean = float("0.884678") + std = float("0.0634359") + data = None + + +class Program_weight_tensor_parameter_102: + name = "parameter_102" + shape = [1024] + dtype = "float32" + min_val = float("-0.398017") + max_val = float("0.42132") + mean = float("-0.000263011") + std = float("0.0641327") + data = None + + +class Program_weight_tensor_parameter_103: + name = "parameter_103" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-1.02287") + max_val = float("2.8231") + mean = float("6.19542e-06") + std = float("0.0392523") + data = None + + +class Program_weight_tensor_parameter_104: + name = "parameter_104" + shape = [4096] + dtype = "float32" + min_val = float("-0.25304") + max_val = float("0.330353") + mean = float("-0.0606505") + std = float("0.0314248") + data = None + + +class Program_weight_tensor_parameter_105: + name = "parameter_105" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.540307") + max_val = float("0.482988") + mean = float("0.000182716") + std = float("0.042781") + data = None + + +class Program_weight_tensor_parameter_106: + name = "parameter_106" + shape = [1024] + dtype = "float32" + min_val = float("-0.143753") + max_val = float("0.907684") + mean = float("-0.000734568") + std = float("0.046809") + data = None + + +class Program_weight_tensor_parameter_107: + name = "parameter_107" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.425938") + max_val = float("0.414272") + mean = float("2.52213e-07") + std = float("0.0362289") + data = None + + +class Program_weight_tensor_parameter_108: + name = "parameter_108" + shape = [1024] + dtype = "float32" + min_val = float("-0.184381") + max_val = float("0.0698598") + mean = float("-0.00154896") + std = float("0.0213505") + data = None + + +class Program_weight_tensor_parameter_109: + name = "parameter_109" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.218216") + max_val = float("0.20645") + mean = float("-6.85879e-05") + std = float("0.0387279") + data = None + + +class Program_weight_tensor_parameter_110: + name = "parameter_110" + shape = [1024] + dtype = "float32" + min_val = float("-6.96266") + max_val = float("6.37581") + mean = float("-0.0250941") + std = float("1.69348") + data = None + + +class Program_weight_tensor_parameter_111: + name = "parameter_111" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.34703") + max_val = float("0.381541") + mean = float("-2.79736e-06") + std = float("0.045062") + data = None + + +class Program_weight_tensor_parameter_112: + name = "parameter_112" + shape = [1024] + dtype = "float32" + min_val = float("-0.405107") + max_val = float("0.465034") + mean = float("-0.00200562") + std = float("0.0802251") + data = None + + +class Program_weight_tensor_parameter_113: + name = "parameter_113" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.292183") + max_val = float("0.329296") + mean = float("-0.00010565") + std = float("0.045425") + data = None + + +class Program_weight_tensor_parameter_114: + name = "parameter_114" + shape = [1024] + dtype = "float32" + min_val = float("-0.213844") + max_val = float("1.40377") + mean = float("0.0199602") + std = float("0.0663399") + data = None + + +class Program_weight_tensor_parameter_115: + name = "parameter_115" + shape = [1024] + dtype = "float32" + min_val = float("0.346154") + max_val = float("1.0012") + mean = float("0.821234") + std = float("0.0431359") + data = None + + +class Program_weight_tensor_parameter_116: + name = "parameter_116" + shape = [1024] + dtype = "float32" + min_val = float("-0.991806") + max_val = float("2.33485") + mean = float("0.0032795") + std = float("0.157206") + data = None + + +class Program_weight_tensor_parameter_117: + name = "parameter_117" + shape = [1024] + dtype = "float32" + min_val = float("0.769764") + max_val = float("2.4883") + mean = float("0.889708") + std = float("0.0766849") + data = None + + +class Program_weight_tensor_parameter_118: + name = "parameter_118" + shape = [1024] + dtype = "float32" + min_val = float("-0.449651") + max_val = float("0.363426") + mean = float("1.06036e-05") + std = float("0.0655297") + data = None + + +class Program_weight_tensor_parameter_119: + name = "parameter_119" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-0.601161") + max_val = float("3.38592") + mean = float("-1.48421e-06") + std = float("0.0401377") + data = None + + +class Program_weight_tensor_parameter_120: + name = "parameter_120" + shape = [4096] + dtype = "float32" + min_val = float("-0.318705") + max_val = float("0.134623") + mean = float("-0.0594812") + std = float("0.0266945") + data = None + + +class Program_weight_tensor_parameter_121: + name = "parameter_121" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.361919") + max_val = float("0.429215") + mean = float("0.000198937") + std = float("0.0438809") + data = None + + +class Program_weight_tensor_parameter_122: + name = "parameter_122" + shape = [1024] + dtype = "float32" + min_val = float("-0.368877") + max_val = float("0.815259") + mean = float("-0.0010476") + std = float("0.0467429") + data = None + + +class Program_weight_tensor_parameter_123: + name = "parameter_123" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.290397") + max_val = float("0.272571") + mean = float("-2.37633e-06") + std = float("0.0351738") + data = None + + +class Program_weight_tensor_parameter_124: + name = "parameter_124" + shape = [1024] + dtype = "float32" + min_val = float("-0.0771337") + max_val = float("0.120211") + mean = float("-0.000336974") + std = float("0.0204067") + data = None + + +class Program_weight_tensor_parameter_125: + name = "parameter_125" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.21345") + max_val = float("0.209263") + mean = float("2.3083e-05") + std = float("0.037769") + data = None + + +class Program_weight_tensor_parameter_126: + name = "parameter_126" + shape = [1024] + dtype = "float32" + min_val = float("-4.83315") + max_val = float("5.11304") + mean = float("-0.00595032") + std = float("1.461") + data = None + + +class Program_weight_tensor_parameter_127: + name = "parameter_127" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.316024") + max_val = float("0.282019") + mean = float("2.79383e-05") + std = float("0.0451561") + data = None + + +class Program_weight_tensor_parameter_128: + name = "parameter_128" + shape = [1024] + dtype = "float32" + min_val = float("-0.490598") + max_val = float("0.536243") + mean = float("-0.000224198") + std = float("0.080099") + data = None + + +class Program_weight_tensor_parameter_129: + name = "parameter_129" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.304782") + max_val = float("0.359943") + mean = float("-2.40214e-05") + std = float("0.0452987") + data = None + + +class Program_weight_tensor_parameter_130: + name = "parameter_130" + shape = [1024] + dtype = "float32" + min_val = float("-0.1898") + max_val = float("0.942493") + mean = float("0.0103801") + std = float("0.0603311") + data = None + + +class Program_weight_tensor_parameter_131: + name = "parameter_131" + shape = [1024] + dtype = "float32" + min_val = float("0.184788") + max_val = float("0.944508") + mean = float("0.79502") + std = float("0.0439908") + data = None + + +class Program_weight_tensor_parameter_132: + name = "parameter_132" + shape = [1024] + dtype = "float32" + min_val = float("-1.62751") + max_val = float("2.03852") + mean = float("-0.00798735") + std = float("0.182111") + data = None + + +class Program_weight_tensor_parameter_133: + name = "parameter_133" + shape = [1024] + dtype = "float32" + min_val = float("0.711052") + max_val = float("2.36278") + mean = float("0.898818") + std = float("0.0758345") + data = None + + +class Program_weight_tensor_parameter_134: + name = "parameter_134" + shape = [1024] + dtype = "float32" + min_val = float("-0.239985") + max_val = float("0.192234") + mean = float("-0.000542245") + std = float("0.056172") + data = None + + +class Program_weight_tensor_parameter_135: + name = "parameter_135" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-0.770121") + max_val = float("3.6544") + mean = float("3.8213e-06") + std = float("0.0417932") + data = None + + +class Program_weight_tensor_parameter_136: + name = "parameter_136" + shape = [4096] + dtype = "float32" + min_val = float("-0.234855") + max_val = float("0.245937") + mean = float("-0.0613096") + std = float("0.0279813") + data = None + + +class Program_weight_tensor_parameter_137: + name = "parameter_137" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.408789") + max_val = float("0.341603") + mean = float("0.000213194") + std = float("0.0443568") + data = None + + +class Program_weight_tensor_parameter_138: + name = "parameter_138" + shape = [1024] + dtype = "float32" + min_val = float("-0.71853") + max_val = float("0.579714") + mean = float("-0.0012385") + std = float("0.0453222") + data = None + + +class Program_weight_tensor_parameter_139: + name = "parameter_139" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.382412") + max_val = float("0.36352") + mean = float("-1.45815e-06") + std = float("0.0378923") + data = None + + +class Program_weight_tensor_parameter_140: + name = "parameter_140" + shape = [1024] + dtype = "float32" + min_val = float("-0.110511") + max_val = float("0.077015") + mean = float("-0.000184519") + std = float("0.0177346") + data = None + + +class Program_weight_tensor_parameter_141: + name = "parameter_141" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.314881") + max_val = float("0.322322") + mean = float("3.35261e-05") + std = float("0.0411541") + data = None + + +class Program_weight_tensor_parameter_142: + name = "parameter_142" + shape = [1024] + dtype = "float32" + min_val = float("-6.00239") + max_val = float("5.94108") + mean = float("-0.00174831") + std = float("1.41015") + data = None + + +class Program_weight_tensor_parameter_143: + name = "parameter_143" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.308886") + max_val = float("0.335845") + mean = float("-9.82469e-06") + std = float("0.0438601") + data = None + + +class Program_weight_tensor_parameter_144: + name = "parameter_144" + shape = [1024] + dtype = "float32" + min_val = float("-0.518165") + max_val = float("0.538689") + mean = float("0.00124768") + std = float("0.0745167") + data = None + + +class Program_weight_tensor_parameter_145: + name = "parameter_145" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.320046") + max_val = float("0.305661") + mean = float("1.63272e-05") + std = float("0.0438538") + data = None + + +class Program_weight_tensor_parameter_146: + name = "parameter_146" + shape = [1024] + dtype = "float32" + min_val = float("-0.235557") + max_val = float("0.940811") + mean = float("-0.000286628") + std = float("0.0611333") + data = None + + +class Program_weight_tensor_parameter_147: + name = "parameter_147" + shape = [1024] + dtype = "float32" + min_val = float("0.203569") + max_val = float("1.22107") + mean = float("0.799742") + std = float("0.0472235") + data = None + + +class Program_weight_tensor_parameter_148: + name = "parameter_148" + shape = [1024] + dtype = "float32" + min_val = float("-2.07874") + max_val = float("1.43998") + mean = float("-0.0125868") + std = float("0.179131") + data = None + + +class Program_weight_tensor_parameter_149: + name = "parameter_149" + shape = [1024] + dtype = "float32" + min_val = float("0.768518") + max_val = float("2.046") + mean = float("0.911229") + std = float("0.0835893") + data = None + + +class Program_weight_tensor_parameter_150: + name = "parameter_150" + shape = [1024] + dtype = "float32" + min_val = float("-0.302542") + max_val = float("0.210339") + mean = float("9.58145e-05") + std = float("0.0621263") + data = None + + +class Program_weight_tensor_parameter_151: + name = "parameter_151" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-1.33504") + max_val = float("3.82938") + mean = float("-2.19615e-05") + std = float("0.0424158") + data = None + + +class Program_weight_tensor_parameter_152: + name = "parameter_152" + shape = [4096] + dtype = "float32" + min_val = float("-0.193622") + max_val = float("0.317142") + mean = float("-0.060676") + std = float("0.0275539") + data = None + + +class Program_weight_tensor_parameter_153: + name = "parameter_153" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.522062") + max_val = float("0.447469") + mean = float("0.000187562") + std = float("0.045517") + data = None + + +class Program_weight_tensor_parameter_154: + name = "parameter_154" + shape = [1024] + dtype = "float32" + min_val = float("-0.836213") + max_val = float("0.293386") + mean = float("-0.000561607") + std = float("0.0471986") + data = None + + +class Program_weight_tensor_parameter_155: + name = "parameter_155" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.377717") + max_val = float("0.475401") + mean = float("-1.95247e-06") + std = float("0.0356703") + data = None + + +class Program_weight_tensor_parameter_156: + name = "parameter_156" + shape = [1024] + dtype = "float32" + min_val = float("-0.0661734") + max_val = float("0.0710802") + mean = float("0.000579249") + std = float("0.0167373") + data = None + + +class Program_weight_tensor_parameter_157: + name = "parameter_157" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.19631") + max_val = float("0.184189") + mean = float("1.34876e-05") + std = float("0.0385181") + data = None + + +class Program_weight_tensor_parameter_158: + name = "parameter_158" + shape = [1024] + dtype = "float32" + min_val = float("-4.46037") + max_val = float("4.66842") + mean = float("-0.0611445") + std = float("1.40916") + data = None + + +class Program_weight_tensor_parameter_159: + name = "parameter_159" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.540496") + max_val = float("0.449869") + mean = float("1.469e-05") + std = float("0.043603") + data = None + + +class Program_weight_tensor_parameter_160: + name = "parameter_160" + shape = [1024] + dtype = "float32" + min_val = float("-0.432967") + max_val = float("0.468255") + mean = float("-0.000388845") + std = float("0.066502") + data = None + + +class Program_weight_tensor_parameter_161: + name = "parameter_161" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.30851") + max_val = float("0.331414") + mean = float("-5.00892e-05") + std = float("0.0439041") + data = None + + +class Program_weight_tensor_parameter_162: + name = "parameter_162" + shape = [1024] + dtype = "float32" + min_val = float("-0.302107") + max_val = float("0.635114") + mean = float("-0.0150733") + std = float("0.0627261") + data = None + + +class Program_weight_tensor_parameter_163: + name = "parameter_163" + shape = [1024] + dtype = "float32" + min_val = float("0.37308") + max_val = float("1.10436") + mean = float("0.83957") + std = float("0.0458408") + data = None + + +class Program_weight_tensor_parameter_164: + name = "parameter_164" + shape = [1024] + dtype = "float32" + min_val = float("-1.93698") + max_val = float("0.843292") + mean = float("-0.0126771") + std = float("0.164465") + data = None + + +class Program_weight_tensor_parameter_165: + name = "parameter_165" + shape = [1024] + dtype = "float32" + min_val = float("0.819789") + max_val = float("2.12976") + mean = float("0.957158") + std = float("0.071556") + data = None + + +class Program_weight_tensor_parameter_166: + name = "parameter_166" + shape = [1024] + dtype = "float32" + min_val = float("-0.492453") + max_val = float("0.541528") + mean = float("0.000372893") + std = float("0.0664933") + data = None + + +class Program_weight_tensor_parameter_167: + name = "parameter_167" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-1.84985") + max_val = float("2.26564") + mean = float("-6.46931e-06") + std = float("0.0432151") + data = None + + +class Program_weight_tensor_parameter_168: + name = "parameter_168" + shape = [4096] + dtype = "float32" + min_val = float("-0.167589") + max_val = float("0.214474") + mean = float("-0.059078") + std = float("0.0218611") + data = None + + +class Program_weight_tensor_parameter_169: + name = "parameter_169" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.459637") + max_val = float("0.437489") + mean = float("0.000131236") + std = float("0.0470443") + data = None + + +class Program_weight_tensor_parameter_170: + name = "parameter_170" + shape = [1024] + dtype = "float32" + min_val = float("-0.691571") + max_val = float("0.251699") + mean = float("-5.21132e-05") + std = float("0.050033") + data = None + + +class Program_weight_tensor_parameter_171: + name = "parameter_171" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.355774") + max_val = float("0.416938") + mean = float("-1.05167e-05") + std = float("0.0352418") + data = None + + +class Program_weight_tensor_parameter_172: + name = "parameter_172" + shape = [1024] + dtype = "float32" + min_val = float("-0.0808865") + max_val = float("0.118057") + mean = float("0.000697454") + std = float("0.0178535") + data = None + + +class Program_weight_tensor_parameter_173: + name = "parameter_173" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.248606") + max_val = float("0.217081") + mean = float("-5.0093e-05") + std = float("0.0376758") + data = None + + +class Program_weight_tensor_parameter_174: + name = "parameter_174" + shape = [1024] + dtype = "float32" + min_val = float("-4.02521") + max_val = float("4.677") + mean = float("0.00873048") + std = float("1.21155") + data = None + + +class Program_weight_tensor_parameter_175: + name = "parameter_175" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.350841") + max_val = float("0.499485") + mean = float("-1.65763e-05") + std = float("0.0437139") + data = None + + +class Program_weight_tensor_parameter_176: + name = "parameter_176" + shape = [1024] + dtype = "float32" + min_val = float("-0.552479") + max_val = float("0.386911") + mean = float("2.90971e-05") + std = float("0.0757677") + data = None + + +class Program_weight_tensor_parameter_177: + name = "parameter_177" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.292778") + max_val = float("0.353237") + mean = float("-5.5581e-05") + std = float("0.0443271") + data = None + + +class Program_weight_tensor_parameter_178: + name = "parameter_178" + shape = [1024] + dtype = "float32" + min_val = float("-0.226098") + max_val = float("0.477497") + mean = float("-0.0206557") + std = float("0.0551932") + data = None + + +class Program_weight_tensor_parameter_179: + name = "parameter_179" + shape = [1024] + dtype = "float32" + min_val = float("0.36922") + max_val = float("0.997781") + mean = float("0.83628") + std = float("0.0447417") + data = None + + +class Program_weight_tensor_parameter_180: + name = "parameter_180" + shape = [1024] + dtype = "float32" + min_val = float("-1.88391") + max_val = float("0.786434") + mean = float("-0.0120058") + std = float("0.185504") + data = None + + +class Program_weight_tensor_parameter_181: + name = "parameter_181" + shape = [1024] + dtype = "float32" + min_val = float("0.841685") + max_val = float("2.08375") + mean = float("0.966726") + std = float("0.065212") + data = None + + +class Program_weight_tensor_parameter_182: + name = "parameter_182" + shape = [1024] + dtype = "float32" + min_val = float("-0.640868") + max_val = float("0.787592") + mean = float("0.000454441") + std = float("0.0745513") + data = None + + +class Program_weight_tensor_parameter_183: + name = "parameter_183" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-2.22028") + max_val = float("1.49989") + mean = float("-1.00778e-05") + std = float("0.0434109") + data = None + + +class Program_weight_tensor_parameter_184: + name = "parameter_184" + shape = [4096] + dtype = "float32" + min_val = float("-0.207696") + max_val = float("0.124275") + mean = float("-0.0622137") + std = float("0.0231397") + data = None + + +class Program_weight_tensor_parameter_185: + name = "parameter_185" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.40061") + max_val = float("0.35687") + mean = float("0.000131829") + std = float("0.0470053") + data = None + + +class Program_weight_tensor_parameter_186: + name = "parameter_186" + shape = [1024] + dtype = "float32" + min_val = float("-0.423887") + max_val = float("0.271995") + mean = float("0.000135862") + std = float("0.0518182") + data = None + + +class Program_weight_tensor_parameter_187: + name = "parameter_187" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.294172") + max_val = float("0.535642") + mean = float("9.83466e-06") + std = float("0.0347763") + data = None + + +class Program_weight_tensor_parameter_188: + name = "parameter_188" + shape = [1024] + dtype = "float32" + min_val = float("-0.0868673") + max_val = float("0.13556") + mean = float("0.000118951") + std = float("0.023148") + data = None + + +class Program_weight_tensor_parameter_189: + name = "parameter_189" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.222209") + max_val = float("0.213131") + mean = float("-7.88644e-05") + std = float("0.0365866") + data = None + + +class Program_weight_tensor_parameter_190: + name = "parameter_190" + shape = [1024] + dtype = "float32" + min_val = float("-5.25709") + max_val = float("4.85018") + mean = float("0.000121225") + std = float("1.48066") + data = None + + +class Program_weight_tensor_parameter_191: + name = "parameter_191" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.734347") + max_val = float("0.432454") + mean = float("-1.10934e-05") + std = float("0.0428612") + data = None + + +class Program_weight_tensor_parameter_192: + name = "parameter_192" + shape = [1024] + dtype = "float32" + min_val = float("-0.39884") + max_val = float("0.534821") + mean = float("0.00025624") + std = float("0.0696553") + data = None + + +class Program_weight_tensor_parameter_193: + name = "parameter_193" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.39313") + max_val = float("0.33438") + mean = float("4.48665e-05") + std = float("0.0433809") + data = None + + +class Program_weight_tensor_parameter_194: + name = "parameter_194" + shape = [1024] + dtype = "float32" + min_val = float("-0.355357") + max_val = float("0.231222") + mean = float("-0.0218124") + std = float("0.0666578") + data = None + + +class Program_weight_tensor_parameter_195: + name = "parameter_195" + shape = [1024] + dtype = "float32" + min_val = float("0.390035") + max_val = float("0.988255") + mean = float("0.808735") + std = float("0.0485752") + data = None + + +class Program_weight_tensor_parameter_196: + name = "parameter_196" + shape = [1024] + dtype = "float32" + min_val = float("-2.03733") + max_val = float("0.630075") + mean = float("-0.0109949") + std = float("0.17034") + data = None + + +class Program_weight_tensor_parameter_197: + name = "parameter_197" + shape = [1024] + dtype = "float32" + min_val = float("0.817321") + max_val = float("2.14733") + mean = float("0.970982") + std = float("0.0686087") + data = None + + +class Program_weight_tensor_parameter_198: + name = "parameter_198" + shape = [1024] + dtype = "float32" + min_val = float("-0.57632") + max_val = float("0.596925") + mean = float("0.000135688") + std = float("0.0782691") + data = None + + +class Program_weight_tensor_parameter_199: + name = "parameter_199" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-2.1346") + max_val = float("0.925853") + mean = float("-1.84993e-05") + std = float("0.0437326") + data = None + + +class Program_weight_tensor_parameter_200: + name = "parameter_200" + shape = [4096] + dtype = "float32" + min_val = float("-0.152141") + max_val = float("0.0842414") + mean = float("-0.0601831") + std = float("0.0187411") + data = None + + +class Program_weight_tensor_parameter_201: + name = "parameter_201" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.341477") + max_val = float("0.420533") + mean = float("9.58547e-05") + std = float("0.0473729") + data = None + + +class Program_weight_tensor_parameter_202: + name = "parameter_202" + shape = [1024] + dtype = "float32" + min_val = float("-0.599971") + max_val = float("0.19868") + mean = float("-0.000200895") + std = float("0.0561623") + data = None + + +class Program_weight_tensor_parameter_203: + name = "parameter_203" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.34667") + max_val = float("0.316547") + mean = float("-7.42529e-06") + std = float("0.0337007") + data = None + + +class Program_weight_tensor_parameter_204: + name = "parameter_204" + shape = [1024] + dtype = "float32" + min_val = float("-0.106748") + max_val = float("0.15115") + mean = float("0.000270795") + std = float("0.021875") + data = None + + +class Program_weight_tensor_parameter_205: + name = "parameter_205" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.332563") + max_val = float("0.209497") + mean = float("-6.41018e-05") + std = float("0.0358305") + data = None + + +class Program_weight_tensor_parameter_206: + name = "parameter_206" + shape = [1024] + dtype = "float32" + min_val = float("-4.9304") + max_val = float("4.72399") + mean = float("0.0204614") + std = float("1.61814") + data = None + + +class Program_weight_tensor_parameter_207: + name = "parameter_207" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.46287") + max_val = float("0.504786") + mean = float("1.67172e-05") + std = float("0.0425254") + data = None + + +class Program_weight_tensor_parameter_208: + name = "parameter_208" + shape = [1024] + dtype = "float32" + min_val = float("-0.353761") + max_val = float("0.481787") + mean = float("0.000374188") + std = float("0.0664596") + data = None + + +class Program_weight_tensor_parameter_209: + name = "parameter_209" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.332026") + max_val = float("0.319801") + mean = float("-3.67894e-05") + std = float("0.0433283") + data = None + + +class Program_weight_tensor_parameter_210: + name = "parameter_210" + shape = [1024] + dtype = "float32" + min_val = float("-0.463938") + max_val = float("0.253202") + mean = float("-0.0243825") + std = float("0.0694694") + data = None + + +class Program_weight_tensor_parameter_211: + name = "parameter_211" + shape = [1024] + dtype = "float32" + min_val = float("0.492569") + max_val = float("1.02988") + mean = float("0.834181") + std = float("0.0484199") + data = None + + +class Program_weight_tensor_parameter_212: + name = "parameter_212" + shape = [1024] + dtype = "float32" + min_val = float("-1.97992") + max_val = float("0.751561") + mean = float("-0.0103537") + std = float("0.175927") + data = None + + +class Program_weight_tensor_parameter_213: + name = "parameter_213" + shape = [1024] + dtype = "float32" + min_val = float("0.844239") + max_val = float("2.06872") + mean = float("0.973033") + std = float("0.0677535") + data = None + + +class Program_weight_tensor_parameter_214: + name = "parameter_214" + shape = [1024] + dtype = "float32" + min_val = float("-0.398354") + max_val = float("0.434863") + mean = float("-0.000193617") + std = float("0.0785058") + data = None + + +class Program_weight_tensor_parameter_215: + name = "parameter_215" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-2.4502") + max_val = float("1.02576") + mean = float("-7.01289e-06") + std = float("0.0445044") + data = None + + +class Program_weight_tensor_parameter_216: + name = "parameter_216" + shape = [4096] + dtype = "float32" + min_val = float("-0.184713") + max_val = float("0.161436") + mean = float("-0.0603951") + std = float("0.0184365") + data = None + + +class Program_weight_tensor_parameter_217: + name = "parameter_217" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.331602") + max_val = float("0.293291") + mean = float("0.000159755") + std = float("0.047831") + data = None + + +class Program_weight_tensor_parameter_218: + name = "parameter_218" + shape = [1024] + dtype = "float32" + min_val = float("-0.404902") + max_val = float("0.23355") + mean = float("2.27185e-05") + std = float("0.0588298") + data = None + + +class Program_weight_tensor_parameter_219: + name = "parameter_219" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.349367") + max_val = float("0.748019") + mean = float("-8.70392e-06") + std = float("0.0342899") + data = None + + +class Program_weight_tensor_parameter_220: + name = "parameter_220" + shape = [1024] + dtype = "float32" + min_val = float("-0.10397") + max_val = float("0.149985") + mean = float("0.000198984") + std = float("0.0203617") + data = None + + +class Program_weight_tensor_parameter_221: + name = "parameter_221" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.207198") + max_val = float("0.209513") + mean = float("8.24163e-06") + std = float("0.0372729") + data = None + + +class Program_weight_tensor_parameter_222: + name = "parameter_222" + shape = [1024] + dtype = "float32" + min_val = float("-5.03153") + max_val = float("5.2182") + mean = float("-0.109778") + std = float("1.85797") + data = None + + +class Program_weight_tensor_parameter_223: + name = "parameter_223" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.528866") + max_val = float("0.449585") + mean = float("-1.76103e-06") + std = float("0.0420585") + data = None + + +class Program_weight_tensor_parameter_224: + name = "parameter_224" + shape = [1024] + dtype = "float32" + min_val = float("-0.458368") + max_val = float("0.499181") + mean = float("0.000493577") + std = float("0.0704913") + data = None + + +class Program_weight_tensor_parameter_225: + name = "parameter_225" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.369091") + max_val = float("0.397998") + mean = float("-8.53004e-05") + std = float("0.0430338") + data = None + + +class Program_weight_tensor_parameter_226: + name = "parameter_226" + shape = [1024] + dtype = "float32" + min_val = float("-0.796062") + max_val = float("0.259031") + mean = float("-0.0239364") + std = float("0.0746942") + data = None + + +class Program_weight_tensor_parameter_227: + name = "parameter_227" + shape = [1024] + dtype = "float32" + min_val = float("0.373671") + max_val = float("1.01622") + mean = float("0.841784") + std = float("0.0486579") + data = None + + +class Program_weight_tensor_parameter_228: + name = "parameter_228" + shape = [1024] + dtype = "float32" + min_val = float("-1.9909") + max_val = float("1.24984") + mean = float("-0.00584053") + std = float("0.178982") + data = None + + +class Program_weight_tensor_parameter_229: + name = "parameter_229" + shape = [1024] + dtype = "float32" + min_val = float("0.834366") + max_val = float("2.07999") + mean = float("0.971535") + std = float("0.0729809") + data = None + + +class Program_weight_tensor_parameter_230: + name = "parameter_230" + shape = [1024] + dtype = "float32" + min_val = float("-0.416096") + max_val = float("0.370792") + mean = float("-6.17901e-05") + std = float("0.0831642") + data = None + + +class Program_weight_tensor_parameter_231: + name = "parameter_231" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-3.83076") + max_val = float("0.714941") + mean = float("-1.16265e-05") + std = float("0.0448252") + data = None + + +class Program_weight_tensor_parameter_232: + name = "parameter_232" + shape = [4096] + dtype = "float32" + min_val = float("-0.139753") + max_val = float("0.0946625") + mean = float("-0.0602229") + std = float("0.015916") + data = None + + +class Program_weight_tensor_parameter_233: + name = "parameter_233" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.652324") + max_val = float("0.449177") + mean = float("9.49839e-05") + std = float("0.0477737") + data = None + + +class Program_weight_tensor_parameter_234: + name = "parameter_234" + shape = [1024] + dtype = "float32" + min_val = float("-0.688466") + max_val = float("0.4898") + mean = float("0.000293583") + std = float("0.052006") + data = None + + +class Program_weight_tensor_parameter_235: + name = "parameter_235" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.474426") + max_val = float("0.754772") + mean = float("1.29011e-05") + std = float("0.0335825") + data = None + + +class Program_weight_tensor_parameter_236: + name = "parameter_236" + shape = [1024] + dtype = "float32" + min_val = float("-0.0657855") + max_val = float("0.0709183") + mean = float("-0.000854948") + std = float("0.0162781") + data = None + + +class Program_weight_tensor_parameter_237: + name = "parameter_237" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.23378") + max_val = float("0.214949") + mean = float("1.7144e-05") + std = float("0.0372596") + data = None + + +class Program_weight_tensor_parameter_238: + name = "parameter_238" + shape = [1024] + dtype = "float32" + min_val = float("-5.60581") + max_val = float("5.73265") + mean = float("0.112788") + std = float("2.14715") + data = None + + +class Program_weight_tensor_parameter_239: + name = "parameter_239" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.376193") + max_val = float("0.380796") + mean = float("4.21058e-05") + std = float("0.040449") + data = None + + +class Program_weight_tensor_parameter_240: + name = "parameter_240" + shape = [1024] + dtype = "float32" + min_val = float("-0.452683") + max_val = float("0.439828") + mean = float("-0.000890881") + std = float("0.0739864") + data = None + + +class Program_weight_tensor_parameter_241: + name = "parameter_241" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.421967") + max_val = float("0.445917") + mean = float("-6.74419e-06") + std = float("0.0416452") + data = None + + +class Program_weight_tensor_parameter_242: + name = "parameter_242" + shape = [1024] + dtype = "float32" + min_val = float("-0.936374") + max_val = float("0.251192") + mean = float("-0.016166") + std = float("0.0750656") + data = None + + +class Program_weight_tensor_parameter_243: + name = "parameter_243" + shape = [1024] + dtype = "float32" + min_val = float("0.140298") + max_val = float("1.00461") + mean = float("0.851388") + std = float("0.0458309") + data = None + + +class Program_weight_tensor_parameter_244: + name = "parameter_244" + shape = [1024] + dtype = "float32" + min_val = float("-2.0986") + max_val = float("2.25206") + mean = float("0.00247574") + std = float("0.195952") + data = None + + +class Program_weight_tensor_parameter_245: + name = "parameter_245" + shape = [1024] + dtype = "float32" + min_val = float("0.785527") + max_val = float("2.25701") + mean = float("0.968401") + std = float("0.0814599") + data = None + + +class Program_weight_tensor_parameter_246: + name = "parameter_246" + shape = [1024] + dtype = "float32" + min_val = float("-0.410728") + max_val = float("0.471995") + mean = float("0.000344424") + std = float("0.0989173") + data = None + + +class Program_weight_tensor_parameter_247: + name = "parameter_247" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-4.49786") + max_val = float("0.777573") + mean = float("-3.15702e-05") + std = float("0.0448057") + data = None + + +class Program_weight_tensor_parameter_248: + name = "parameter_248" + shape = [4096] + dtype = "float32" + min_val = float("-0.133458") + max_val = float("0.0659306") + mean = float("-0.0602515") + std = float("0.0153779") + data = None + + +class Program_weight_tensor_parameter_249: + name = "parameter_249" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.535721") + max_val = float("0.437152") + mean = float("1.62065e-05") + std = float("0.0477011") + data = None + + +class Program_weight_tensor_parameter_250: + name = "parameter_250" + shape = [1024] + dtype = "float32" + min_val = float("-0.454064") + max_val = float("0.681818") + mean = float("6.2942e-05") + std = float("0.0603099") + data = None + + +class Program_weight_tensor_parameter_251: + name = "parameter_251" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.528543") + max_val = float("0.591533") + mean = float("9.35326e-07") + std = float("0.0340503") + data = None + + +class Program_weight_tensor_parameter_252: + name = "parameter_252" + shape = [1024] + dtype = "float32" + min_val = float("-0.12405") + max_val = float("0.0954732") + mean = float("-0.000429642") + std = float("0.0187012") + data = None + + +class Program_weight_tensor_parameter_253: + name = "parameter_253" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.189238") + max_val = float("0.186658") + mean = float("-4.49103e-05") + std = float("0.0376047") + data = None + + +class Program_weight_tensor_parameter_254: + name = "parameter_254" + shape = [1024] + dtype = "float32" + min_val = float("-5.89314") + max_val = float("5.5602") + mean = float("0.0681234") + std = float("2.32958") + data = None + + +class Program_weight_tensor_parameter_255: + name = "parameter_255" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.347598") + max_val = float("0.462532") + mean = float("4.04686e-05") + std = float("0.0425447") + data = None + + +class Program_weight_tensor_parameter_256: + name = "parameter_256" + shape = [1024] + dtype = "float32" + min_val = float("-0.456737") + max_val = float("0.604412") + mean = float("0.00282517") + std = float("0.0661391") + data = None + + +class Program_weight_tensor_parameter_257: + name = "parameter_257" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.310478") + max_val = float("0.338168") + mean = float("-4.01779e-05") + std = float("0.0432356") + data = None + + +class Program_weight_tensor_parameter_258: + name = "parameter_258" + shape = [1024] + dtype = "float32" + min_val = float("-0.786046") + max_val = float("0.216225") + mean = float("-0.0018346") + std = float("0.0668864") + data = None + + +class Program_weight_tensor_parameter_259: + name = "parameter_259" + shape = [1024] + dtype = "float32" + min_val = float("0.259398") + max_val = float("1.0235") + mean = float("0.885232") + std = float("0.0506651") + data = None + + +class Program_weight_tensor_parameter_260: + name = "parameter_260" + shape = [1024] + dtype = "float32" + min_val = float("-1.90102") + max_val = float("1.96087") + mean = float("0.0088865") + std = float("0.185482") + data = None + + +class Program_weight_tensor_parameter_261: + name = "parameter_261" + shape = [1024] + dtype = "float32" + min_val = float("0.76713") + max_val = float("2.0366") + mean = float("0.979649") + std = float("0.0780366") + data = None + + +class Program_weight_tensor_parameter_262: + name = "parameter_262" + shape = [1024] + dtype = "float32" + min_val = float("-0.390896") + max_val = float("0.37858") + mean = float("-0.000148754") + std = float("0.0923103") + data = None + + +class Program_weight_tensor_parameter_263: + name = "parameter_263" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-3.5622") + max_val = float("1.66579") + mean = float("-3.1158e-05") + std = float("0.0449254") + data = None + + +class Program_weight_tensor_parameter_264: + name = "parameter_264" + shape = [4096] + dtype = "float32" + min_val = float("-0.150746") + max_val = float("0.102974") + mean = float("-0.0605871") + std = float("0.0155634") + data = None + + +class Program_weight_tensor_parameter_265: + name = "parameter_265" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.620615") + max_val = float("0.413") + mean = float("-1.12441e-05") + std = float("0.0477616") + data = None + + +class Program_weight_tensor_parameter_266: + name = "parameter_266" + shape = [1024] + dtype = "float32" + min_val = float("-0.527421") + max_val = float("0.642856") + mean = float("0.000220085") + std = float("0.0698131") + data = None + + +class Program_weight_tensor_parameter_267: + name = "parameter_267" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.506842") + max_val = float("0.411796") + mean = float("1.02369e-06") + std = float("0.0285618") + data = None + + +class Program_weight_tensor_parameter_268: + name = "parameter_268" + shape = [1024] + dtype = "float32" + min_val = float("-0.0944259") + max_val = float("0.0879589") + mean = float("0.000509157") + std = float("0.0176293") + data = None + + +class Program_weight_tensor_parameter_269: + name = "parameter_269" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.254153") + max_val = float("0.245438") + mean = float("-3.30448e-05") + std = float("0.0317838") + data = None + + +class Program_weight_tensor_parameter_270: + name = "parameter_270" + shape = [1024] + dtype = "float32" + min_val = float("-4.6147") + max_val = float("4.60157") + mean = float("-0.0950461") + std = float("1.93599") + data = None + + +class Program_weight_tensor_parameter_271: + name = "parameter_271" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.439672") + max_val = float("0.459225") + mean = float("4.0968e-06") + std = float("0.0395477") + data = None + + +class Program_weight_tensor_parameter_272: + name = "parameter_272" + shape = [1024] + dtype = "float32" + min_val = float("-0.354839") + max_val = float("0.384207") + mean = float("-0.00152028") + std = float("0.0610267") + data = None + + +class Program_weight_tensor_parameter_273: + name = "parameter_273" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.296777") + max_val = float("0.299064") + mean = float("1.04407e-05") + std = float("0.0411855") + data = None + + +class Program_weight_tensor_parameter_274: + name = "parameter_274" + shape = [1024] + dtype = "float32" + min_val = float("-0.941908") + max_val = float("0.305852") + mean = float("0.0157111") + std = float("0.0813882") + data = None + + +class Program_weight_tensor_parameter_275: + name = "parameter_275" + shape = [1024] + dtype = "float32" + min_val = float("0.393158") + max_val = float("1.08561") + mean = float("0.885416") + std = float("0.0582507") + data = None + + +class Program_weight_tensor_parameter_276: + name = "parameter_276" + shape = [1024] + dtype = "float32" + min_val = float("-1.78475") + max_val = float("2.13616") + mean = float("0.00923119") + std = float("0.204167") + data = None + + +class Program_weight_tensor_parameter_277: + name = "parameter_277" + shape = [1024] + dtype = "float32" + min_val = float("0.815845") + max_val = float("2.19893") + mean = float("0.988519") + std = float("0.0734347") + data = None + + +class Program_weight_tensor_parameter_278: + name = "parameter_278" + shape = [1024] + dtype = "float32" + min_val = float("-0.447988") + max_val = float("0.408752") + mean = float("-7.29141e-05") + std = float("0.0990147") + data = None + + +class Program_weight_tensor_parameter_279: + name = "parameter_279" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-1.67494") + max_val = float("2.48525") + mean = float("-1.50499e-06") + std = float("0.04503") + data = None + + +class Program_weight_tensor_parameter_280: + name = "parameter_280" + shape = [4096] + dtype = "float32" + min_val = float("-0.130953") + max_val = float("0.058752") + mean = float("-0.0594859") + std = float("0.0158067") + data = None + + +class Program_weight_tensor_parameter_281: + name = "parameter_281" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.337668") + max_val = float("0.266275") + mean = float("4.4483e-05") + std = float("0.048029") + data = None + + +class Program_weight_tensor_parameter_282: + name = "parameter_282" + shape = [1024] + dtype = "float32" + min_val = float("-0.305927") + max_val = float("0.668946") + mean = float("-0.000397661") + std = float("0.0675731") + data = None + + +class Program_weight_tensor_parameter_283: + name = "parameter_283" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.28257") + max_val = float("0.39333") + mean = float("1.30311e-05") + std = float("0.0289804") + data = None + + +class Program_weight_tensor_parameter_284: + name = "parameter_284" + shape = [1024] + dtype = "float32" + min_val = float("-0.0991313") + max_val = float("0.183748") + mean = float("0.00142281") + std = float("0.01809") + data = None + + +class Program_weight_tensor_parameter_285: + name = "parameter_285" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.189261") + max_val = float("0.200929") + mean = float("-4.88603e-05") + std = float("0.0320965") + data = None + + +class Program_weight_tensor_parameter_286: + name = "parameter_286" + shape = [1024] + dtype = "float32" + min_val = float("-4.72085") + max_val = float("5.09041") + mean = float("-0.0528521") + std = float("1.67574") + data = None + + +class Program_weight_tensor_parameter_287: + name = "parameter_287" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.417967") + max_val = float("0.421562") + mean = float("-1.37061e-06") + std = float("0.0376486") + data = None + + +class Program_weight_tensor_parameter_288: + name = "parameter_288" + shape = [1024] + dtype = "float32" + min_val = float("-0.440276") + max_val = float("0.464728") + mean = float("-0.000372022") + std = float("0.0636703") + data = None + + +class Program_weight_tensor_parameter_289: + name = "parameter_289" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.311547") + max_val = float("0.327576") + mean = float("3.64293e-05") + std = float("0.0388486") + data = None + + +class Program_weight_tensor_parameter_290: + name = "parameter_290" + shape = [1024] + dtype = "float32" + min_val = float("-0.832812") + max_val = float("0.360577") + mean = float("0.0197386") + std = float("0.0785429") + data = None + + +class Program_weight_tensor_parameter_291: + name = "parameter_291" + shape = [1024] + dtype = "float32" + min_val = float("0.441643") + max_val = float("1.03545") + mean = float("0.878254") + std = float("0.0572239") + data = None + + +class Program_weight_tensor_parameter_292: + name = "parameter_292" + shape = [1024] + dtype = "float32" + min_val = float("-1.57479") + max_val = float("2.12085") + mean = float("0.0114295") + std = float("0.206515") + data = None + + +class Program_weight_tensor_parameter_293: + name = "parameter_293" + shape = [1024] + dtype = "float32" + min_val = float("0.821111") + max_val = float("2.23282") + mean = float("0.990809") + std = float("0.0804874") + data = None + + +class Program_weight_tensor_parameter_294: + name = "parameter_294" + shape = [1024] + dtype = "float32" + min_val = float("-0.360933") + max_val = float("0.499383") + mean = float("-0.000350924") + std = float("0.107586") + data = None + + +class Program_weight_tensor_parameter_295: + name = "parameter_295" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-1.08267") + max_val = float("2.65327") + mean = float("-3.26631e-05") + std = float("0.0443415") + data = None + + +class Program_weight_tensor_parameter_296: + name = "parameter_296" + shape = [4096] + dtype = "float32" + min_val = float("-0.125224") + max_val = float("0.0787336") + mean = float("-0.0633795") + std = float("0.0162259") + data = None + + +class Program_weight_tensor_parameter_297: + name = "parameter_297" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.320222") + max_val = float("0.315752") + mean = float("9.77071e-06") + std = float("0.046676") + data = None + + +class Program_weight_tensor_parameter_298: + name = "parameter_298" + shape = [1024] + dtype = "float32" + min_val = float("-0.316534") + max_val = float("0.652375") + mean = float("-0.000507655") + std = float("0.0867803") + data = None + + +class Program_weight_tensor_parameter_299: + name = "parameter_299" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.894505") + max_val = float("0.545689") + mean = float("-1.91619e-06") + std = float("0.0278144") + data = None + + +class Program_weight_tensor_parameter_300: + name = "parameter_300" + shape = [1024] + dtype = "float32" + min_val = float("-0.158846") + max_val = float("0.106994") + mean = float("0.000261068") + std = float("0.0215746") + data = None + + +class Program_weight_tensor_parameter_301: + name = "parameter_301" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.208101") + max_val = float("0.202789") + mean = float("-1.94002e-05") + std = float("0.0292179") + data = None + + +class Program_weight_tensor_parameter_302: + name = "parameter_302" + shape = [1024] + dtype = "float32" + min_val = float("-5.15342") + max_val = float("5.01401") + mean = float("0.126831") + std = float("1.55616") + data = None + + +class Program_weight_tensor_parameter_303: + name = "parameter_303" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.394899") + max_val = float("0.431749") + mean = float("-1.03804e-05") + std = float("0.0384029") + data = None + + +class Program_weight_tensor_parameter_304: + name = "parameter_304" + shape = [1024] + dtype = "float32" + min_val = float("-0.772058") + max_val = float("0.795616") + mean = float("0.0024652") + std = float("0.091139") + data = None + + +class Program_weight_tensor_parameter_305: + name = "parameter_305" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.379615") + max_val = float("0.299149") + mean = float("-2.4116e-05") + std = float("0.0397046") + data = None + + +class Program_weight_tensor_parameter_306: + name = "parameter_306" + shape = [1024] + dtype = "float32" + min_val = float("-0.659021") + max_val = float("0.621035") + mean = float("0.0204517") + std = float("0.0861176") + data = None + + +class Program_weight_tensor_parameter_307: + name = "parameter_307" + shape = [1024] + dtype = "float32" + min_val = float("0.329969") + max_val = float("1.09281") + mean = float("0.869545") + std = float("0.0658685") + data = None + + +class Program_weight_tensor_parameter_308: + name = "parameter_308" + shape = [1024] + dtype = "float32" + min_val = float("-1.89088") + max_val = float("2.6452") + mean = float("0.00979987") + std = float("0.261005") + data = None + + +class Program_weight_tensor_parameter_309: + name = "parameter_309" + shape = [1024] + dtype = "float32" + min_val = float("0.861549") + max_val = float("2.31069") + mean = float("0.997541") + std = float("0.0721418") + data = None + + +class Program_weight_tensor_parameter_310: + name = "parameter_310" + shape = [1024] + dtype = "float32" + min_val = float("-0.45393") + max_val = float("0.385771") + mean = float("-0.000908001") + std = float("0.0829224") + data = None + + +class Program_weight_tensor_parameter_311: + name = "parameter_311" + shape = [4096, 1024] + dtype = "float32" + min_val = float("-1.01878") + max_val = float("2.82061") + mean = float("-1.80134e-05") + std = float("0.0405797") + data = None + + +class Program_weight_tensor_parameter_312: + name = "parameter_312" + shape = [4096] + dtype = "float32" + min_val = float("-0.427268") + max_val = float("0.12174") + mean = float("-0.0825004") + std = float("0.0222412") + data = None + + +class Program_weight_tensor_parameter_313: + name = "parameter_313" + shape = [1024, 4096] + dtype = "float32" + min_val = float("-0.503751") + max_val = float("0.390497") + mean = float("6.71481e-05") + std = float("0.0402383") + data = None + + +class Program_weight_tensor_parameter_314: + name = "parameter_314" + shape = [1024] + dtype = "float32" + min_val = float("-0.301582") + max_val = float("0.972091") + mean = float("-0.000814253") + std = float("0.0889075") + data = None + + +class Program_weight_tensor_parameter_315: + name = "parameter_315" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.619248") + max_val = float("0.488464") + mean = float("-3.73973e-06") + std = float("0.0279986") + data = None + + +class Program_weight_tensor_parameter_316: + name = "parameter_316" + shape = [1024] + dtype = "float32" + min_val = float("-0.113842") + max_val = float("0.127734") + mean = float("0.000780312") + std = float("0.0224108") + data = None + + +class Program_weight_tensor_parameter_317: + name = "parameter_317" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.180661") + max_val = float("0.182666") + mean = float("1.79485e-06") + std = float("0.0286126") + data = None + + +class Program_weight_tensor_parameter_318: + name = "parameter_318" + shape = [1024] + dtype = "float32" + min_val = float("-2.2891") + max_val = float("2.73009") + mean = float("0.00829886") + std = float("0.462405") + data = None + + +class Program_weight_tensor_parameter_319: + name = "parameter_319" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.30943") + max_val = float("0.303807") + mean = float("-3.47794e-06") + std = float("0.0391287") + data = None + + +class Program_weight_tensor_parameter_320: + name = "parameter_320" + shape = [1024] + dtype = "float32" + min_val = float("-0.621728") + max_val = float("0.5475") + mean = float("-0.00523892") + std = float("0.147246") + data = None + + +class Program_weight_tensor_parameter_321: + name = "parameter_321" + shape = [1024, 1024] + dtype = "float32" + min_val = float("-0.245789") + max_val = float("0.284052") + mean = float("1.01018e-05") + std = float("0.0396867") + data = None + + +class Program_weight_tensor_parameter_322: + name = "parameter_322" + shape = [1024] + dtype = "float32" + min_val = float("-1.19149") + max_val = float("0.884533") + mean = float("0.0143458") + std = float("0.070582") + data = None + + +class Program_weight_tensor_parameter_323: + name = "parameter_323" + shape = [1024] + dtype = "float32" + min_val = float("0.274043") + max_val = float("0.985254") + mean = float("0.700398") + std = float("0.0834863") + data = None + + +class Program_weight_tensor_parameter_324: + name = "parameter_324" + shape = [16, 1024] + dtype = "float32" + min_val = float("-0.0799812") + max_val = float("0.525918") + mean = float("1.7754e-05") + std = float("0.0129912") + data = None + + +class Program_weight_tensor_parameter_325: + name = "parameter_325" + shape = [4, 1024] + dtype = "float32" + min_val = float("-0.23129") + max_val = float("0.401738") + mean = float("-0.000464122") + std = float("0.0197346") + data = None + + +class Program_weight_tensor_parameter_326: + name = "parameter_326" + shape = [2048, 1024] + dtype = "float32" + min_val = float("-0.782574") + max_val = float("1.13226") + mean = float("-2.24621e-05") + std = float("0.0274568") + data = None + + +class Program_weight_tensor_parameter_327: + name = "parameter_327" + shape = [39981, 1024] + dtype = "float32" + min_val = float("-1.04291") + max_val = float("1.0591") + mean = float("-0.00809384") + std = float("0.0392946") + data = None