@@ -743,11 +743,10 @@ def prefill(
743743 else [t for layer_kv in past_key_values for t in (layer_kv [0 ], layer_kv [1 ])]
744744 }
745745
746- selected_seq_len = self ._select_sequence_length (input_tokens .shape [1 ])
747746 slices_iter = self .slice_inputs_for_inference (
748747 input_tokens ,
749748 attention_mask ,
750- selected_seq_len ,
749+ self . sequence_length , # always use max sequence length for slicing in prefill
751750 position_ids ,
752751 ** kwargs ,
753752 )
@@ -767,7 +766,7 @@ def prefill(
767766 input_ids = input_slice if input_ids is not None else None ,
768767 attention_mask = attention_mask_slice ,
769768 past_key_values = preconsumed_outputs ["past_key_values" ],
770- sequence_length = selected_seq_len ,
769+ sequence_length = self . sequence_length ,
771770 context_length = self .context_length ,
772771 pad_token = getattr (self .tokenizer , "eos_token_id" , 0 ),
773772 attention_mask_min = self .attention_mask_min ,
@@ -798,7 +797,7 @@ def prefill(
798797 input_ids = input_slice if input_ids is not None else None ,
799798 attention_mask = attention_mask_slice ,
800799 past_key_values = preconsumed_outputs ["past_key_values" ],
801- sequence_length = selected_seq_len ,
800+ sequence_length = self . sequence_length ,
802801 context_length = self .context_length ,
803802 pad_token = getattr (self .tokenizer , "eos_token_id" , 0 ),
804803 attention_mask_min = self .attention_mask_min ,
0 commit comments