In [41]:
import torch
from transformers import T5ForConditionalGeneration, T5Tokenizer

# Load and prepare LLM from open source

In [53]:
MODEL_NAME = 'cointegrated/rut5-base-absum'
model = T5ForConditionalGeneration.from_pretrained(MODEL_NAME)
tokenizer = T5Tokenizer.from_pretrained(MODEL_NAME)
model.eval();

# Prepare inference function

In [54]:
def summarize(
    text, n_words=None, compression=None,
    max_length=1000, num_beams=3, do_sample=False, repetition_penalty=10.0, 
    **kwargs
):
    """
    Summarize the text
    The following parameters are mutually exclusive:
    - n_words (int) is an approximate number of words to generate.
    - compression (float) is an approximate length ratio of summary and original text.
    """
    if n_words:
        text = '[{}] '.format(n_words) + text
    elif compression:
        text = '[{0:.1g}] '.format(compression) + text
    x = tokenizer(text, return_tensors='pt', padding=True).to(model.device)
    with torch.inference_mode():
        out = model.generate(
            **x, 
            max_length=max_length, num_beams=num_beams, 
            do_sample=do_sample, repetition_penalty=repetition_penalty, 
            **kwargs
        )
    return tokenizer.decode(out[0], skip_special_tokens=True)

# Using example from recognized audio

In [61]:
path_to_doc = "../content/recognized_transcription.txt"
with open(path_to_doc) as f:
    text = f.read()
print(text)

 Я провела анализ и обработку ГИС и успешно рассчитала 3D-модель пласта. Это позволило нам получить подробное представление о структуре и характеристиках пласта, что, безусловно, имеет важное значение для разработки нефтяных месторождений. Наша 3D-модель дает нам возможность прогнозировать потенциальные места добычи нефти, оптимизировать работу скважин и принимать обоснованные решения на основе точных данных.


In [62]:
print(summarize(text))

Наша 3D-модель дает нам возможность прогнозировать потенциальные места добычи нефти.
