-
Notifications
You must be signed in to change notification settings - Fork 2
doc‐inseq_helpers.py
Файл inseq_helpers.py предоставляет набор инструментов для работы с интерпретацией генерации последовательностей, используя библиотеку inseq. Этот файл содержит функции и классы, помогающие анализировать и преобразовывать данные, полученные от моделей генерации текста, в более удобный для анализа формат.
Исправляет токены, используя токенизатор GPT2.
Параметры:
-
feature_attr(FeatureAttributionOutput): Выходные данные атрибуции признаков.
Возвращает: Объект атрибуции признаков с исправленными токенами.
Извлекает токены из атрибуции признаков.
Параметры:
-
feature_attr(FeatureAttributionOutput): Выходные данные атрибуции признаков.
Возвращает: Список кортежей токенов.
Извлекает фразы из атрибуции признаков.
Параметры:
-
feature_attr(FeatureAttributionOutput): Выходные данные атрибуции признаков.
Возвращает: Кортеж фраз.
Преобразует атрибуции признаков в массивы.
Параметры:
-
feature_attr(FeatureAttributionOutput): Выходные данные атрибуции признаков.
Возвращает: Список массивов.
Хранит информацию об атрибуции признаков.
Атрибуты:
-
phrase_input: Входная фраза. -
phrase_generated: Сгенерированная фраза. -
tokens_input: Токены входной фразы. -
tokens_generated: Токены сгенерированной фразы. -
array: Массив атрибуций.
Класс для детокенизации.
Методы:
-
__init__(text, tokenized_text): Инициализация с текстом и токенизированным текстом. -
clean_text(s): Очищает текст. -
group_text(): Группирует токены в слова.
-
attr_to_df: Преобразует атрибуцию признаков в DataFrame. -
calculate_mask: Вычисляет маску для группирования элементов. -
group_by: Группирует токены и соответствующие атрибуции. -
squash_arr: Сжимает массив с использованием заданных масок.
Этот набор инструментов полезен для исследователей и разработчиков, работающих с моделями генерации текста, особенно с теми, которые основаны на трансформерах, таких как GPT-2. Функции и классы в inseq_helpers.py облегчают процесс анализа и интерпретации выходных данных таких моделей, позволяя лучше понять, как модель генерирует текст и на какие аспекты входных данных она больше всего опирается.
ExplainitAll — это библиотека для интерпретируемого ИИ, предназначенная для интерпретации генеративных моделей (GPT-like), и векторизаторов, например, Sbert. Библиотека предоставляет пользователям инструменты для анализа и понимания работы этих сложных моделей. Кроме того, содержит модули RAG QA, fast_tuning и пользовательский интерфейс.
- Лицензия Apache-2.0 license