Skip to content

interp.py

Zahar A. Ponimash edited this page Feb 6, 2024 · 1 revision

Документация к файлу interp.py

Файл interp.py содержит классы и функции для интерпретации результатов моделей генерации текста, в частности, моделей на основе GPT-2. Основная цель этих инструментов заключается в анализе и визуализации атрибуций признаков, генерируемых моделью, и их взаимосвязи с семантическими кластерами.

Классы

1. ExplainerGPT2Output

Класс для хранения и отображения результатов атрибуций признаков.

Атрибуты:

  • attributions: Объект AttrObj с исходными атрибуциями.
  • attributions_grouped: Объект AttrObj с группированными атрибуциями.
  • attributions_grouped_norm: Объект AttrObj с нормализованными группированными атрибуциями.
  • cluster_imp_df: DataFrame важности кластеров.
  • cluster_imp_aggr_df: Агрегированный DataFrame важности кластеров.
  • word_imp_df: DataFrame важности слов.
  • word_imp_norm_df: Нормализованный DataFrame важности слов.

Методы:

  • show_word_imp_heatmap(): Отображает тепловую карту важности слов.
  • show_word_imp_norm_heatmap(): Отображает нормализованную тепловую карту важности слов.
  • show_cluster_imp_heatmap(): Отображает тепловую карту важности кластеров.
  • show_cluster_imp_aggr_heatmap(): Отображает агрегированную тепловую карту важности кластеров.

2. ExplainerGPT2

Класс для интерпретации результатов GPT-2 модели с использованием семантических кластеров.

Атрибуты:

  • gpt_model: Экземпляр модели GPT-2 для атрибуции.
  • nlp_model: Модель для обработки семантических кластеров.

Методы:

  • __init__(gpt_model, nlp_model): Инициализация экземпляра.
  • interpret(input_texts, generated_texts, clusters_description, batch_size, steps, max_new_tokens, aggr_f): Интерпретирует результаты модели GPT-2.

Функции

  • get_first_attribute: Извлекает первую атрибуцию из выходных данных модели.
  • attr_to_df: Преобразует атрибуцию в DataFrame для визуализации.

Применение

Классы и функции в файле interp.py могут быть использованы для глубокого анализа и интерпретации результатов моделей генерации текста на основе GPT-2. Это особенно полезно для исследователей и практиков, занимающихся анализом и улучшением моделей машинного обучения, где требуется понимание того, как модель принимает решения и какие факторы влияют на эти решения. Визуализация атрибуций признаков и их связь с семантическими кластерами помогает лучше понять поведение модели и может использоваться для улучшения ее интерпретируемости.

Clone this wiki locally