Есть мысли о вариантах внутренней организации большой библиотеки.
Схема представления:
- Вычисляем самые распространённые в полной библиотеке токены, общие для большинства книг.
- Вычисляем для каждой книги облако её наиболее частых токенизаций.
- Удаляем из облака общие токены большинства, таким образом оставляя собственный «след» книги.
- Используем полученное тонкое облако в оформлении, показываем его рядом с параграфом.
- Между тонкими облаками можно установить отношения и расстояния.
Таким образом можно реализовать структурирование данных по вектору от параграфа к книге — найденные «тонкие облака» будут вполне чётко показывать направление мысли в книге, из которой взят параграф.
Таким же образом можно разметить и другие характеристики, если, например, сделать не вычитание «общего облака» из «частного облака», а вместо этого сначала найти «специальное облако» например по интересующей терминологии, например набор концептуальных терминов, и смотреть, какие из этих терминов есть в книге, и показывать их вторым списком ниже первого облака.
Условная картинка

Есть мысли о вариантах внутренней организации большой библиотеки.
Схема представления:
Таким образом можно реализовать структурирование данных по вектору от параграфа к книге — найденные «тонкие облака» будут вполне чётко показывать направление мысли в книге, из которой взят параграф.
Таким же образом можно разметить и другие характеристики, если, например, сделать не вычитание «общего облака» из «частного облака», а вместо этого сначала найти «специальное облако» например по интересующей терминологии, например набор концептуальных терминов, и смотреть, какие из этих терминов есть в книге, и показывать их вторым списком ниже первого облака.
Условная картинка