Replies: 2 comments 8 replies
|
vocab_freq.txt Первое содержащее смысл слово по частоте входов — управления. 41 управления, 8571 |
1 reply
Что в данном случае подразумевается под «топонимами» в плане исходного корпуса текстов? Я правильно понимаю, что такой словарь и последующие модели на его основе будут нести задачу обнаружения или распознания топонима в стороннем тексте? Я правильно понимаю, что словари служат в роли связующего звена между сущностями «таблицы и базы» и сущностями «нейросети и модели»? |
7 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
Сделал пакет для формирования словаря https://github.com/terratensor/vocab
Сформировал для примера различные версии словарей из 50 книг КОБ. С разной сортировкой, по частоте или по алфавиту, с пунктуацией и без, приведенные токен к нижнему регистру.
https://github.com/terratensor/vocab/tree/main/vocab
Планирую сделать словарь/словари для нашей общей библиотеки 140к+ ВИБ + КОБ + Топонимы + 20К новые, и можно разбавить словарем ФКТ.
Далее использовать словари для обучения нейросетей и для эмбедингов. Полагаю, эти словари могут быть и в открытом доступе. Не корпуса, а словари, хотя по факту, скорее всего от них будет мало толку без корпуса.
Должно быть не хуже, я считаю даже лучше, чем то, что сейчас есть в свободном доступе: википедии и либрусек из художественной литературы новостей Лента, ТАСС и РИА, и Твиттере…
Вот здесь есть подборка https://github.com/natasha/corus?tab=readme-ov-file#reference
Эти корпуса и словари из них использовались в различных моделей, которые понимаю русский язык, большинство в свободном доступе в той или иной мере используют корпуса из этой подборки. Там есть либрусек 150Гб, но скачать его не удалось, художественная литература…
Я так понял, что когда кто-то из ребят берется дообучить модель, он обычно использует датасеты и сетки на основе этих корпусов.
All reactions