wikilex

Wikipedia Entities Lexicon Extractor

Scans a Wikipedia Dump in xml and for each article it extracts the article Title (and generate the proper uri), Categories, Entities (all the mentions, uris, sentence triples), Links (all the entities mentioned in the article)

All this information is saved into a SQLite database using the following structure:

Categories {
    id,
    uri,
    category
}

Entities {
    id,
    source_uri,
    link_uri,
    sentence
}

Mentions {
    id,
    mention,
    target_uri, -- uri the mention is linking to
    source_uri, -- uri page where the mention was found
    sentence
}

This allows to query easily different potential features for an Entity Linking system.

Name		Name	Last commit message	Last commit date
Latest commit History 82 Commits
data		data
db		db
lib		lib
queries		queries
LICENSE		LICENSE
README.md		README.md
build_db.py		build_db.py
extract_wikipedia_lexicon.py		extract_wikipedia_lexicon.py
lexicon.py		lexicon.py
requirements.txt		requirements.txt
setup.sh		setup.sh

Provide feedback

Saved searches

Use saved searches to filter your results more quickly

data

data

db

db

lib

lib

queries

queries

LICENSE

LICENSE

README.md

README.md

build_db.py

build_db.py

extract_wikipedia_lexicon.py

extract_wikipedia_lexicon.py

lexicon.py

lexicon.py

requirements.txt

requirements.txt

setup.sh

setup.sh

Repository files navigation

wikilex

About

Releases

Packages

Languages

License

mynlp/wikilex

Folders and files

Latest commit

History

Repository files navigation

wikilex

About

Topics

Resources

License

Stars

Watchers

Forks

Languages