Desenvolvimento de um modelo capaz de extrair caracteristicas de um DNA como o tipo de proteina que ele produz ou o animal a qual pertence
Este projeto implementa dois modelos de aprendizado de máquina para classificar sequências de DNA. Eles determinam a proteína que a sequência produz e a espécie a que pertence. A aplicação está disponível em gene-classification.streamlit.app.
- Dados de sequências de DNA de chimpanzés, cães e humanos.
- Categorias de proteínas: G Protein, Tyrosine Kinase, Tyrosine Phosphatase, Synthetase, Synthase, Ion Channel, Transcription Factor.
- Criação de k-mers para transformar sequências de DNA em recursos utilizáveis.
- Uso de
CountVectorizerpara converter sequências de k-mers em uma matriz de contagem de n-grams.
-
Classificação de Espécies:
- Modelo:
LogisticRegression. - Objetivo: Classificar a espécie da sequência de DNA.
- Modelo:
-
Classificação de Proteínas:
- Modelo:
NaiveBayes. - Objetivo: Determinar a proteína produzida pela sequência de DNA.
- Modelo:
- Separação dos dados em conjuntos de treino e teste.
- Avaliação baseada em precisão, tempo de treinamento e previsão.
- Uso de visualizações para análise de desempenho.
- A
LogisticRegressionfoi eficiente para classificar espécies, capturando padrões distintos em sequências de DNA. NaiveBayesmostrou-se adequado para classificar proteínas, dada a natureza estatística dos dados.
Acesse gene-classification.streamlit.app, faça o upload da sequência de DNA e obtenha a classificação instantânea.