Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

16 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

CompVertID

Compound conVert ID — เครื่องมือแปลงชื่อ/รหัสสารประกอบไปเป็นรหัสฐานข้อมูล (ปัจจุบันรองรับ KEGG) พร้อมการตรวจสอบความถูกต้องและการให้คะแนนความเชื่อมั่น

CompVertID ออกแบบมาสำหรับงาน metabolomics ช่วย map รายชื่อสารประกอบ (จาก Compound Discoverer หรือแหล่งอื่นเช่น NMR) ไปยัง KEGG Compound ID โดยตรวจสอบข้ามด้วยสูตรโมเลกุลและบอกระดับความเชื่อมั่นของแต่ละผลลัพธ์


คุณสมบัติหลัก

  • รับข้อมูลได้หลายรูปแบบ — ไฟล์ Excel จาก Compound Discoverer (.xlsx) หรือไฟล์รายชื่อสาร (.txt/.csv) จากเทคนิคอื่น
  • ตรวจสอบ KEGG ID ที่มีอยู่ — ดึงข้อมูลจาก KEGG มายืนยันว่าถูกต้อง
  • ค้นหา KEGG ID ที่ขาด — ค้นจากชื่อสาร แล้วกรองด้วยสูตรโมเลกุล
  • ให้คะแนนความเชื่อมั่น — บอกชัดว่าผลไหนเชื่อได้ ผลไหนต้องตรวจเอง (ลงสีในตาราง)
  • รวมผล pos/neg และตัดข้อมูลซ้ำ — จัดการ positive/negative mode ของการทดลองเดียวกัน
  • มีทั้งแบบหน้าต่าง (GUI) และ command line (CLI)
  • บันทึก log ทุกการรัน — ช่วย debug เมื่อเกิดปัญหา โดยเคารพความเป็นส่วนตัว

การติดตั้งและใช้งาน

แบบที่ 1: ดาวน์โหลดโปรแกรมสำเร็จรูป (แนะนำสำหรับผู้ใช้ทั่วไป)

ไปที่หน้า Releases แล้วดาวน์โหลดไฟล์ให้ตรงกับเครื่องของคุณ:

ไฟล์ สำหรับ
CompVertID-Windows.zip Windows
CompVertID-macOS-Intel.zip Mac รุ่นเก่า (ชิป Intel, ก่อนปลายปี 2020)
CompVertID-macOS-AppleSilicon.zip Mac รุ่นใหม่ (ชิป M1/M2/M3/M4)

ไม่แน่ใจว่า Mac ของคุณชิปอะไร? กดเมนู (มุมซ้ายบน) → About This Mac แล้วดูบรรทัด "Chip" หรือ "Processor"

ดาวน์โหลดแล้วเปิดใช้งานได้เลย ไม่ต้องติดตั้ง Python

Windows:

  1. ดับเบิลคลิกไฟล์ .zip เพื่อแตกไฟล์ จะได้ โฟลเดอร์ CompVertID
  2. เข้าไปในโฟลเดอร์ แล้วดับเบิลคลิก CompVertID.exe
  3. ครั้งแรกถ้ามีหน้าต่าง "Windows protected your PC" ให้กด More info → Run anyway

⚠️ สำคัญ: เก็บไฟล์ .exe ไว้ในโฟลเดอร์เดิมเสมอ — ห้ามลากออกมาไว้ข้างนอกแยกจากไฟล์อื่น เพราะโปรแกรมต้องใช้ไฟล์ในโฟลเดอร์เดียวกันจึงจะเปิดได้ (ถ้าอยากเปิดสะดวก ให้คลิกขวาที่ CompVertID.exe → Send to → Desktop เพื่อสร้าง shortcut)

Mac:

  1. ดับเบิลคลิกไฟล์ .zip เพื่อแตกไฟล์ จะได้ CompVertID.app
  2. ครั้งแรกให้คลิกขวาที่ CompVertID.app แล้วเลือก Open (ไม่ใช่ดับเบิลคลิก)
  3. ถ้าขึ้นกล่องบอกว่าเปิดไม่ได้ ให้ไปที่ System Settings → Privacy & Security เลื่อนลงไปหาข้อความเกี่ยวกับ CompVertID แล้วกด Open Anyway (อาจต้องใส่รหัสเครื่องหรือ Touch ID) จากนั้นเปิดได้ตามปกติ

ครั้งแรกที่เปิดอาจใช้เวลาสักครู่ และระบบอาจถามยืนยันความปลอดภัย — เป็นเรื่องปกติของโปรแกรมที่ดาวน์โหลดจากอินเทอร์เน็ต

แบบที่ 2: ติดตั้งผ่าน pip (สำหรับผู้ใช้ที่มี Python)

pip install git+https://github.com/snnattapon/CompVertID.git

จากนั้นเรียกใช้ได้สองแบบ:

compvertid-gui          # เปิดหน้าต่างโปรแกรม
compvertid --help       # ใช้แบบ command line

วิธีใช้งาน (GUI)

  1. เปิดโปรแกรม
  2. เลือกไฟล์ Positive mode และ/หรือ Negative mode (ดูข้อควรระวังด้านล่าง)
  3. เลือกที่บันทึกไฟล์ผลลัพธ์
  4. กด เริ่มทำงาน (Run)
  5. ดูผลในตาราง (ลงสีตามความเชื่อมั่น) และเปิดไฟล์ผลลัพธ์ที่บันทึกไว้

วิธีใช้งาน (CLI)

# ไฟล์ Compound Discoverer สองโหมด
compvertid --pos pos.xlsx --neg neg.xlsx -o results.xlsx

# ไฟล์รายชื่อจาก NMR (โหมดเดียว)
compvertid --pos my_compounds.txt -o results.xlsx

# เปิดโหมด debug (บันทึกรายละเอียดสารที่มีปัญหาลง log)
compvertid --pos pos.xlsx --neg neg.xlsx -o results.xlsx --debug

⚠️ ข้อควรระวังสำคัญ: หนึ่งการทดลองต่อการรัน

ใส่ได้เฉพาะไฟล์ของการทดลอง/โปรเจกต์เดียวกันต่อการรันหนึ่งครั้ง

ช่อง Positive mode และ Negative mode ถูกออกแบบมาสำหรับ pos/neg ของ ตัวอย่างชุดเดียวกัน โปรแกรมจะรวมผลทั้งสองและตัดข้อมูลซ้ำเสมือนว่าเป็นการทดลองเดียว

อย่านำไฟล์จากคนละโปรเจกต์มารันพร้อมกัน เช่น อย่าใส่ project1_pos.xlsx ในช่องหนึ่งและ project3_control.xlsx ในอีกช่อง เพราะสารที่บังเอิญซ้ำกันจะถูกยุบรวมกัน ทำให้ข้อมูลปนกันโดยไม่มีการแจ้งเตือน

ถ้ามีหลายโปรเจกต์ ให้รันทีละโปรเจกต์แยกกัน


รูปแบบไฟล์ที่รองรับ

ดูไฟล์ตัวอย่างในโฟลเดอร์ examples/

Excel จาก Compound Discoverer (.xlsx) — ต้องมี sheet ชื่อ Compounds และคอลัมน์ Name, Formula, KEGG ID

รายชื่อสาร (.txt / .csv) — รองรับสองแบบ:

# แบบ A: ชื่ออย่างเดียว บรรทัดละชื่อ
Choline
Oleic acid
# แบบ B: มี header ระบุคอลัมน์ (คั่นด้วย tab หรือ comma)
Name,Formula,KEGG ID
Choline,C5H13NO,C00114

เคล็ดลับ: ถ้ามีสูตรโมเลกุล (Formula) ให้ใส่มาด้วย จะช่วยให้ผลแม่นยำขึ้นมาก เพราะโปรแกรมใช้สูตรในการยืนยันและแก้ความกำกวม รายชื่อที่มีแต่ชื่อล้วนจะได้ผลที่ความเชื่อมั่นต่ำกว่า


ความหมายของสี (ระดับความเชื่อมั่น)

สี ความหมาย ต้องทำอะไร
🟢 เขียว เจอและสูตรตรง เชื่อถือได้ ไม่ต้องตรวจ
🟡 เหลือง น่าเชื่อถือ แต่ยืนยันไม่ครบ (ไม่มีสูตรเทียบ หรือต่างแค่ประจุ) ดูผ่าน ๆ
🟠 ส้ม ต้องตรวจเอง (เจอหลายตัว หรือสูตรไม่ตรง) ควรตรวจสอบ
⚪ เทา ไม่พบ หรือเป็นสารที่ KEGG ไม่ครอบคลุม (เช่น lipid) ปกติของข้อมูล

ผลลัพธ์แต่ละแถวมีคอลัมน์ Confidence และ Notes อธิบายเหตุผลโดยละเอียด


เอกสารเพิ่มเติม


License

MIT License — ใช้งาน แก้ไข และเผยแพร่ต่อได้อิสระ

ที่มาของข้อมูล

ข้อมูลสารประกอบดึงจาก KEGG ผ่าน KEGG REST API

Reference

Huckvale, E., & Moseley, H. N. B. (2023). kegg_pull: a software package for the RESTful access and pulling from the Kyoto Encyclopedia of Gene and Genomes. BMC bioinformatics, 24(1), 78. https://doi.org/10.1186/s12859-023-05208-0

About

No description, website, or topics provided.

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages