Compound conVert ID — เครื่องมือแปลงชื่อ/รหัสสารประกอบไปเป็นรหัสฐานข้อมูล (ปัจจุบันรองรับ KEGG) พร้อมการตรวจสอบความถูกต้องและการให้คะแนนความเชื่อมั่น
CompVertID ออกแบบมาสำหรับงาน metabolomics ช่วย map รายชื่อสารประกอบ (จาก Compound Discoverer หรือแหล่งอื่นเช่น NMR) ไปยัง KEGG Compound ID โดยตรวจสอบข้ามด้วยสูตรโมเลกุลและบอกระดับความเชื่อมั่นของแต่ละผลลัพธ์
- รับข้อมูลได้หลายรูปแบบ — ไฟล์ Excel จาก Compound Discoverer (.xlsx) หรือไฟล์รายชื่อสาร (.txt/.csv) จากเทคนิคอื่น
- ตรวจสอบ KEGG ID ที่มีอยู่ — ดึงข้อมูลจาก KEGG มายืนยันว่าถูกต้อง
- ค้นหา KEGG ID ที่ขาด — ค้นจากชื่อสาร แล้วกรองด้วยสูตรโมเลกุล
- ให้คะแนนความเชื่อมั่น — บอกชัดว่าผลไหนเชื่อได้ ผลไหนต้องตรวจเอง (ลงสีในตาราง)
- รวมผล pos/neg และตัดข้อมูลซ้ำ — จัดการ positive/negative mode ของการทดลองเดียวกัน
- มีทั้งแบบหน้าต่าง (GUI) และ command line (CLI)
- บันทึก log ทุกการรัน — ช่วย debug เมื่อเกิดปัญหา โดยเคารพความเป็นส่วนตัว
ไปที่หน้า Releases แล้วดาวน์โหลดไฟล์ให้ตรงกับเครื่องของคุณ:
| ไฟล์ | สำหรับ |
|---|---|
CompVertID-Windows.zip |
Windows |
CompVertID-macOS-Intel.zip |
Mac รุ่นเก่า (ชิป Intel, ก่อนปลายปี 2020) |
CompVertID-macOS-AppleSilicon.zip |
Mac รุ่นใหม่ (ชิป M1/M2/M3/M4) |
ไม่แน่ใจว่า Mac ของคุณชิปอะไร? กดเมนู (มุมซ้ายบน) → About This Mac แล้วดูบรรทัด "Chip" หรือ "Processor"
ดาวน์โหลดแล้วเปิดใช้งานได้เลย ไม่ต้องติดตั้ง Python
Windows:
- ดับเบิลคลิกไฟล์
.zipเพื่อแตกไฟล์ จะได้ โฟลเดอร์CompVertID - เข้าไปในโฟลเดอร์ แล้วดับเบิลคลิก
CompVertID.exe - ครั้งแรกถ้ามีหน้าต่าง "Windows protected your PC" ให้กด More info → Run anyway
⚠️ สำคัญ: เก็บไฟล์.exeไว้ในโฟลเดอร์เดิมเสมอ — ห้ามลากออกมาไว้ข้างนอกแยกจากไฟล์อื่น เพราะโปรแกรมต้องใช้ไฟล์ในโฟลเดอร์เดียวกันจึงจะเปิดได้ (ถ้าอยากเปิดสะดวก ให้คลิกขวาที่CompVertID.exe→ Send to → Desktop เพื่อสร้าง shortcut)
Mac:
- ดับเบิลคลิกไฟล์
.zipเพื่อแตกไฟล์ จะได้CompVertID.app - ครั้งแรกให้คลิกขวาที่
CompVertID.appแล้วเลือก Open (ไม่ใช่ดับเบิลคลิก) - ถ้าขึ้นกล่องบอกว่าเปิดไม่ได้ ให้ไปที่ System Settings → Privacy & Security เลื่อนลงไปหาข้อความเกี่ยวกับ CompVertID แล้วกด Open Anyway (อาจต้องใส่รหัสเครื่องหรือ Touch ID) จากนั้นเปิดได้ตามปกติ
ครั้งแรกที่เปิดอาจใช้เวลาสักครู่ และระบบอาจถามยืนยันความปลอดภัย — เป็นเรื่องปกติของโปรแกรมที่ดาวน์โหลดจากอินเทอร์เน็ต
pip install git+https://github.com/snnattapon/CompVertID.gitจากนั้นเรียกใช้ได้สองแบบ:
compvertid-gui # เปิดหน้าต่างโปรแกรม
compvertid --help # ใช้แบบ command line- เปิดโปรแกรม
- เลือกไฟล์ Positive mode และ/หรือ Negative mode (ดูข้อควรระวังด้านล่าง)
- เลือกที่บันทึกไฟล์ผลลัพธ์
- กด เริ่มทำงาน (Run)
- ดูผลในตาราง (ลงสีตามความเชื่อมั่น) และเปิดไฟล์ผลลัพธ์ที่บันทึกไว้
# ไฟล์ Compound Discoverer สองโหมด
compvertid --pos pos.xlsx --neg neg.xlsx -o results.xlsx
# ไฟล์รายชื่อจาก NMR (โหมดเดียว)
compvertid --pos my_compounds.txt -o results.xlsx
# เปิดโหมด debug (บันทึกรายละเอียดสารที่มีปัญหาลง log)
compvertid --pos pos.xlsx --neg neg.xlsx -o results.xlsx --debugใส่ได้เฉพาะไฟล์ของการทดลอง/โปรเจกต์เดียวกันต่อการรันหนึ่งครั้ง
ช่อง Positive mode และ Negative mode ถูกออกแบบมาสำหรับ pos/neg ของ ตัวอย่างชุดเดียวกัน โปรแกรมจะรวมผลทั้งสองและตัดข้อมูลซ้ำเสมือนว่าเป็นการทดลองเดียว
อย่านำไฟล์จากคนละโปรเจกต์มารันพร้อมกัน เช่น อย่าใส่ project1_pos.xlsx ในช่องหนึ่งและ project3_control.xlsx ในอีกช่อง เพราะสารที่บังเอิญซ้ำกันจะถูกยุบรวมกัน ทำให้ข้อมูลปนกันโดยไม่มีการแจ้งเตือน
ถ้ามีหลายโปรเจกต์ ให้รันทีละโปรเจกต์แยกกัน
ดูไฟล์ตัวอย่างในโฟลเดอร์ examples/
Excel จาก Compound Discoverer (.xlsx) — ต้องมี sheet ชื่อ Compounds และคอลัมน์ Name, Formula, KEGG ID
รายชื่อสาร (.txt / .csv) — รองรับสองแบบ:
# แบบ A: ชื่ออย่างเดียว บรรทัดละชื่อ
Choline
Oleic acid
# แบบ B: มี header ระบุคอลัมน์ (คั่นด้วย tab หรือ comma)
Name,Formula,KEGG ID
Choline,C5H13NO,C00114
เคล็ดลับ: ถ้ามีสูตรโมเลกุล (Formula) ให้ใส่มาด้วย จะช่วยให้ผลแม่นยำขึ้นมาก เพราะโปรแกรมใช้สูตรในการยืนยันและแก้ความกำกวม รายชื่อที่มีแต่ชื่อล้วนจะได้ผลที่ความเชื่อมั่นต่ำกว่า
| สี | ความหมาย | ต้องทำอะไร |
|---|---|---|
| 🟢 เขียว | เจอและสูตรตรง เชื่อถือได้ | ไม่ต้องตรวจ |
| 🟡 เหลือง | น่าเชื่อถือ แต่ยืนยันไม่ครบ (ไม่มีสูตรเทียบ หรือต่างแค่ประจุ) | ดูผ่าน ๆ |
| 🟠 ส้ม | ต้องตรวจเอง (เจอหลายตัว หรือสูตรไม่ตรง) | ควรตรวจสอบ |
| ⚪ เทา | ไม่พบ หรือเป็นสารที่ KEGG ไม่ครอบคลุม (เช่น lipid) | ปกติของข้อมูล |
ผลลัพธ์แต่ละแถวมีคอลัมน์ Confidence และ Notes อธิบายเหตุผลโดยละเอียด
- คู่มือการใช้งานและการพัฒนา (docs/GUIDE.md) — รายละเอียดเชิงลึก สำหรับผู้ใช้และผู้ร่วมพัฒนา
MIT License — ใช้งาน แก้ไข และเผยแพร่ต่อได้อิสระ
ข้อมูลสารประกอบดึงจาก KEGG ผ่าน KEGG REST API
Huckvale, E., & Moseley, H. N. B. (2023). kegg_pull: a software package for the RESTful access and pulling from the Kyoto Encyclopedia of Gene and Genomes. BMC bioinformatics, 24(1), 78. https://doi.org/10.1186/s12859-023-05208-0