這是一個商品匹配標註工具,主要用來處理兩種類型的標註:
- C2C(消費者對消費者):處理 C2C 搜尋結果。
- B2C(企業對消費者):處理 B2C 搜尋結果。
工具以 Streamlit 為基礎撰寫,操作方法請見C2C/B2C 人工核實標註方法。
需要的工具和套件如下:
- Python:版本
>=3.9 - 必裝套件:
streamlitpandasstreamlit-aggrid
- 安裝方法:
打開終端機跑這行:
pip install -r requirements.txt
- 啟動方式:
streamlit run label_ui_b2c.py - 將檔案路徑為:
./b2c/B2C_Common_250.csv - 標註的結果會存成
{搜尋詞}_annotations.csv
- 啟動方式:
streamlit run label_ui_c2c.py - 請將檔案路徑修改為組別代號,例如:
./c2c_result/G組_C2C搜尋結果.csv - 標註的結果會存成
{搜尋詞}_annotations.csv
- 啟動工具:選好你的類型(C2C 或 B2C),執行對應指令。
- 選搜尋詞:從側邊欄挑出要標註的搜尋詞。
- 開始標註:
- 看商品是否匹配:
- x:不匹配。
- o:匹配。
- 點一下表格的格子,就可以在 x 和 o 間切換。
- 保存進度:點「保存標註」按鈕,系統會幫你自動生成標註結果檔案。
- 整理檔案並且製作成壓縮檔。
在大家做完人工核實之後,就可以針對標註的結果進行分析並且製作PPT 因為要計算模型商品匹配結果的 Recall、Accuracy、Precision、f1 score的分數,所以需要以下資料:
- 利用 putback.ipynb 將檔案從o跟x的模式轉換成能夠計算分數的格式。請注意,由於格式不同需要修改程式
- 人工核實結果(Ground Truth):來自大家的人工標註結果。 每對商品是否匹配的真實標籤(例如:匹配=1,不匹配=0)。
- 模型預測結果:之前模型給出的商品匹配結果。 同樣格式,標籤是 1 或 0。
依 grouped_queries.csv 的順序,找到搜尋詞後依序標註。
必標 15 個共同搜尋詞,再加 35 個自選搜尋詞。
拿大家人工核實的部分來算你們之前模型商品匹配結果的Recall、Accuracy、Precision、f1 score的分數,然後進行分析。
把結果資料整理成 c2c 和 b2c 兩個資料夾,壓縮後再提交。 總共有四份檔案要繳交,每組請選派B2C和C2C共兩位代表統整檔案以及報告:
- 人工核實檔案(壓縮檔):將資料依類別分為 c2c 和 b2c 兩個資料夾,壓縮後繳交(請分開繳交)
- 檔名:組別_C2C.rar 以及 組別_B2C.rar
- 範例:A組_C2C.rar, A組_B2C.rar
- 結果分析(PPT):透過人工核實標記的結果分析 PPT
- 檔名:組別_結果分析_C2C_報告人.pptx
- 範例:A組_結果分析_C2C_XXX.pptx,A組_結果分析_B2C_XXX.pptx
2023/11/27 23:59 前
如果有問題請找助教 助教:旭清
Email:stanley890314@gmail.com

