# v3.2 引用核對結論與修訂注意事項

日期：2026-09-23。對象：18 頁 `TUCO-JISE-advisor-v3.2.pdf`。本文件承接 v3.1 核對（原文保留於 `../citation-evidence-v3.1/AUDIT-NOTES.zh.md`），只記錄 v3.2 的處置結果；「已釐清，勿誤判為錯誤」一節原樣沿用。

## v3.2 已落實的四項修正

- **[33] Judge Reliability Harness**：書目改為 `@misc`，`howpublished={arXiv:2603.05399v1}`、`url={https://arxiv.org/abs/2603.05399v1}`，保留該版「LLM Judges」題名，移除 ICLR 主會議 proceedings 記載。官方 arXiv Comments 欄（截圖沿用）明列接受於 Agents in the Wild: Safety, Security, and Beyond Workshop at ICLR 2026。本文三處引用句對到 v1 原文的摘要與 §6，頁碼不變。未改引 OpenReview 的 workshop 版本（題名 AI Judges）；若日後改引，題名、會名、URL 與引用段落均須重新對齊。
- **[17] Documentation vs. Code Patterns**：§2.2 改為「Removing Javadoc @throws clauses changes exception-versus-assertion prediction accuracy by at most 0.54 percentage points on clause-bearing samples; further ablations reveal reliance on shortcut cues」（整合進原分號列句）。指標為 Exception／Assertion 二分類；0.54 pp 是含 clause 子集的最大降幅，整體 0.16 pp 未寫入正文；shortcut 結論由 attribution-guided ablation 支持（原文第 1、2、6 頁）。
- **[1] WebArena**：§2.1 改為「WebArena introduced a self-hostable environment built from open-source applications for browser agents driven by natural-language instructions」。
- **[23] BDD**：§2.2 改為「behaviour-driven development links natural-language requirements to executable checks」。

四項修改均未新增實驗、未變更數據；PDF 仍 18 頁，參考文獻編號與 v3.1 相同。

## 已釐清，勿誤判為錯誤

- **[8] PinATA 作者名單**：文獻庫的 arXiv v1 是五位作者，正式 ISSTA 2025 紀錄有六位作者，包含 Aymeric Cretin。本文正式出版版書目有依據，不能因 v1 少一位作者就刪除。核對連結：[官方會議紀錄](https://conf.researchr.org/details/issta-2025/issta-2025-papers/10/Are-Autonomous-Web-Agents-good-testers-)。
- **[17]、[28] ASE 2026**：Crossref 某些請求失敗或尚未解析，不等於文獻不存在；arXiv 紀錄、related DOI 與作者／會議紀錄能提供交叉證據。本包保留實際查詢狀態，不把 HTTP 錯誤改成通過。
- **[5] 的 83 篇**：對的是 arXiv v2。若回頭打開早期版本，樣本數可能不同，應指定引用版本。
- **[14] 的 1,750／448**：單位是 test items／Fail items，不是 448 個去重 bug。
- **[16] 的 3.8 倍**：是正確 assertion oracle 的數量比較，不是準確率提升倍數。
- **[20] 的 100%／4%**：是原文 id_81 的實例，不是全部測試的平均。
- **[22] 的 43%／45%**：原文直接報告 LLM／human mutation scores；訓練污染是一般風險，不能由此斷言 Tuco 使用的模型實際看過這兩站。
- **[25]、[27]、[28] 的用途**：分別是 metamorphic 原理類比、真實 server-side bugs 的 benchmark 先例、注入有效性的類比。這些來源沒有替 Tuco 驗證其 round trip、seed taxonomy 對應或 GUI activation；本研究自身證據仍需由本研究材料提供。
- **[29] mutation 不適用的句子**：原文 PDF 第 3 頁與第 5 頁註腳有直接依據；限定於 buggy-code bug-detection setting，並解釋 green-suite 前提。不宜脫離此設定擴大。
- **[30] 隱藏 signals／三次重複**：兩者分別出現在 arXiv v2 摘要與 §5.1；有直接來源。

此處的「原文支持」指引用主張有相應原文段落，不代表來源研究本身已被獨立重現。所有判讀與截圖已放在 `index.html`，可由教授逐項複核。
