
※ 本文由 AI 根據影片內容整理,如有錯漏敬請指正。
📺 觀看完整影片:[畀 AI 多啲資料,答案反而變差?最新研究揭示 Context Window 陷阱|學識 AI EP 9]
---
早幾年我們用生成式 AI,往往只是寫一小段文字,然後就問 AI 問題。但隨著這幾年 AI 的 context window 越來越大,現在不少人索性把一大段文字、甚至十幾個 PDF 檔案一次過丟給 AI,然後才提問。
這個做法本身無可厚非。過去幾年我們學用 AI 的最基本原則,就是要給它足夠的背景資料。於是很自然地,我們會覺得講得越清楚、給的資料越多,AI 就越了解你想它做什麼,答案質素自然越高。加上現在主流模型的 context window 已經去到大約 100 萬個 token,有模型甚至標榜 1000 萬個 token,「既然它吃得下,就索性全部給它,讓 AI 自己判斷哪些有用」看似順理成章。
但近年的研究指出,情況並不是這樣。
Context window 究竟是什麼
AI 處理文字時,首先要把文字拆成一個個 token。一個 token 在英文大約對應一個單字或單字的一部分,中文也大致相同;不同模型的計算方法有分別,沒有一個劃一標準。
而 context window,就是 AI 一次過可以處理多少東西——包括你今次輸入的 prompt、之前的對話、你提供的文件甚至圖片。這些資料全部一次過處理之後,它才會計算出回應。
你可以把 context window 想像成 AI 面前的一張工作桌子:桌子越大,能同時放在它面前處理的東西就越多。但這個比喻正正藏著關鍵——桌子放得下多少東西,和你能夠多有效率地運用桌上的文件,其實是兩回事。所以當我們說一個模型支援 100 萬個 token,那只是說它能同時處理這個數量,並不代表它處理 100 萬個 token 時的效果,等同它處理一萬個 token 時的效率。
研究一:任務數量比 context 長度影響更大
2026 年 7 月一篇論文 Understanding LLM Performance Degradation in Multi-Instance Processing,研究 AI 一次過要處理大量資料項目時表現會怎樣。
想像我給 AI 一套電影的影評,叫它判斷每一條是正評還是負評。一條一條去做,AI 可以做得很準確;但如果一次過給它幾十條、甚至幾百條,還要綜合成一個結果,難度就完全不同了。研究人員把這種情況叫 multi-instance processing。
他們挑選 AI 逐項處理時已經表現得很好的任務,再慢慢增加一次過要處理的同類任務數量。結果發現:當任務數量增加到大約 20 至 100 個,所有受測試的模型都已經開始出現輕微的表現下降;再增加下去,表現更會明顯崩潰。
更有趣的是,研究人員把兩樣東西分開來看:一是總 context 有多長,二是裡面有多少個不同任務。結果發現 context 長度的確有影響,但一次過要處理多少個任務,影響似乎更加明顯。同樣是 10 萬個 token,可以是一份很長的報告,也可以是 50 份很短的文件——表面上資訊量一樣,但對 AI 來說並非同一回事,後者明顯更難處理。
研究二:就算找對了資料,context 變長一樣會拖低表現
資料一多,最容易理解的問題是 AI 未必找得到真正重要的那一段:選錯文件、抽錯段落,甚至忽略了最關鍵的文字。這也是過去很多測試都會發現的規律。
不過 2025 年一篇研究 Context Length Alone Hurts LLM Performance Despite Perfect Retrieval 再進一步:假設我們已經幫 AI 解決了「找資料難」的問題,context 變長還有沒有其他影響?
他們測試了不同的開放和封閉模型。結果發現,就算 AI 已經準確找到所有相關資料,隨著整個輸入越來越長,模型表現仍然明顯下降,幅度在不同模型和任務之間大約由 14% 去到將近 85%。
研究人員還做了一個更極端的實驗:把多出來的內容換成幾乎沒有資訊的空白內容。正確資料完全沒變、問題完全沒變,只是整個輸入變長了——結果模型表現依然下降。
換句話說,這篇研究帶出的問題,比「太多垃圾資料干擾 AI」更深一層:就算 AI 已經找到正確資料,就算多出來的內容幾乎沒有意思,單純輸入變得很長,都可能影響部分模型之後的推理。
當然,我們也不能因此說 context 越長 AI 就一定表現差。研究中不同模型、不同任務的下降程度差異很大,而且暫時我們也未有一個很清楚確實的原因去解釋整個現象。但有一點相當清晰:context window 無論支援多大的範圍,在這個範圍裡的任何長度都不一定會有同樣的表現。
研究三:「給少一點」也不是答案
講到這裡,大家又要小心不要走去另一個極端——以為既然給太多會表現差,那就盡量給少一點。
2026 年 8 月一篇新論文 Distraction-Aware Truncation: Disentangling Context Length Effects from Signal Loss in Long-Context LLM Benchmarks,實驗設計正好測試「把 context 縮短,是否自然會令 AI 做得更好」。
研究人員用了兩種完全不同的方法縮短 context。第一種很簡單:直接剪掉一部分內容,不管哪些有用哪些無用。結果模型表現一直下降——原因不難理解,亂刪資料有可能連真正需要的答案、條件和證據都一併刪掉。所以資訊短了,不一定代表 AI 表現就好。
第二種方法則保留完成任務真正需要的資料,只移除其他干擾內容。結果完全不同:在他們測試的 benchmark 中,模型表現得以維持,部分較小的模型甚至出現改善。
三篇研究串在一起,結論就是:要提高 AI 的表現,答案不是給越多資料越好,也不是越少越好,而是要衡量我們提供的資料裡面,有多少是真的跟這個任務相關,有多少是不相關——比例才是關鍵。
實際上應該怎樣判斷給 AI 什麼資料
回到日常使用,我們起碼應該自己先判斷一下:這些原始資料,值不值得給 AI 去回答我今次想問的問題?粗略來說,可以分成三類。
一、核心資料
沒有了它,就沒有辦法可靠地回答今次的問題。例如我想知道公司 2025 年和 2026 年的出差政策有什麼改變,那兩份正式生效的政策就是核心資料,一定要給。
二、補充背景
有助理解一件事,但回答問題時不一定必須引用。例如一份 meeting notes 解釋公司當初為什麼要做這些修改:如果我問「公司為什麼要改政策」,它可能很有用;但如果我只問「今年酒店津貼上限多少」,AI 未必需要知道這些原因。給補充資料之前,先問清楚自己:這份資料對 AI 回答我的問題,究竟有什麼幫助?如果幫助很輕微、甚至沒什麼直接關係,其實未必需要給。
三、可能造成干擾的資料
例如舊版本、draft,甚至另一間公司的政策文件。表面上看你會覺得都是相近的資料,多給一些讓 AI 參考好像沒有壞——但實際上你會令 AI 混淆,很難分辨正確資料在哪一份文件裡面。
而這個分類,其實又視乎你今次問的是什麼問題。所以每次提問都要重新判斷需要提供什麼資料,而不要以為有一個不變的資料庫,問任何問題都叫 AI 去參考。如果真的要用一個固定的資料庫,那每一份文件都必須標籤好,而且每次提問時講明今次跟答案最相關的是哪幾份文件,AI 才較容易直接找到。
這個建議並不是叫你不要讓 AI 做判斷。我們用 AI 當然是想它幫忙分析,但你有責任先做自己的基本分析,然後把你知道的資訊告訴 AI——包括你上載的檔案屬於什麼類型、哪些類型跟今次問題不相關。這個資訊,其實比你提供更多原始資料給 AI 分析來得更加重要。
資料太多?把問題拆成兩步
有時候你真的面對海量原始資料:幾年的 email 紀錄、整個 project 的 source code、幾百份文件,根本無法逐份判斷哪一樣最有用。這個時候,可以把問題拆成兩步去問 AI。
第一步不要立即要求答案,而是先問 AI:跟我這個問題最直接相關的是哪幾份文件?哪幾段資料可以作為主要參考?有什麼資料可能互相矛盾?哪些文件可能已經過時?
透過 AI 的回覆,你可以先了解這些檔案哪份對應哪份、跟什麼相關、跟什麼不相關,甚至自己核實一下每份檔案大概說什麼。然後才做第二步,真正去問你想問的問題。這樣 AI 就更清楚應該在哪裡找什麼資料,一次過要處理的複雜性也大大降低。
結論:判斷仍然是人的責任
Context window 越來越大,不代表我們就應該盡用它。相反,我們有責任做自己的判斷,再跟 AI 一起合作處理問題。
今集三篇研究論文提醒我們:用 AI 之前,自己要先了解問題,並且跟它說清楚內容是什麼,而不是盲目地提供越來越多資料。我們今次想解決的是什麼問題,就選哪些資料真正幫助到 AI 解決這個問題——not more, not less。
額外提供不相關的資訊,其實不是在幫 AI,只是提供了更多噪音、更多干擾。這樣對人、對 AI 都不是一個好的合作方式。
那麼下次你準備把十幾份文件一次過丟給 AI 之前,不妨先問自己一句:這裡面,有多少是真的跟我的問題有關?





