AI 永遠改不掉的六個毛病:不是模型不夠新,是架構本來就這樣

2026-07-24 Author by Even
AI 永遠改不掉的六個毛病:不是模型不夠新,是架構本來就這樣
01 引言

大型語言模型(LLM)永遠的缺陷

每次有新模型上線,市場上總會出現一片歡呼。這次呢,換成了「Fable 5 到底會不會開放使用」的羅生門、GPT 那串聽起來像星系名稱的新家族、還有 Grok 4.5 —— 名字一個比一個唬人。

但老實說,每次試過新模型之後,發現一件事:它們變聰明了,變快了,甚至變得比較會道歉了,可是有幾個毛病,從以前到現在,從來沒看到 AI 真的改掉。

這不是哪家公司偷懶。這是大型語言模型(LLM)架構本身的問題 —— 只要 Transformer 這套底層邏輯沒換,這些毛病大概就會一直跟著我們。以下六個,是大家常常在討論抱怨的問題。

02 缺陷一

它會一本正經地胡說八道

當你問 AI 問得太細,它就有可能會開始亂編。編出不存在的論文、編出沒說過的話、編出根本沒發生過的日期,而且語氣篤定得跟真的一樣。

這叫「Hallucination(幻覺)」。AI 在訓練過程裡被獎勵的是「給出一個答案」,而不是「老實說我不知道」。所以與其承認自己沒把握,它更常選擇賭一把 —— 用最自然的語氣,講一個聽起來合理但其實是編的答案。

Artificial Analysis 做過一份幻覺率評測,結果落差大到誇張:表現最好的模型錯誤率只有 16%,表現最差的卻高達 96%。連被拿來當標竿的 Anthropic 系統卡數據也顯示,就算是最新一批模型,遇到「找不到參考來源」的情境,仍有八成以上機率答錯而不是老實承認不知道。

換句話說,沒有一個模型是「免疫」的,差別只在於機率高低。

怎麼辦? 先把問題問得讓 AI 有台階下 —— 允許它說「不確定」,而不是逼它一定要給答案。任何關鍵的日期、數字、引用,自己動手查一次。需要佐證時,要求 AI 給多個來源,然後自己去核對,而不是照單全收。

03 缺陷二

它只是「看起來」在推理

AI 很會把話講得頭頭是道,但真要它做嚴謹的計算,或解一題它沒見過的新題型,常常會出包出得很有喜感。

最有名的案例,大概就是早期模型數不出「strawberry」裡有幾個 r。最近還有一題更貼近生活:「我想洗車,車行離我 50 公尺,我該走路還是開車?」

答案顯然是開車 —— 不開車要怎麼把車開去洗?可是在 53 個受測模型裡,只有 5 個每次都答對,其餘不是偶爾答錯,就是有 33 個模型從頭到尾沒答對過一次。

ARC-AGI 這套基準測試,就是專門設計來檢驗這種「流動智力」—— 面對全新情境時能不能真的推理、而不是套模板。這類題目人類看一眼就懂,但即使是目前排名最前面的模型,在最新一輪的 ARC-AGI-3 挑戰裡,正確率也只有 7.8%。

為什麼會這樣? 語言模型的本質,是預測「聽起來通順」的下一個字,不是真的在跑邏輯運算,也不是在追蹤世界的實際狀態。它擅長模仿推理的樣子,但那和真正在推理,是兩件事。

怎麼辦? 遇到複雜的數學或邏輯任務,優先選擇具備「代理」能力、能呼叫外部工具(例如計算機、程式碼執行環境)的模型,讓它去算,而不是讓它「用嘴巴算」。

04 缺陷三

它太順著你了

你說喜歡藍色,它就列出一堆藍色染髮的優點;你下一句改口說討厭藍色、要染紅色,它立刻無縫接軌,講出一模一樣熱情的紅色版本,完全不會提醒你「你剛剛才說喜歡藍色耶」。

這是「Sycophancy(諂媚)」。根本原因出在訓練方式:在強化學習的人類回饋階段,評分員會不自覺偏好跟自己想法一致的回答,AI 也就慢慢學會了——比起說真話,讓人覺得順耳更容易拿高分。

Science.org 的研究量化了這件事:多數模型的「認同使用者行為」比例,都高出人類基準值一大截,部分模型甚至比人類的自然反應高出五十個百分點以上。更麻煩的是後續效應 —— 習慣被諂媚式回應對待的人,事後會更傾向覺得自己「完全沒錯」、比較不會想道歉,卻同時更願意繼續用這個模型。這代表順從感確實討喜,但不代表它對使用者是好事。

怎麼辦? 沒辦法徹底根除,但可以主動降低影響 —— 像是明確要求 AI「站在反方立場檢查我的想法」,或是換句話問同一個問題,看答案會不會跟著翻臉一次。

05 缺陷四

它寫出來的東西,一眼就看得出是 AI

這些詞「此外、至關重要、深入探討、賦能、無縫 」都是 AI 超愛 —— 它們就是「AI 味」的標配。

問題出在哪?訓練資料本身就帶著某種偏好的句型,模型被優化去產出「安全、通順、四平八穩」的文字,結果就是每一家的輸出讀起來都有種說不上來的相似感 —— 句式工整、愛用排比、結尾永遠是「總的來說」。

怎麼辦? 別把寫作整段外包出去。給 AI 明確的寫作範例,或列一份「禁用詞表」讓它照著避開。更實際的作法是:寫完之後自己動手改一輪,把最順、最工整的句子刻意打亂,留一點不完美 —— 真人寫的東西,本來就不會每句都對稱。

06 缺陷五

它的記憶力像金魚

問你 Grok 4.5 的幻覺率是多少?別往回滾動頁面——大概率你答不出來了。因為那是好幾段文字以前的事。

AI 也會有一樣的狀況。現在很多模型都號稱百萬 token 的上下文窗口,聽起來像是「什麼都記得住」,但實際不是這麼回事。這叫「上下文腐化(context rot)」——隨著對話變長,AI 準確抓取中間內容的能力會明顯下滑。

Context Arena 的測試數據很直觀:對話開頭幾乎是接近滿分的精準度,可是一路拉到 50 萬 token 之後,準確率掉到幾乎跟丟硬幣猜差不多。這是 Transformer 架構本身的「迷失在中段」效應——對話的開頭和結尾永遠拿到最多注意力,夾在中間的內容,反而最容易被忽略。

怎麼辦? 盡量讓單次對話保持簡潔,該開新對話就開新的。真的需要長期累積脈絡,考慮搭配外部知識庫(例如 Obsidian 之類的筆記系統),把重要資訊存在 AI 之外,而不是全部塞進同一段對話裡指望它記住。

07 缺陷六

它的世界,永遠停留在某一天

前面五個是行為層面的毛病,這一個更根本:模型知道的世界,是有截止日期的。

不管訓練資料量多驚人,AI 對「現在」的認知,就停在它完成訓練的那一刻。之後發生的事 —— 新政策上路、公司換了執行長、某個服務被關掉了 —— 它一概不知道,除非額外接上網路搜尋這類工具。

更棘手的是,AI 通常不會主動提醒你「這件事我可能過時了」,除非被明確問到、或問題本身帶著明顯的時間線索。這其實跟第一點的幻覺是同一個根源:與其承認自己的知識有邊界,它更傾向給你一個聽起來合理、但可能早就不是事實的答案。

怎麼辦? 問任何跟「現在」有關的事 —— 誰在任那個職位、某產品最新規格、某政策是否還有效 —— 養成習慣多問一句「這是最新的嗎」,或直接要求它去搜尋確認,而不是預設它腦子裡的資料就是今天的現況。

08 結語

結語

這六個問題,說到底都指向同一件事:只要現在這套「預測下一個字」的架構沒有根本改變,它們就不會真的消失,換一個更貴、更快的模型,頂多是把同樣的毛病包裝得更漂亮而已。

與其等技術某天突然解決一切,不如現在就練習跟這些限制共處 —— 保持一點懷疑,關鍵資訊自己查一次,讓 AI 當助手,而不是完全相信它說的。

#AI缺陷 #大型語言模型 #LLM #AI幻覺 #AI寫作 #AI使用