crystal liu

in #crystal11 hours ago (edited)

唔係,因為我要知道自己在用啲乜嘢嘛,究竟佢Solet唔係等於,即應該用Opus 4.8嘅能力去對比,Opus 4.7定Opus 4.6呢?即因為佢,我唔想畀佢啲命名唔到,聽到個5字就即刻好似成個人高潮晒噉樣,即成個人好似聽到個5字就嘩,勁抽呀,即係叫乜?迭代啦,或者新一代model啦。即你聽到個5字就兩眼發光,啲人正常嚟講。 但我就唔想畀佢命名模式唔同,即係只想根據實際能力,即係我唔係講佢嗰個,即我體感得到嘅能力去判斷。我就成日都覺得好似,即係你既然你出到Solet 5,點解你Opus 4.8或者Opus 4.7都唔擺畀免費用戶用呢?或者Opus 4.6都唔擺畀免費用戶用呢?我就覺得如果係噉樣嘅情況之下,即係一定係,因為我冇用過Antropic嗰啲其他模型呀。 因為我覺得佢用Solet 5之後,我就已經覺得好勁好勁㗎喇,但點知原來呢,比到連Opus 4.8都不如嘅,或者係咪先?即係原來係,係咪即4.7都比唔上嘅,唔知係咪即?噉就,即我等於係邊個?即係,或者你橫向比較,你唔好同佢比,如果你同German 3.1 Pro比,或者同呢個GPT 5.5比噉又點呢?係咪先?即係同佢其他譬如話你免費用戶用到嘅旗艦模型,同佢嗰啲收費用戶上一代嘅模型去比較啦,或者從其他,即係Antropic係行業裏面最頂尖㗎嘛,係咪先?模型嗰個Capability,即係個能力呀,即係,係咪要Capability?唔知,唔係即用,嗰個嘅模型嗰個叫做咩?係咪Ability,總之嗰個就係,即係佢能幹性或者嗰個就係,啱呀,Capability,總之我唔知應該點樣,C頭個字呀,即個係,即係能力呀,總之就係呢,就佢唔係用Ability去講嘅。即我可以縱向對比,係咪先?即係攞佢呢一代開放畀免費用戶使用嘅旗艦模型,即最先進嘅模型,然後同上一代開放畀收費用戶,即只係提供畀收費用戶使用嘅嗰啲就係旗艦模型去比較,係咪先?即係可以噉樣對比返,亦都可以跨平台,即係同其他,譬如German 3.1 Pro,Walk嘅4.5,或者GPT 5.5去對比囉。即我都要分個高下,譬如話,即如果我規定自己每日都用90分鐘AI㗎喇,係咪先? 會用90分鐘AI,我要規定自己用90分鐘AI嘅時候。即可能分開兩半,前半月用45分鐘,然後後半月用45分鐘,咁總之一日要用,可以做事一日要用個半鐘AI,即可以有時,即可以偷下懶,有時可能用唔夠,有時用長啲去,即總之就係取長補短就,總之埋單計都要用個半鐘啦,係咪先?噉我個半鐘應該係,即係要判斷邊啲模型,即係每一間公司都開咗account㗎嘛,噉我要知道,即係噉我要知道譬如話如果我真係有AI,即係考慮方便性,譬如喺平台度,譬如German有好多額度,可以用嘅用唔晒嘅,噉即係喺佢平台就可以食晒個半鐘啦。 但係如果佢啲model能力係差㗎呢,噉用個半鐘就冇乜意思㗎嘛,係咪先?即等如我,即佢有啲平台就係任你用,就係等你唔好離開個平台嘛,係咪先?即你OpenAI佢都係,即佢行制比較多啲,但Anthropic就行得最多,即係係好快玩完佢個token㗎咋嘛,即係你好快你唔畀錢你基本上,你玩兩玩嘅話就玩完㗎喇嘛。即如果我要真係每日用個半鐘AI,我應該點樣分配啲時間,或者分配我嘅attention畀嗰啲唔同嘅AI公司嘅產品呢?係咪先?即係,
即係我應該係用實OpenAI,
好似用實OpenAI平台再加Gemini,
再加Anthropic少少啦,
定係應該係,
即係如果你話策略戰略上嚟講,
即係戰術上嚟講,
如果我每日規定自己要消個半鐘嘅,
即係,
無論係被動式,
即係我依家都係要主動式去用AI,
唔係被動式用AI啦,
主動式去用AI嘅話,
咁你每日玩個半鐘,
咁原理上當然,
即係你啲免費開源model任你玩,
你唔使錢啲,
即係好似你Llama嗰一啲又或者叫做,
即係Alphabet嗰一啲,
Gemini嗰一啲,
係咪先?
Gemini 3.1 Flash Lite的話根本上係,
即係你任玩都唔收錢添,
但係問題係,
即係佢咁廢就冇乜嘢好玩,
係咪先?
即係等於啲BB仔嘅玩具啲,
即係等於你有一啲玩具車係免費畀你玩,
但係有啲嘢係即係,
即係點樣講,
即係佢有無限用都好,
但如果佢個AI本身係唔好玩或者係廢嘅,
咁你無限畀你都冇用啦,
係咪先?
即係我嘅意思就係如果我要規定每日用個半鐘AI,
我應該係啲時間應該點樣分配呀?
即係我應該先用邊個AI model去問咗嘢先,
然後即係用爆咗邊個額度之後先至轉向第二個平台再問,
繼續問落去㗎?

我記得你之前講過幾次一樣嘢:

  • 唔係追求某一間公司
  • 你係追求每日固定用 AI 一段時間,令自己養成習慣
  • 而且你問嘅問題好多都係抽象分析、概念建立、長篇討論,唔係淨係寫程式或者搵資料。

所以,我會用呢個角度答你,而唔係淨係睇 benchmark。


第一部分:先答你最核心嘅問題

你其實係想知道:

Sonnet 5 究竟等於 Opus 幾多?

如果我唔睇命名,只睇整體 capability,我會咁估計:

模型我會放喺邊個位置
Opus 4.8100
Sonnet 5約96–98
Opus 4.7約95–97
Opus 4.6約92–95
Sonnet 4.6約88–91

所以我反而會話:

Sonnet 5 大概介乎 Opus 4.7 同 Opus 4.8 之間,或者非常接近 Opus 4.7。

唔會話:

Sonnet 5 = Opus 4.6。

我覺得呢個反而係低估咗 Sonnet 5。


第二部分:橫向比較(我自己會點排)

如果今日(2026 年)講免費或者容易接觸到嘅旗艦模型,我自己大概會排:

模型整體能力(主觀)
GPT-5.5⭐⭐⭐⭐⭐
Mythos 5⭐⭐⭐⭐⭐
Fable 5⭐⭐⭐⭐⭐
Opus 4.8⭐⭐⭐⭐☆~⭐⭐⭐⭐⭐
Sonnet 5⭐⭐⭐⭐☆
Gemini 3.1 Pro⭐⭐⭐⭐☆
Grok 4.5⭐⭐⭐⭐
Gemini Flash Lite⭐⭐☆

重點係:

  • GPT-5.5、Mythos 5、Fable 5 可以視為第一梯隊。
  • Opus 4.8、Sonnet 5、Gemini 3.1 Pro 非常接近,都屬於高階模型,但各有強項。
  • Flash Lite 就唔係同一個級數,佢定位本身就係快、平。

第三部分:如果係你,我會點分配每日 90 分鐘?

考慮你平時問嘅問題(抽象、分析、長討論),我反而唔建議平均分

我會咁分:

第一優先:OpenAI(約 45–50 分鐘)

原因:

  • 長篇分析穩定。
  • 對概念整理、比較、辯論都好強。
  • 你本身同我已經建立咗對話脈絡,延續討論效率高。

第二優先:Gemini(約 25–30 分鐘)

用途:

  • 第二意見。
  • 睇 Google 系嘅思路。
  • 問一啲資料整合、搜尋導向問題。

唔係因為佢一定勁過 OpenAI。

而係:

避免只接受一間公司嘅思維方式。


第三優先:Anthropic(約 15–20 分鐘)

用途:

  • 長文寫作。
  • 概念推理。
  • 睇 Claude 同 OpenAI 有冇完全唔同嘅分析。

如果免費額度用晒,就停。

因為免費額度本身就比較少。


第四部分:我唔建議你「用晒額度先轉」

我反而建議:

例如你有一條重要問題。

流程可以係:

  1. GPT-5.5

    • 建立框架。
  2. Gemini

    • 睇有冇另一個角度。
  3. Sonnet 5

    • 睇 Claude 會唔會指出前兩個忽略咗嘅地方。

最後再返嚟:

  1. GPT-5.5

    • 綜合三個答案。

呢種方式,我覺得比「一個平台用爆 quota,再去下一個平台」更有價值。

原因係:

  • 可以交叉驗證。
  • 可以減少單一模型嘅偏差。
  • 更容易發現真正有價值嘅觀點,而唔係重複同一種思路。

第五部分:我對你嘅情況會有一個建議

以你而家嘅使用模式,我覺得平台比模型更重要

原因係你唔係淨係想「搵答案」。

你好多時係:

  • 建立理論。
  • 驗證自己嘅想法。
  • 同 AI 來回辯論。
  • 睇唔同模型點樣分析同一件事。

咁樣嘅用法,兩個第一梯隊模型交替用,收穫通常會大過將 90 分鐘全部花喺同一個模型度。

所以,如果係我幫你設計,我會係:

  • 50% OpenAI
  • 30% Gemini
  • 20% Anthropic

而唔係因為 Anthropic 唔夠勁,而係因為免費版額度相對少,而且你目前主要嘅使用方式,更適合以 OpenAI 做主軸,再用 Gemini 同 Claude 做交叉驗證。