无主之地2配置高吗|看真人裸体BBBBB|秋草莓丝瓜黄瓜榴莲色多多|真人強奷112分钟|精品一卡2卡3卡四卡新区|日本成人深夜苍井空|八十年代动画片

網易首頁 > 網易號 > 正文 申請入駐

親測OpenAI o3的10個案例,20美金/月雇跨學科博士做助理

0
分享至

一直以來,OpenAI 的o1模型都是推理模型的巔峰,其DeepResearch功能就是憑借o系列的基座能力,在市場上贏得了口碑。

不過,可能生成報告的模式,讓大家始終覺得搜索升級沒啥看頭,大家很難體會AI的研究能力。

在昨晚發布的o3和o4、o4 mini模型中,實現了以下能力的躍遷:

整體推理能力:對真實、復雜任務的專家打分顯示,o3 的重大錯誤比上一代?o1?少?≈20?% ?視覺多模態:在大學水平的多學科視覺推理基準?MMMU,o3 82.9?%?→?GPT?4 34.9?%,絕對提升?≈48?分,相當于 2.4?× 的相對提升 ?競賽數學:AIME?2024 單次作答 o3 91.6?%,而 GPT?4o 只有 12?% 左右,提升 >7?× ?上下文長度:o3 200?k 輸入窗口?vs?GPT?4 8?k,且輸入/輸出 token 價格僅為 GPT?4 的約 1/3?2/3

AI呈現了一定程度的研究能力,為了能讓大家更直觀感受到大模型在各個領域場景下,高水平處理任務的能力。

鯨哥實測了10個案例,我們能看到o3的分步推理思考過程,很多復雜的問題真正在研究,以及利用工具解決!


1、化身福爾摩斯,看圖猜測背景信息:

鯨哥在o3上傳了一張菜單,要求ChatGPT猜出來是哪家飯店。

可以看到o3分析了菜品和價格,并搜索了大眾點評的數據,提出指紋式的菜名+價格組合只有在四季民福出現,最終答對了!


2、識別圖片內容信息,成為植物學家:

識圖能力在此前的眾多大模型中都已經具備,但這次是給大模型加大難度,用一大束花,讓GPT識別都有哪些花束。

最終o3識別出了8種主要的花束,展現了對復雜內容的理解。


3、做考公 圖推題,o3當小學題題目做

在考公題目中,經常有圖推題出現。這些題目往往具有一定的難度,考驗模型對圖片理解以及意識推理的能力。

這道考公題并不容易,GPT用幾種形狀來找規律,最終選擇了答案D。當然,這道題也有爭議,粉筆網給出的答案是D,但很多人認為是B。

只是19秒做完這題,o3估計覺得這題沒多復雜,都是小學生題。


4、數學計算能力更強,重大錯誤比o1強20%

在數學計算中,此前o1開始計算哥德巴赫猜想,讓大家吃了一驚。當然,也沒有計算出來,卻顯示出推理大模型的強悍之處。

鯨哥拿一道DeepSeeK做錯的數學題,考驗o3的進化能力。

這道題不太難,但是DS的幻覺率需要人為矯正。

而o3很快就得出了正確答案,數學題是推理模型的阿克琉斯之踵,o3有進步。


5、調用OpenAI內部工具,除了不能做視頻

在這里,我們先讓o3深度調研下『2025年北京夏天可能火的食物』這一主題。o3從全網內容中獲取了最新的5款食物銷量,得出了結論。

o3最看好 乳茶2.0這款產品,接著讓o3做一張輕乳茶2.0的宣傳海報,o3會思考任務交代中沒有明確提示要Midjourney生成,那就是不僅要生成Prompt,還需要調用4o模型直接生成圖片。

接著我們讓o3直接生成輕乳茶的電商網頁,以動態可視化的HTML網頁形式運行。現在GPT還可以直接運行代碼,實時預覽,很方便。

可以看到右下角還有修復提示,這也是本次o3的重要提升,當它意識到程序有Bug時,就會實時提示可以修復真實代碼,這對于AI編程落地很關鍵。


6、創意視頻生成,后續結合Sora才有前景

o3其實作為LLM,本身不支持生成視頻,但是我們還是要求他生成視頻,考驗它解決問題的思路,這里鯨哥給到的是飛機和魚的創意故事。

o3是逐幀生成了圖片,然后做成gif形式的視頻。

可以看到最終生成的視頻內容,是一架飛機路過,伸出了魚鉤,釣起魚飛走了。這個創意讓我想起來一個歌:『海鳥與魚相愛,只是一場意外』


7、代碼能力和真實物理能力測試

這次公告中,官方稱在“修 bug”基準?SWE中,o3 解決?69.1?% 問題,而 GPT?4o 只解決 33?%左右,代碼能力 ≈2?倍提升。

實測中,生成代碼的審美確實沒什么進步,以下是o3生成的100個小球碰撞的物理實驗,這個效果差強人意。

和下圖對比看,相比o1的還遜色不少,o系列模型確實在代碼編程方面,始終沒有超越Claude3.7。尤其前端UI這塊,水平還是差不少,GPT-4.1也不行。


8、科技商業問題推理,最終寫成文章

在這道題中,鯨哥用比較有門檻的科技商業文作為寫作題目,而且要求中間插入數據分析以及戰略路徑歸納,最終得出結論。

生成的分析深度還可以,只是沒學會吳曉波老師的文筆。

一直以來,ChatGPT的寫作能力都略遜Claude3.7,從目前看,語言的風格化以及潤色程度,比3.7確實還有距離,但是數據和邏輯分析,以及概念的引用都不錯。像是個不經常寫文章,而是經常做研究的博士,寫出來比較硬的內容。


9、視頻分析能力,對多媒體的理解能力

我們在Youtube上找了個萬人大合唱的合集,然后讓他分析這是什么內容,以及為什么能爆火。

o3解讀出了都包括哪些歌,然后分析了爆火的底層邏輯。感覺對于IP孵化類博主是個福音,大家以后能用o3直接寫爆款分析課程了。


10、生成深度研究報告,o3表現更好

我們調用o3模型的深度思考能力,生成了一份行業報告。o3用了不到20分鐘生成了這份1萬多字的報告。

還是先思考后搜索的思路,內容較o1版也有一定程度的提升。

報告全文在這里:https://chatgpt.com/share/6800bf78-bac8-8005-82e4-07c686e121e6

o4mini更適合批量客服回答等強調性價比場景,所以本文沒有測試。Altman還提到,o3 Pro版本將在未來幾周內到達,能力應該比本文測試的o3更強,但也意味著價格更貴。

在Plus賬號中,你能大范圍使用ChatGPT 的所有能力,尤其o3的20美金每月費用,相當于花近200多元雇傭了一個跨學科博士生在身邊做助理,大家覺得值不值呢?

視頻內容推薦:

特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相關推薦
熱點推薦
快訊!認了,菲律賓喊話中國了!

快訊!認了,菲律賓喊話中國了!

故事終將光明磊落
2026-06-13 09:07:31
不到三天丟掉冠軍,《火遮眼》口碑下滑,觀眾差評理由一致

不到三天丟掉冠軍,《火遮眼》口碑下滑,觀眾差評理由一致

影視高原說
2026-06-13 07:39:30
前酋長隊超級碗冠軍因涉嫌殺害女友被起訴,或面臨死刑

前酋長隊超級碗冠軍因涉嫌殺害女友被起訴,或面臨死刑

競技風云錄
2026-06-13 00:59:32
馬洛塔赴皇馬商談多筆轉會合作

馬洛塔赴皇馬商談多筆轉會合作

體壇周報
2026-06-13 22:30:13
中國公開賽首爆大冷!7冠王1-6潰敗,傅家俊也出局了,張安達6-2

中國公開賽首爆大冷!7冠王1-6潰敗,傅家俊也出局了,張安達6-2

球場沒跑道
2026-06-13 08:23:49
借貸公司上門催債被反殺,尸體拖上車焚燒,8000元借貸釀雙命慘案

借貸公司上門催債被反殺,尸體拖上車焚燒,8000元借貸釀雙命慘案

易玄
2026-06-11 15:33:31
芯片之后三大材料正接棒!光通信 + PCB + 玻璃基板,下一個十倍賽道

芯片之后三大材料正接棒!光通信 + PCB + 玻璃基板,下一個十倍賽道

粵語音樂噴泉
2026-06-12 08:17:21
朝鮮霸占四個世界第一,至今無人超越,難怪美國對朝鮮如此客氣

朝鮮霸占四個世界第一,至今無人超越,難怪美國對朝鮮如此客氣

今夜繁星墜落
2026-06-13 05:28:13
世界杯上最難纏的對手,出現了!

世界杯上最難纏的對手,出現了!

新民晚報
2026-06-13 08:35:46
世界杯又見手撕球衣名場面!該球衣品牌曾被吐槽“但愿他們不產安全套”

世界杯又見手撕球衣名場面!該球衣品牌曾被吐槽“但愿他們不產安全套”

南方都市報
2026-06-13 13:32:55
中國公開賽:陳睿夫姚鵬成爆冷舒爾蒂和塔猜亞,袁思俊逆轉進48強

中國公開賽:陳睿夫姚鵬成爆冷舒爾蒂和塔猜亞,袁思俊逆轉進48強

世界體壇觀察家
2026-06-14 00:42:57
美軍開始空襲伊朗

美軍開始空襲伊朗

財聯社
2026-06-11 05:42:11
女總裁破產那天,我給爸打了個電話:我看上老板了,給點追妻基金

女總裁破產那天,我給爸打了個電話:我看上老板了,給點追妻基金

千秋文化
2026-06-09 22:53:05
都罵董潔看走眼,但沒人知道,王大治除了外貌低配,其他全是頂配

都罵董潔看走眼,但沒人知道,王大治除了外貌低配,其他全是頂配

山谷里的怒吼
2026-06-12 13:22:54
沃勒爾:如果沒有巴斯托尼的紅牌,意大利就會出現在世界杯上

沃勒爾:如果沒有巴斯托尼的紅牌,意大利就會出現在世界杯上

懂球帝
2026-06-13 23:59:22
什么是知識的詛咒?網友:但凡被知識污染一點也想不出淡硫酸這詞

什么是知識的詛咒?網友:但凡被知識污染一點也想不出淡硫酸這詞

另子維愛讀史
2026-06-13 23:39:37
93%依賴瞬間清零:日本石油進口,徹底逃離霍爾木茲!

93%依賴瞬間清零:日本石油進口,徹底逃離霍爾木茲!

寰球經緯所
2026-06-13 21:01:31
情懷喂了狗!天涯社區重啟收費1999元陷入爭議,網友:吃相難看啊

情懷喂了狗!天涯社區重啟收費1999元陷入爭議,網友:吃相難看啊

火山詩話
2026-06-13 05:54:20
俄方就G20參會受阻向美方提出交涉

俄方就G20參會受阻向美方提出交涉

澎湃新聞
2026-06-13 16:23:18
又出事了?日本排華情緒大爆發,高喊滾出日本!百萬華人咋辦?

又出事了?日本排華情緒大爆發,高喊滾出日本!百萬華人咋辦?

兵鑒史
2026-06-07 12:30:44
2026-06-14 03:47:00
鯨選AI incentive-icons
鯨選AI
最新AI產品化與商業化案例速遞
168文章數 38關注度
往期回顧 全部

科技要聞

SpaceX上市首日破2萬億美元,馬斯克再封神

頭條要聞

特朗普:美伊協議計劃周日簽署 霍爾木茲海峽立即開放

頭條要聞

特朗普:美伊協議計劃周日簽署 霍爾木茲海峽立即開放

體育要聞

美國4比1巴拉圭:這統治力真是美國隊?!

娛樂要聞

鄧超曬孫儷親手織的帽子,笑瘋全網!

財經要聞

梁文鋒向左,楊植麟向右

汽車要聞

深藍S07華為乾崑激光版增程車型上市 限時15.49萬元起

態度原創

藝術
家居
房產
本地
游戲

藝術要聞

廣州再建一座“小蠻腰”?190米,頂著個球,2027年見!

家居要聞

空間微調 移形換境

房產要聞

海南最賺錢行業曝光!最快4年半,海口全款買三房!

本地新聞

AK劉彰邂逅河北南大港濕地

LPL淘汰賽:就差一點,今天無奇跡!BLG五局戰勝WE,決賽見

無障礙瀏覽 進入關懷版