AI为什么能写对“99%”的汉字?GPT Image2.0技术拆解

Description
感谢关注+三连~

Comments

御坂55536号 2026-05-10

我报名比赛时学生证找不到了,我找的别的人的拍了个照,gpt直接把手写部分全部扣掉且一些防伪的水印啥的都保留的完好,然后再用他帮我把我自己的信息填了上去,看不出来是假[doge][doge]

♥ 202 ↩ 6

發燈條等總計39000人 2026-05-10

[doge]

♥ 121 ↩ 1

唐唐一男儿 2026-05-10

很棒,再一次说明了图像和文字最后都被高维化处理变成了token,已经包含低维我们理解不了的信息在里面了[笑哭]

♥ 124 ↩ 7

lvjiajjj 2026-05-10

我觉得Nano banana和GPT-image 2应该都是自回归+扩散,而且这俩都对于某些细节不听话,都是明知有问题想去改但是它们也改不过来,banana 2你去用ai studio也能看到它会视觉上自我纠错自我检查,cot里生成了5张也是可能的,GPT也会视觉检查图像

♥ 66 ↩ 11

蹄垫Official 2026-05-10

把视频纯猜想的声明放在最后是为了防止影响完播率吗[笑哭] 我觉得什么时候开源图像视频模型能出个deepseek一样便宜的

♥ 55 ↩ 21

断简零墨Reiboku 2026-06-20

感觉更像是套用字体生成的,因为它生成的哪怕是手写的字,都有很浓的计算机字体味。因为GPT Image 2.0明显有生成多个不同子图片然后在会话中保持,用作合成素材,它可能调用Agent把预期的文字渲染到一个透明png里。证据是过两天重新打开旧的session它就没法保持那个字体一致性了。这次AI会知道应该在哪些地方放合成的文字替代而不是自己用扩散模型生成。

♥ 58 ↩ 10

风叶渝 2026-05-10

我记得openai并没有出技术报告吧。到底长什么样全是外面猜[吃瓜]

♥ 51 ↩ 1

白夢鈴 2026-05-12

這個我也研究了一下:來聊聊最近很強大的:GPT-Image-2 跟 Nano Banana 2我這段時間在處理的是 Wan 2.2 這種影片生成,就沒很專心去搞 DiT 相關的東西。但我之前有做一些功課,也做了一些實驗,可以來說說。在 Nano Banana 出來之前,對於圖片生成文字這件事是很困難的,通常都會出現亂碼。也有不少試圖解決的方案如:文字編碼器 + 獨立 diffusion 圖像模型。等到 Nano Banana 問世之後,那種圖像文字級別的呈現能力令人驚訝與感嘆。但從 Nano Banana Pro 跟 Nano banana 2 在文字的渲染上依然會出現其怪的字。英文可能還好一點,但中文、數學符號我個人測試,複雜一點都會跑掉。更強的的 GPT-Image-2 因為才剛出來沒多久,使用上的經驗也還不太夠,不太好給出一些想法。圖像生成的本質就是從高斯雜訊進入去噪器之後一點一點的得出圖像。要講 Diffusion 可能不是一天兩天能講完的,我這邊就當大家知道。Diffusion 模型在細粒度控制上仍然有不少限制,最終輸出並不只由單一模組決定。從前端的條件編碼器(例如 CLIP 等文字編碼器)所產生的 conditioning embedding,到中間負責逐步預測噪聲或其他等價參數化的 denoiser(例如 U-Net 或 Transformer),再到最後的反向採樣流程,任何一個環節的差異,都可能明顯影響最終生成結果。把 U-Net denoiser 換成 Transformer denoiser,並不代表 diffusion 的核心框架被改寫。其本質仍然是在每個時間步根據條件資訊估計噪聲,並逐步還原樣本。真正改變的,主要是 denoiser 的結構、表示能力,以及模型內建的歸納偏置。DiT 的原始論文也是以 Transformer 取代常見的 U-Net backbone,並在 latent patches 上進行建模。

♥ 47 ↩ 5

咸yuu1345 2026-05-13

就这张图片大部分字都对了,我是真没话说

♥ 55 ↩ 2

蜜蜂and蜜糖 2026-06-23

只能说不愧是豆包的严父[滑稽]

♥ 49 ↩ 4

U400A1-Online 2026-05-17

这个AI有注意力权重的,如果不是图片不是以文字为核心的话就会神秘乱码

♥ 35 ↩ 2

Mosior_ 2026-05-12

你技术猜想,标题能不能说技术猜想,不要说技术拆解

♥ 32 ↩ 1

贼头贼脑_ 2026-05-11

提示一下大家,GPT有可能会随机降智,一定要确认一下是不是使用了thinking,使用和不使用区别可大了,如果没有使用,一定要点那个使用thinking,而且要确认一下有没有可能被降成5.4

♥ 33 ↩ 12

阿鲁巴大仙 2026-05-15

我感觉文字可能是独立生成再叠上去的。如图,我让他按照我拍猫的清晰度来模糊化整个图像,但背景里的身高数字明显过于清晰。

♥ 28 ↩ 7

迪士尼·中国 2026-05-10

猜想的话应该放在视频前而不是最后

♥ 25 ↩ 1

liu_bili_Grass 2026-05-10

gptimage2的字体几乎完全符合 ps叠加上去几个像素都不差 都不像是扩散的 他们是不是对字体特殊做了对齐啊

♥ 19 ↩ 1

NOT_黎y烬 2026-05-17

疑似新的劳大复活方法

♥ 17

口径不足背过气去 2026-05-10

这样的原理的模型能让家用电脑跑起来吗?

♥ 15 ↩ 41

狐灵foxode 2026-05-10

图像分词器的码本怎么得到的呢?那么多种图像细节居然可以用数字表达出来[笑哭]

♥ 13 ↩ 1