中国の大規模言語モデルが世界ランキングの上位2位を独占
2026-08-03 16:48 人民網日本語版
一方、Unlimited OCRは、OCR(光学文字認識)分野の専門モデルとして、長文書解析技術の重要な一歩を踏み出した。従来、OCRモデルは書籍や論文、報告書などの長文書を処理する際、「ページごとに解析し、その結果を結合する」という方式を採用するのが一般的だった。しかし、出力内容が増えるにつれて、モデルが保持しなければならない「一時的な記憶量」が膨らみ続け、推論速度の低下やGPUメモリー使用量の増大につながるという課題があった。この業界共通の課題に対し、百度は、人間が長文書を読み書きする際の作業方法を参考にし、過去の情報を無制限に保持するのではなく、直近に生成した内容だけを「作業記憶」として保持する仕組みを採用した。この設計により、OCRモデルは1回のフォワード推論だけで数十ページに及ぶ文書を連続して解析し、最初のページから最後のページまで一貫した出力を実現できるようになった。また、「一時的な記憶量」を抑えることで、計算コストやGPUメモリー使用量が出力文の長さに応じて増え続けることもなくなった。(編集KS)
责编:杨雨婷




