このページの本文へ

単一モデルでテキスト情報と座標情報を高精度で同時抽出可能に

OCR使わずテキストと座標情報を抽出 LINE WORKSが新技術「CREPE」を発表

2024年09月27日 16時00分更新

文● ASCII

  • この記事をはてなブックマークに追加
  • 本文印刷

 LINE WORKSは、2024年9月25日、従来のような複数のOCRモデルを使わず、単一モデルで画像ドキュメントからテキスト情報および座標情報を同時抽出する新技術「CREPE」を開発したことを発表した。同技術に関する論文は、文書解析と認識に関する国際会議 「ICDAR2024」にて採択されている。

 従来のOCRでは、さまざまなモデル(検出、認識、解析モデルなど)を組み合わせて段階処理されるため、システムの複雑度が増し、誤差が蓄積され、文書の解析精度が低下するという課題を抱えていた。CREPEでは、単一モデルで情報抽出する「End-to-Endモデル」を採用、画像全体を入力として取り込み、直接的に解析結果を生成するアプローチをとっている。

 End-to-Endモデルでは、複雑なシステムが不要かつ誤差の蓄積を防ぐことができるが、“テキストの座標”を抽出できないという新たな課題が発生する。そこでLINE WORKSは、テキスト情報だけでなくその座標情報も同時に抽出することが可能なCREPEを開発。同技術は、「弱教師あり学習」という手法を採用することで、少ないデータで学習できるように設計されている。

「CREPE」の画像ドキュメント解析の一例、レシート画像(左)から有用な情報を抽出した結果(右)

■「CREPE」の手法
(1)SpecialTokenを導入することでSequenceの中で、画像内のテキストを単語単位で抽出(例:text)
(2)Decoder最終層とLM HeadをSequenceHeadとCoordinateHeadに分離することで、テキストだけではなく座標も推論
(3)CoordinateHeadは単語の終わりを意味するトークンが出る場合にアクティベーションされるので、単語ごとの位置を獲得

「CREPE」の概要図

 LINE WORKSは、「LINE WORKS OCR(AI-OCRサービス)」にCREPEを搭載することで、さまざまなドメインに特化した高精度な解析モデルに適応できるとしている。

■関連サイト

カテゴリートップへ

本記事はアフィリエイトプログラムによる収益を得ている場合があります

アクセスランキング

  1. 1位

    ITトピック

    IT技術者の4割が「5年後のスキル陳腐化」に危機感/働くシニアは多いが「長く働きやすい」環境ではない日本/トークンコストの成果証明は難しい、ほか

  2. 2位

    データセンター

    AIデータセンターの「電力・冷却課題」打破へ シュナイダーが営業・設計・現場を直結する新組織立ち上げ

  3. 3位

    TECH

    二酸化炭素を資源に変える新触媒、新しい合金を電気で合成

  4. 4位

    デジタル

    ヤマハ、RTX1300の「ひかり電話アダプターモード」を解説する無料ウェビナーを10月15日に開催

  5. 5位

    サーバー・ストレージ

    「身代金を払えば復元できる」は過去の幻想――約束を守らない攻撃者と変容するランサムエコシステム

  6. 6位

    sponsored

    乱立する文書管理をBoxに統合へ、オークネットは基盤整備で「AIをビジネスの武器にする」

  7. 7位

    sponsored

    ルールは作ったが… 現場の「勝手にAI利用」が止まらない! どうやったら防げた?

  8. 8位

    ソフトウェア・仮想化

    Microsoft IQとは? AIエージェントが必要とする理由は? マイクロソフトの担当幹部が解説

  9. 9位

    IoT

    フィジカルAI時代を見据え、NTTドコビジがNaaS基盤を強化 数万台のIoTデバイスをセキュアに管理

  10. 10位

    デジタル

    Zscaler Internet AccessのIKEv2接続例 ヤマハRTX1300でZIA経由の冗長IPsec VPNを構築する方法

集計期間:
2026年09月22日~2026年09月28日
  • 角川アスキー総合研究所