ロボットが学習したことのない文字を手書きで再現—ストローク構造の学習による汎化
ブラウン大学の研究者らは、ロボットに日本語の文字を手書きする訓練を行い、再訓練なしでヒンディー語、ギリシャ語、英語、さらにはモナリザのスケッチまで汎化できることを確認した。鍵となるのは、局所的なストローク制御と全体的なペン動作を分離することだ。

手書きは、自動化しようとするまで単純に見える人間のスキルの一つだ。単語を書けるロボットは、ペンをどこに置くか、各線をどのくらいの長さで引くか、文字の途中(大文字のAの横棒など)でペンをいつ持ち上げるか、そしてどこに戻すかを決定しなければならない。ほとんどのロボット筆記システムは、各文字を固定テンプレートとして扱うことでこれを回避している。ブラウン大学の研究者らは別の方法を取った:ロボットにピクセルだけでなく、ストロークの構造を学習させたのだ。
ロボット工学者のステファニー・テレックスと博士課程の学生である小谷篤信によって開発されたこのシステムは、タスクを2つのモデルに分割する。局所モデルは現在のストロークを処理し、ペンの位置を決め、ストロークを終了するタイミングを決定する。大域モデルはペンを次のストロークの開始位置に移動させる。ロボットは日本語の文字コーパスで訓練され、各文字の構成ストロークがどのように組み合わさるかについての注釈が付けられた。そこから、画像を見て次のストロークをどこから始めるか、また描画中にどのように動かしてターゲットを再現するかを予測することを学習した。
驚くべき結果は、研究者らが汎化をテストしたときに現れた。彼らはホワイトボードにヒンディー語、タミル語、イディッシュ語で単語を書いた—ロボットが一度も見たことのない文字だ—そしてロボットはそれらを正確にコピーした。また、日本語のみで訓練したにもかかわらず、英語のブロック体と筆記体も処理した。モナリザの大まかなスケッチでさえ再現された。
このシステムは完璧ではない。現代の日本語は左から右に書かれるため、ロボットは他の左から右の文字にはうまく汎化したが、アラビア語やヘブライ語のような右から左の言語では苦労した。これは、モデルが普遍的な筆記規則を学習しているのではなく、訓練データから方向バイアスを学習していることを示している。
これは、ロボットが人間とより自然な方法でコミュニケーションできるようにするための一歩だ—感熱紙のプリントアウトを吐き出す代わりに、手書きのメモを残す。しかし、これは機械学習における汎化についてのより深い点も浮き彫りにしている:モデルが正しい抽象化(ストローク構造)を学習すれば、新しい入力に転移できる;表面的なパターン(テキスト方向)を学習すれば、失敗する。
彼らは、文字を作るためにどのストロークをどの順序で行うかという小さなアルゴリズムを与えてくれる。そして、私たちのアルゴリズムが学習しているのはまさにそれだ。
出典: WIRED
ディスカッション
0 件のコメント
最初のコメントを投稿しましょう。