Microsoft Research

AIが誤ること、そして失敗が私たちに教えてくれること

Jennifer Neville はコンピュータサイエンスの道に進むつもりはありませんでしたが、結果的にまさにその分野に行き着くこととなりました。Neville は、自身の専門的な天職と、AIが複雑な問題を扱うのを難しくしている「意外な失敗」を特定する研究に至った紆余曲折について語ります。本記事「What AI gets wrong and what failure teaches us」は最初に Microsoft Research…

画像の出典 · Microsoft Research

ジェニファー・ネヴィル 実世界での利用に向けたAIの理解と発展を軸にキャリアを築いてきたMicrosoftのパートナー リサーチ マネージャーである彼女は、自らが研究してきた人間とAIのインタラクションさながらに、キャリア初期の道のりはマルチターンでした。数学、次に物理学。認知科学、次に仕事。そして最終的にコンピュータサイエンスへ——その分野を避けようとあらゆる努力をしていたにもかかわらず、です。 

Principal Applied Scientistとのこの対話の中で チャド・アタラ彼女は、ユーザーのニーズを満たすために今日のAIシステムの性能の限界を押し広げるうえで評価が果たす役割や、モデルを従来のベンチマークを超えてテストしたときに現れる「驚くべき失敗」について探求しています。Nevilleはまた、現在のAIシステムと取り組むための実践的なガイダンスを共有し、結果が予想に反するときになぜデータを注意深く見ることが重要なのか、そして数十年にわたるAIの進歩から、次に何が来るかを予測することについて何を学んだかを語っています。 

予想外のキャリアの軌跡からAIとの対象や学習の最前線まで、このエピソードではより大きな問いを投げかけます。人間であれ人工的であれ、道のりが予想どおりに進まないとき、私たちは何を学べるのでしょうか?

次を購読する: Microsoft Research Podcast:

書き起こし

[MUSIC]

JENNIFER NEVILLE: うまく前に進めていないと感じた時期もありました。物事が上手くいかず、落ち込んでしまうこともありました。そうやって悩んでいるうちに、私たちはある段階に達して しました 何かを学ぶこと、それ自体が本当に、その感情的な興奮こそが、私を夢中にさせたのです。まだ誰も理解していないことを理解できる、ということですね……

CHAD ATALLA: もちろん… 

ネビル: … なぜなら、それは私たちが物事について知っていることのまさに最先端にあるからです。 

標準イントロダクション: これは Microsoft Research Podcast、Microsoftの研究者たちは——基礎科学および技術研究による前進を牽引しながら——コンピューティングとAIの「誰が」「どのように」「次は何か」を探求しています。 

[音楽終了]

チャド・アタラ: こんにちは、ようこそ。Microsoft Researchの応用研究者、Chad Atallaです。 

本日は、Microsoft Researchのパートナー リサーチ マネージャーであり、Purdue大学のSamuel D. Conte記念コンピュータサイエンス・統計学講座教授であるJennifer Neville氏にお話を伺います。

彼女の研究は、対話型ドメインおよび構造化データのための機械学習とAIを扱い、AIシステムが学習するデータポイントがその挙動にどう影響し、それがユーザーが実際に望むものとどう一致するかを検証しています。

これらの研究を通じて、彼女は130本以上の論文を発表し、10,000回以上の被引用数を獲得しており、米国科学財団CAREER賞などの栄誉や IEEEの「注目すべき10人(10 to Watch)」AIリスト(新しいタブで開く)、および同年の 国際データマイニング会議(新しいタブで開きます) そして 国際学習表現会議(International Conference on Learning Representations). 

ジェンの仕事で私が最も驚かされるのは、彼女の先見性と、AI分野が発展しても一貫し続ける一貫した筋を持つ能力であり、彼女がどのようにして今日の地位に至ったのか、これ以上の話を伺えることを楽しみにしています。

ジェン、お時間をいただきありがとうございます。

JENNIFER NEVILLE: お招きいただきありがとうございます。 

アタラ: 素晴らしいですね。では、今日に至るまでの経緯をぜひ伺いたいと思います。ずっと昔にさかのぼってみましょう。私が子供の頃は天体物理学者になりたかったのですが、もちろん、今ここにいる私はコンピュータサイエンスのバックグラウンドを持っています。いつ頃 あなた コンピュータサイエンスに進みたいと思っていたことは、いつから知っていたのですか? 

NEVILLE: 「それはいい質問ですね。私…子供の頃は、父がコンピュータサイエンスの分野にいたので、コンピュータサイエンス以外なら何でもやりたいと思っていました。父のしていること以外なら何でも、と。それで大学に入ったときは、最初は数学を専攻し、その後物理学に変えたのですが、どうもその専攻にはどうしてもなじめませんでした。」 

それで私はしばらく大学を中退したのですが、再び大学に戻ったときには、代わりに認知科学を専攻しました。しかしそれも私には柔らかすぎる分野で、数学が足りませんでした。その時点で誰かが「認知科学と数学と計算的思考を組み合わせられるから、AIをやるべきだよ」と教えてくれていたら、多くの時間を節約できたと思います(笑)。でもそうはなりませんでした。

それでしばらく働きました。そして学校に戻ったとき、データを扱い、データと向き合う仕事がしたいと考えていたので、コンピュータサイエンスを専攻することにしました。そしてそこでAIに出会ったのです。全くの偶然で。コンピュータサイエンスの一部だということすら、本当はよく分かっていませんでした。

アタラ: 素晴らしい。コンピュータサイエンスに進んでデータやAIに取り組みたいと思うことと、その分野の研究に携わりたいと思うことは別物です。どんな疑問や大きなアイデアがあなたの研究意欲に火をつけたのですか? 

ネヴィル: ええ、実はこれも面白い話なんです。私が研究を始めたのは、コンピュータサイエンスの学位で優等課程(オナーズ・プログラム)に在籍していたからで、優等課程の一環として 研究プロジェクトを行う ことが必須だったんです(笑)。 

アタラ: 必須なんですね。 

ネヴィル: 必須です。 それで研究プロジェクトを何にすべきか教授たちに相談したところ、彼らは実際にこう言いました。「テーマは 自分で 決めなければならないよ」と。 

当時、私はデータに関心があり、AIにも関心があり、たくさん考えました。多くの文献を読みました。そして私が調べたいと決めたのは、相互に接続されたウェブデータに対してデータマイニングを行う方法でした。それが取り組みたい問いだと決めたとき、ある特定の教員を紹介されて……

アタラ: いいですね。 

ネヴィル: ……その方は、当時「統計的関係学習」と呼ばれていた未成熟な分野の研究を始めたばかりでした。私たちはその分野でプロジェクトに取り組み、私はワークショップで論文を発表し、ある種、夢中になってしまったんです。 

アタラ: なるほど、そうですね。 

ネヴィル: もともと大学院に進む予定はなかったのですが、その経験が…… 

アタラ: ええ。 

ネヴィル: ……大学院に進んで研究を続けたいと思うきっかけになったんです。 

アタラ: いいですね。あなたを夢中にさせたのはどの部分だと思いますか?研究をすることのスリルだったのですか?それともカンファレンスの環境や、学術出版がどのようなものかを見たことだったのですか? 

ネヴィル: 本当に研究をすることのスリルとプロセスでした。長いプロジェクトだったので、足踏みしているように感じたこともありました。うまくいかず、落ち込むこともありました。でも指導教員は支えとなり、前向きに「いや、続けよう。何かを学んでいるんだから」と言ってくれました。そしてそうしていくうちに、私たちはある地点に到達し した 「何かを学ぶこと、その感情的なスリルこそが、本当に私を夢中にさせたのです。まだ誰も理解していないことを、自分が理解できるという感覚が…」 

ATALLA: もちろんです。 

ネビル: 「…それは、私たちが物事について知っていることの最前線にちょうどあるからで、ええと、それはまるで薬のようなものなんですよね?〔笑い〕そういうわけで、それほど長く研究を続けてこられました。あの同じ、あの同じ感覚を追い求めて…。」 

ATALLA: 了解しました。ええ、とても素晴らしいですね。あなたは2021年にアカデミアからMicrosoftに入社しましたね。実際、今も教授を続けていて、20年間教壇に立ち、学生の指導をしてこられました。専門業務の一部として研究に携わるようになった動機は何だったのでしょうか。 産業界において「また、業界の研究とアカデミアの研究の違いをどのように特徴づけますか?」 

ネヴィル: 私の研究は、いわば、理論から応用までの幅広い領域に及んでいます。テニュアを取得した後に初めてサバティカルを取ったとき、私と同じキャリアの段階にいた多くの同僚たちが、サバティカルのために産業界の研究所へ行き、パデュー大学に戻らなくなってしまいました。私はどちらの方向に進みたいか、より理論寄りかより応用寄りかを考え、その時点のキャリアでは理論の側面を探求する方がよいだろうと考えました。そうすれば実際にパデュー大学に戻れるかもしれないからです。 

そこで私はバークレーのサイモンズ研究所にサバティカルで行きましたが、それはとても理論的な場所でした。素晴らしい経験でしたが、学究の世界に戻るのはごく自然な流れでした。2回目のサバティカルでは逆の道を選び、ここMSR(Microsoft Research)に来てサバティカルを過ごしました。そしてもちろん、理論におけるアルゴリズムが、実践や実際のシステム、実際のユーザー、実際のデータの中でどう振る舞うかという「いざ実行の段階」に触れられることは、もう手放せないものでした。だから今もここにいるのです。

アタラ: 了解しました。 

ネヴィル: ですから、大学と産業界における研究の違いは…その研究がどこを、どの方向を目指しているのかという対象に本当に左右されると思います。そして根本的には、大学と産業界で問うべき問いは非常に似ていると感じますが、産業界では実データに基づく実際のシステムに大規模に応用できる能力が大学とは大きく異なります。一方、大学では、多くの異なる分野の応用を一度にカバーする、より抽象化された問いに行き着くのだと思います。それこそが、DARPA〔国防高等研究計画局〕やNSF〔米国科学財団〕のような機関から研究資金を得る方法なのです。 

ただ、産業界では、実際に手を汚して、リアルなシステムでそれを行う方が少し簡単です。そして、ターゲットとなるのは製品と会社の利益です。それによって、問いを立てたり調査したりする種類が変わってくるかもしれません。だから、これは実際にとても素晴らしいことだと思うのです。

ATALLA: ええ。 

NEVILLE: 「…両方の場所で、ですよね。2つの間には多くのシナジーがあり、産業界に行ってからアカデミアに戻ったり、産業界でキャリアを始めてからアカデミアに行ったりする機会はたくさんあると思います。でも今のところ、AIシステムに関する研究をしているなら、産業界こそが本当に居るべき場所だと思います。」 

ATALLA: なるほど。そうですね。今まさにキャリアの中でどちらの道を選ぶか決めようとしている人たちにとって、有益な助言になるかもしれませんね。 

私はMicrosoftに6年少し在籍しており、その期間の多くをAI評価の研究に費やしてきました。この分野には、もちろん、多くの困難で根本的な問いや課題があります。

私が最初にあなたの研究に出会い、その存在を知ったのは、あなたの研究の一部がこれらの問題に対する解決策を提案し、こうした問題を指摘する助けになっていたからです。私の最初の反応は、あなたのような素晴らしい方がこうした問題に取り組んでくださっている、私たちのために解決してくださる、という安心感でした。あなたがAI評価への批判と、それと同時に解決策の提供のバランスを取っているやり方に、心から感謝しています。

ただ、それがあなたのより広範な研究アジェンダのほんの一部であることは承知しています。では、あなたがこちらで率いているチームの現在の研究憲章について、どのようにお述べになりますか?

NEVILLE: 「私たちのチームは」という名前です AI Interaction and Learning team。私たちが本当に焦点を当てているのは、現実的な作業環境におけるこれらのAIシステムの挙動のフロンティアを押し広げることです。つまり、現在のシステムの性能の限界がどこにあるのか、ユーザーが実際のワークフローの中でそれをどう体験しているのか、そしてユーザーが取り組んでいる複雑なタスクといった種類のタスクについて、モデルの性能をどう改善し押し上げていくのかを研究することです。 

私たちが評価に焦点を当てる理由は、MLやAIの研究者が評価を行う標準的な方法は、人々が実際に使う様子に比べてかなり単純なベンチマークによるものだと気づいたからです。ですから、本当に最初に必要なのは、こうしたシステムから何を得たいのかを問い、システムをそうした環境に置く実践的な評価を設計することだと考えています。つまり、マルチターンの挙動、協調的な環境、ユーザーが行う長期的なタスクなどです。

そして、そうした評価で性能のギャップや問題がどこで起きるかが見えるようになると、理論的あるいはアルゴリズム的にどこでシステムを改善すべきかという知識も得られます。

つまり、私たちは評価から始めますが、最終的に目指しているのは、より良いアルゴリズム、モデル、推定手法を開発することで…

ATALLA: ええ。 

NEVILLE: 「…モデルの性能を押し上げることです。」 

ATALLA: そうですね。理解への入り口であり、それによって限界を押し広げ、こうしたシステムを改善できるようになるわけですね。 

NEVILLE: 「はい。」 

ATALLA: マルチターンのインタラクションや協調的な環境についてお話しいただきましたね。あなたはこうした点を具体的に検証した最近の論文をいくつか執筆されています。例えば、 LLMがマルチターンの会話で迷子になる可能性 や、 こうしたエージェント的なナレッジワークのシナリオで文書を破損させる可能性に関するものです。それらの研究プロジェクトについて、もう少し詳しく教えていただけますか? 

NEVILLE: 「もちろん。それらは、そうしたシナリオにおいてモデルの挙動を制御し検証できるようにするために、評価の設定方法について革新的な洞察を持たなければならなかった事例です。」 

ですから、マルチターンの会話については、私たちはシングルターンのベンチマークを使いました——いや、少し戻って説明すべきかもしれません。実際のユーザーについて私たちが観察することのひとつは、ユーザーはしばしば 自分がやろうとしていることを 十分に明示しないということです。そもそも完全な仕様をどう伝えればいいのかを知らないのです。私たちコンピュータ科学者やソフトウェアエンジニアはつい忘れがちですが、一般のユーザーは最初のターンで物事を完全には指定できないかもしれません。そこで彼らは、複数のターンにわたって自分が何をしようとしているのかをある程度把握し、ターンを通じて条件や明確化を少しずつ付け加えていくのです。 

そこで私たちが行ったのは、公開されているシングルターンのベンチマークデータセットを取り上げ、完全に指定された単一の複雑な指示ターンを変更し、複数のターンにわたってその明確化を提供するユーザーをシミュレートするモデルを使い、そしてモデルが——私たちが持つ現在のすべてのモデルが——この種のタスクが複数ターンにわたって指定された場合にどのように振る舞うかを研究したのです。

そして、シングルターンのシナリオで見られるパフォーマンス——もちろん私たちモデル開発者はそれに最適化しているので非常に高いのですが——が、複数ターンにわたると実際には大幅に低下することを見出しました。これはかなり驚くべき発見でした。というのも、誰もそのように評価したことがなかったからです。…

ATALLA: そうです。 

NEVILLE: …そのような方法で以前には評価していなかったのです。しかし、その研究を世に発表したところ、システムのユーザーたちがみな共感してくれました。… 

ATALLA: ええ…そうですね。 

NEVILLE: …「まさに自分が経験したことです。そうなっていると分かっていました。それをどう直せばいいのでしょう?」と。そしてそのひとつとして…つまり、私たちは強化学習の手法に取り組んでいて、モデルがこうした環境でより良く学習できるようにし、この振る舞いを修正しようとしているのです。 

しかし論文で話した実用的な解決策は、複数のターンにわたって何かを指定した結果、モデルが混乱してしまった場合には、チャットをやめて、すべて消去して、戻って、そして今わかっていることを踏まえて、完全に指定された単一ターンの指示を与え直す、というものです。…

アタラ: なるほど、そうですよね。 

ネビル: …そのようなやり取りでは、その後より良い振る舞いをするようになります。 

ですから、これは、私たちは根本的にはモデルへのアルゴリズムの改善を求めているものの、こうしたプロジェクトでは時に、どのようにすればよいかに関する洞察に行き着くことがある、ということを示しているのかもしれません。 ユーザー 彼らの行動を変える可能性がある…… 

アタラ: はい、そうです。 

ネヴィル: …モデルからより良い結果を得るために、たとえば、今の段階において… 

ATALLA: ええ、まあ…… 

NEVILLE: …そのパフォーマンスとともに。 

ATALLA: ええ。そうですね、あなたの研究のテーマの一つは、こうしたシステムを改善して、ユーザーが実際に望んでいることにうまく適合させるにはどうすればいいか、ということだと述べられましたよね。そしてここで、「実のところ、ユーザーは最初のターンで自分の望みを十分に明示していないことが多く、こうした長い複数ターンのやり取りは実際にある」という事例に言及されました。この論文を発表された後、複数ターンの会話の中で迷子になってしまうというフラストレーションに共感する声が寄せられたのですね。 

ユーザーの要望やニーズ、そして体験を理解することについてどうお考えですか?それは、おっしゃったようにユーザーをシミュレートしてこうした長いマルチターン評価を実行するといった、あなたが行っていることとどのように関連しているのでしょうか?

ネヴィル: そうですね、それは……大規模にユーザーが何をしようとしているのか、そしてシステムの中でどのような失敗や成功を経験しているのかを直接見られるというのは、業界の研究所にいて、あのような大規模なデータを目にできる立場ならではの利点のひとつだと思います。 

マイクロソフト社内でプロダクトチームとともに、大規模なコンシューマーログを分析し、ユーザーが経験している主な障害パターンを把握する作業を数多く行ってきました。そしてそれが… 提供する 私たちが行っている多くの、多くの業務に対する洞察や動機づけとなるようなものです。また、ユーザーの成功を分析している優れた製品グループも数多くあり、それによって、ユーザーにどのような……今の私たちのシステムでユーザーがうまく遂行できるタスクはどのような種類のものか、を推奨することまで可能になります。 

検索エンジンが最初に登場した頃を思い返すと、人々は検索エンジンとのやり取りの仕方を学ばなければなりませんでした……

ATALLA: もちろんです。 

ネビル: … 彼らが求めている情報を効果的に得られるような形で。これらのAIシステムが登場する前は誰もが当たり前に行っていたことだったので、今ではその出来事を忘れてしまっているかもしれません。しかし今、検索エンジンからこうしたチャットベースのシステムへの移行が起きており、ユーザーの側にも何らかの学習が必要になると考えています、… 

アタラ: そうそう、その通り。 

ネビル: … この新しい環境において。そして、ユーザーが何をしているかという観点から成功している事柄を分析することは、推薦を始めるための素晴らしい方法だと思います… 

ATALLA: ええ。 

NEVILLE: … 同じように、ユーザーへのチュータリングや指導も行うということです。 

ATALLA: 実データを見ることの有用性を指摘してくださっている点は素晴らしいと思いますが、それは実際にはどういう意味なのでしょうか?本当に実データを見ているのですか?プライバシーはどう扱われているのでしょうか?実環境のデータを責任を持って活用するために、どのようなプロセスを設けているのでしょうか? 

NEVILLE: ああ、そうですね、それは良い指摘です。取り上げていただきありがとうございます。実は、私たちはデータそのものを見ているわけではありません。プライバシーを保護する形で、大規模にデータを分析し、失敗や成功のパターンを抽出しています。また、私たちが実際にデータを目で見ることはできないという、多くの制限もあります。私たちにできるのは、極めて制限された環境でデータを処理する手法を送り込むことだけです。そして、そのようにして得られたプライバシーが保護された高レベルのインサイトこそが、その後のアルゴリズム上の取り組みの原動力となるのです。 

念のため明確にしておくと、私たちはあなたのデータや応答を使ってファインチューニングを行っているわけではありません。しかし、情報の提供、低評価をつけた際の説明の記入、あるいはモデルとのチャートやり取りといった形で、応答に多くの詳細を含めていただければ、それらは最終的に、人があなたの行動を実際に見ることなく、モデルを改善するためのものへと蒸留されていくのです。

ATALLA: 検索が主流な手段だった時代から、こうしたマルチターンのチャット形式のやり取りへの移行についてお話しいただきました。しかし今、さらにエージェント型の、いわば協調的なナレッジワークスタイルのタスクがますます重要になってきていますね。そして、その分野でも取り組まれたとおっしゃっていました。リスナーの皆さんと共有したい、他に興味深い教訓はありますか? 

NEVILLE: はい。私たちは、トランスフォーマーがモデル内部で計算するのが本質的に困難なタスクのタイプを特徴づけようとする理論的な研究と、より シミュレーションに基づく研究の両方を行っています。後者では、長期間にわたるワークフローで実行される複雑なタスクを調べています。例えば、ドキュメントを取り上げ、そのドキュメントに対して繰り返し編集を行うようなタスクです。 

こうした環境において、モデルやエージェントにとってのタスクの複雑さは、このような長期にわたる作業活動の中でユーザーが何をしようとしているのかを追跡するだけでなく、現在の状態はどうなっているのか、どの情報が関連し、どの情報が関連しないのか、何がどう変化したのかを理解することにもあります。そうした点については、エージェントはかなり得意になりつつありますが、他よりも取り組みやすい特定の種類のタスクが存在します。

ATALLA: もちろんです。 

ネビル: 私たちが注目しているのは、どのような種類のタスクが現在のエージェントにとって複雑さが高すぎるのか、そしてそれをどう解決するかということです。エージェントによるツールの使い方の最善の方法は何でしょうか。人間をループに組み込む方が良いのでしょうか。物事がうまくいっていないことをどうやって知ることができるでしょうか。つまり、エージェント自身に、自分で自分を監視させ、答えが正しかったのか、あるいは以前の状態にロールバックすべきなのかを評価させることも含めて。これらはすべて、現時点では未解決の問いだと思います。 

しかし、私たちには……確かに、それを示す研究がいくつかあります 再び これらのワークフローが長くなるほど、驚くべき失敗が起こります。なぜなら、エラーは見逃すと蓄積していき得るからです…… 

ATALLA: ええ。 

ネビル: … そして、タスクを繰り返しのやり取りの中で遂行しなければならないため、AIをさらに混乱させることになります。 

ATALLA: ええ、その「意外な失敗」という表現は私にとって興味深いですね。そこには「これはもっとうまくできるはずなのに、こういう特定のやり方で失敗したのは意外だ」という期待が含まれているように思えます。この種の意外なエラーをより多く目にする感じですか、それともエラーの多くは、いわば想定内のもので、こういうふうに失敗したりああいうふうに失敗したりするのは理解できる、という感じでしょうか? 

ネビル: ええ、そこには、やはり想定される失敗というものが確実にあると思います。なぜならそれらは…… ええと、もちろんシステムをどんどん改善していくにつれて、予期される障害は少なくなっていきます。 

ATALLA: その通りです。予期できるなら、修正することもできます。 

ネビル: その通りです。しかし、ハルシネーションのような問題は、コミュニティで長い間特徴づけられてきた種類の失敗であり、それらを減らすための具体的なベンチマークや手法が存在します。 

私のチームは、ほとんど驚くべき形の失敗として現れるものを探すことになると思います。というのも、それは従来型の失敗ではなく、非常に微妙なために、実際に起きていることを切り分けて示すのが難しいことが多いからです。そうした失敗は、数学の問題への不正解や、法律上の意見——つまり法的意見——におけるハルシネーションのような形では現れず、むしろ文書内の意味的内容の微妙な欠落として現れるのです。そして、チームとともにこれまで調査してきたことを振り返ってみると、私たちには一種の仮説があります。それは、人間にとって難しいことはモデルにとっても難しいはずだ、というものです。しかし実際には、そうとは限りません。というのも、私たちはトランスフォーマーにとって実際に何が計算困難なのか、彼らの検索システムにとって何が検索困難なのかを考える必要があるからです……

ATALLA: そうです。 

ネヴィル: …根本となるコンテンツから。 

そこで、「意外」というのは、私たち人間が非常に簡単にできると考えていることに由来するのだと思います。 または 私たちは、以前に正しく行われたタスクがあれば、今同じタスクを再び確実に正しく行えるはずだと考えています。しかし実際には、LLMでは必ずしもそうとは限りません。ですから、何が難しくて何が簡単かについて、人間の知能に基づく私たち自身の期待を通じて、意外性がじわじわと忍び込んでくるのだと思います。 

ATALLA: ええ。では、ユーザーがこれらのシステムに何ができるかについて抱く期待——おそらく人間の知能を反映したものに基づく混乱と、世の中に溢れる誇大宣伝やマーケティングの間で、実際のユーザーに何を持ち帰ってほしいとお考えですか。あるいは、こちらの研究を踏まえて、AIシステムに対する能力や期待についてユーザーにどのように注意喚起したいですか。ユーザーはどうすればそのノイズを切り抜けて、より適切な期待を持つことができるでしょうか。 

NEVILLE: ああ、それはいい質問ですね。現在のAIシステムには、今の職場環境で人々にとって非常に役立つ能力がたくさんあると思います。私たちの研究から得られる教訓は、あらゆる場面で100%成功することを期待すべきではない、ということだと思います。返ってきた答えは必ず確認すべきです。そして、間違っていると思う答えが返ってきた場合でも、そのモデルにはまったくできないと決めつける必要はありません。もう一度聞いてみたり、別の聞き方をしてみると、次回はより良い答えが得られるかもしれません。 

それは今の私たちの働き方に取り入れるのが難しいことです。というのも、すべてを100%彼らに任せるのはまだ無理だからです。しかし、監督と検証を伴うワークフローの中でAIをどう活用するかを見つけられれば、作業の生産性や物事を成し遂げるスピードを向上させるなど、非常に役立てられると思います。

それから…もう一つ付け加えるなら、我々に少し付き合ってほしいということです。[笑] 私たちはこうしたシステムを リアルタイムで リリースされながら開発しているのですから。だからこそ、皆さんの利用は実際にモデルの限界を押し広げる助けになります。何ができて何ができないかの実例を与えてくれるからです。 

もう一つお伝えしたいのは、ユーザーの皆さんには理解されていないかもしれないことですが、過去の検索システムやレコメンダーシステムでは、ユーザーとして私たちが与えられるフィードバックは、いわば高評価・低評価のようなものでした。しかし今は、はるかに高い精度でフィードバックを与えられる環境にあり、それは下流のモデルの改善に非常に役立ちます。

ですから、もしあなたがモデルとチャット環境のような形でやり取りしているなら、何かがうまくいかなかったときには、それがどのようにうまくいかなかったかを伝えることが実際には役に立つということを理解してください。テキストでのやり取りでも音声でのやり取りでも、何が間違っていたのか、何を期待していたのか、代わりに何が得られたのかを正確に伝えるようにしてください。というのも、それらはモデルを更新する際に実際に活用されるからです。つまり、ユーザーであるあなたの役割は、モデルに、あなたが望んでいたけれど現時点ではできなかったことを実行できるよう訓練することだと考えることができます。

ATALLA: 素晴らしい。興味深い行動喚起ですね。 

それで、ちょっと気になったのですが。あなたは今、この種の大規模言語システムにおいて私たちがいるトランスフォーマーのパラダイムについて話されました。大規模AIシステムの科学は次にどこへ向かうとお考えですか? 概ねですが、 これはとても難しい質問かもしれませんが、少なくともあなたの興味や研究の方向性において、これらのシステムの科学は次にどこへ向かうとお考えですか? 

NEVILLE: それは、それは大きな質問ですね。 [笑い] 私たちは…研究コミュニティは、トランスフォーマーアーキテクチャが使用すべき適切な基盤モデルなのかどうかを同時に考えようとしていると思います。なぜなら、トランスフォーマーにおける計算の仕組みにはいくつかの既知の限界があるからです。それらの限界の多くは、モデルを囲むラッパー、つまり現在モデルの周りにあるエージェント的なハーネスや、バックエンドで行われる推論によって解決できます。 

ですから、開かれた問いは、トランスフォーマーアーキテクチャの限界に、このような周囲のラッパーでどの程度対処できるのか、そして何が根本的に異なる…

ATALLA: なるほど。 

NEVILLE: …アーキテクチャによって対処される必要があるのか、ということだと思います。私は、代替的なアーキテクチャやモデルの開発、そして現在のモデルを取り巻く精巧なラッパーの開発が急速に進むのを目にすることになると思います。 

次世代の研究では、モデルとのより長期的なやり取りに焦点を当てる必要があり、モデルが自分たちの活動している世界を、現在よりもはるかに具体的な形で理解できるようにしなければならないと思います。しかし、今行われている研究については非常に楽観的です。私たちはこれに成功するだろうと思います。

私が始めた頃の話に戻ると、私の最初のインターンシップは2000年にAT&T Labsででした。インターン中の昼食時に、AIモデルにこのゲームをプレイできるようにするにはどうすればいいか、チェスよりも難しいが何ができるだろうかと話し合いながら 囲碁を 「そして、どうすればAIモデルにこのゲームをプレイさせられるか、それがチェスより難しいこと、そして何ができるだろうかについて話し合っていました。」 

そして、私はその頃 囲碁の打ち方を習っている 最中でした。9×9の盤で学んでいたのです。あなたが 囲碁の打ち方を習ったことがあるかどうかはわかりませんが, … 

ATALLA: ありません。 

NEVILLE: …大きな盤で囲碁を習うことはしません… 

ATALLA: へえ。 

NEVILLE: …というのも、人間にとっても難しすぎるからです。だから9×9の盤から始めるのです。 

そして私は自分が打ち方を学んでいくのを見ながら、アルゴリズムがどうやって打ち方を学ぶのかを考えていました。そうしている間に、AIがこれができるようになるまでどれくらいかかるだろうかと推測していました。振り返るとおかしな話です。というのも、AT&T Labsには機械学習とAI研究のそうそうたる人物が集まっていました。みんな「これができるようになるには50年かかるだろう」と言っていました。100年と言う人もいました。しかしもちろん、今ではそれは すでに解決済みの問題です(新しいタブで開く). 

ATALLA: ええ。 

ネヴィル: 将来のことを考えると、研究者として考えてしまう点があります。現在の行動に見られるこうした境界を私たちが乗り越えるのがとても難しいので、「ああ、これには10年かかるだろう」「25年かかるだろう」と考えがちです。 

でも、研究のペースやこの分野で研究している人々の数、そしてこれらのモデルが動いている規模を考えれば、実際には2000年の、あのAIの新入生だった私が思っていたよりも、ずっと早く実現するだろうと思っています。それで……

アタラ: わあ。ではその精神で、2000年を振り返りつつ、20年先、あるいは物事が動くのがとても速いので、10年先に飛んでみることを想像してみましょう。 

ネヴィル: [笑] ええ。 

アタラ: この分野の研究に、どのような足跡を残したいとお考えですか? 

ネヴィル: 私の研究キャリアを通じての一貫した共通の糸と言えるのは、複雑系、そしてAIと機械学習をそれらの複雑系でどう機能させるかについて考えることです。今でさえ、私たちが協働に注力しているのはまさにそれで、多人数・多AIのインタラクションについて考えています。本当にSF的な帰結という観点で考えると、職場環境において、人間とAIの両方からなる組織がチームとして協力して物事を成し遂げ、イノベーションを起こす姿が見られ始めたら、それがうまく機能するようになれば、私の研究は成功だったと感じるでしょう。 

アタラ: 素晴らしい。さて、締めくくりとして、ライトニングラウンド、つまり即答の質問、気軽な低リスクの回答、頭に浮かんだことをそのまま答えるというのをやるのは楽しいと思ったのですが。いいですか? 

ネヴィル: もちろんです。 

アタラ: 素晴らしい。あなたが心に残り続けた、あるいは視点を変えたアドバイスを1つ教えてください。 

ネヴィル: ええと、わかりました。でも短い回答って言いましたよね。[笑] 

私がコンピュータサイエンスを始めた頃、ええと、実は、 Doina Precup(新しいタブで開く) は私の最初のコンピュータサイエンスの授業のTA(ティーチングアシスタント)でした。私が圧倒されて、自分だけが何も知らないのに他のみんなはすべて知っているような気がしていたとき、彼女は私にこう言いました。質問することを恐れないで。周りの人は何かを分かっているように見えても、実は何も分かっていないものよ。あなたが勇気を出して質問することを、むしろ本当に感謝するはずよ。だって彼らも同じことを考えているのだから、と。そして、あなたが、あなたが 質問を すれば、あなた自身にとっても彼らにとっても助けになるわ、と。 

それ以来、私はこの言葉をキャリアを通じて心に留めてきました。質問をすると愚かに見えるのではないかと恐れてしまうのは、とても難しいことです。しかし間違いなく、これまでの道のりで、そのような恐怖を感じながらもそれでも勇気を出して質問したときはいつも、人々が本当に感謝してくれることに気づきました。そして、後で人々は「ああ、私も同じことを考えていたの。あなたがその質問をしてくれて本当によかった」と言ってくれるのです。だから、勇気を出して質問してください。

アタラ: 素晴らしい。苦い経験から学んだ教訓は何ですか? 

ネヴィル: データを見ることです。[笑] データを見ること。 

機械学習では、私たちにはある傾向があります。これはベンチマークにも当てはまります。テストセットがあって、モデルを実行し、学習させ、そのテストセットに適用します。そして一般に、私たちが押し上げようとしている指標となる数字が得られます。だから、数字が上がっていれば良い成果を出していると考えます。数字が動かなければ、「ああ、ではこの問題は難しすぎるのだ」と考えてしまうのです。

しかし、うまくいかないときに時間をかけてデータを見れば、データに誤りがあることに実際に気づくかもしれない、ということを私は何度も苦い経験から学びました。データが期待していたものと違う。モデルを学習させた分布とデータが異なる。というわけで、いつも……それは私が「データの人間」だということかもしれませんね。[笑] しかし、物事が期待どおりに動かないときは、多くの場合、データを見に行って理解しようとするのです。

アタラ: ええ、もっともです。いい教訓ですね。簡単ではない教訓ですが。 

ネヴィル: [笑] 忘れやすいものですが。 

アタラ: そうですね。 

ネヴィル: そしてそれが……もしかしたらそれが重要な点かもしれません。この教訓を学んだにもかかわらず、…… 

アタラ: ええ。 

ネヴィル: ……この教訓を、私のキャリアの中で少なくとも6回は 学び直し なければなりませんでしたから。 

アタラ: なるほど。では逆の質問ですが、最も誇りに思っている業績は何ですか? 

ネヴィル: テニュア(終身在職権)を取得すると同時に、幼児を育てることができたことだと思います。 

アタラ: すごいですね。 

NEVILLE: 息子が生まれたのは、私たちがキャリアを始める直前でした。夫も教員なので、二人が教員の職に就く前のことです。だからこそ、私がテニュアを取得できて、息子が健康で元気に育って、しかも結婚生活も続けられたというのは [笑] … 

ATALLA: ええ、本当に。 

NEVILLE: … おそらく最大の成果だと思うんです、ええ … 

ATALLA: 大きな成果ですね。それでは最後の質問です。アートや自然があなたの仕事に影響を与えた例を一つ挙げるとしたら、何でしょうか? 

NEVILLE: うーん、これが本当に「自然」と言えるかは分かりませんが、AI研究者としていつも観察しているのは、子どもや人、動物、昆虫がどのように世界や環境について学び、行動を変えていくかということです。正直に白状すると、私は幼い子を持つ親として、かなりオタク気味でした。機械学習から得た考え方を取り上げて、それで息子がもっと上手に学べるよう手助けできるか試してみたりしていました。 

例えば、赤ちゃんの頃に寝返りを打とうとしていたときは、「よし、ポジティブな訓練例をあげよう [笑] ほら、脚をこう動かしてみて」と言って …

ATALLA: ええ、ええ。 

NEVILLE: … それが彼の学びにどう影響するかを見て、さらに彼が学んでいく様子を観察しながら、それが私たちが開発するアルゴリズムやモデルにどう組み込めるかを考えていました。私のキャリアを通じて、繰り返し立ち返ってきた最大のやり取りは、おそらくそれです。 

ATALLA: 素敵な話ですね。ええ。 

NEVILLE: ありがとうございます。 

ATALLA: それでは、ジェンさん、あなたの経験と洞察をシェアしていただきありがとうございました。お越しいただき光栄です。 

そして視聴者の皆さん、ご視聴ありがとうございました。マイクロソフトの同僚たちの研究についてもっと知りたい方は、Microsoft Researchのページを aka.ms/research でご覧いただくか、[音楽] このポッドキャストの他のエピソードもぜひチェックしてください。ありがとうございました。 

[音楽終了]


詳しくはこちら:

この投稿 AIが誤ること、そして失敗が私たちに教えてくれること 最初に掲載されたのは Microsoft Research.

原文の出典

Microsoft Research

内容について

原文の公開と権利は出典元に帰属します。

機械翻訳 · 原文をご参照ください