1回目は「AIの仕組みと構造」について、簡単に触れます。
タイトルが便宜上難しそうな感じになってしまいましたが、そんなに難しいことは書いていないので気軽に読んでください🎉

業務ツールもチャットも根っこは一緒!「UI」と「頭脳」の仕組み

難しそうなAIシステムも特別な魔法ではない

エンジニアが使う開発支援ツールや、会計ソフトなどで採用されている「領収書をスキャンして自動で文字起こしする機能」などは一見とても高度に見えます。
ですが、根っこで動いているのはChatGPTやGeminiと同じ「LLM(大規模言語モデル)」や、画像も読み取れる「LMM(大規模マルチモーダルモデル)」と呼ばれるAIの頭脳です。

「チャット画面(UI)」は単なる入力フォーム

私たちが普段見ているChatGPTやGeminiのチャット画面は、人間が使いやすいように作られた見た目(UI:ユーザーインターフェース)に過ぎません。
裏側では「画面から入力されたデータ」をAPI経由で「AI(頭脳)」に送り、返ってきた結果を画面に表示しているだけです。

扱っているデータと指示が違うだけ

どのツールも「材料(入力)を渡して、裏のAI頭脳に指示を出し、欲しい結果(出力)を出してもらう」という基本構造はまったく同じです。

  • プログラミング支援
    • 入力:「コード」
    • 指示:「コードを直して」
      • 出力:「修正コード」
  • 領収書処理
    • 入力:「画像」
    • 指示:「画像から文字を起こして」
      • 出力:「金額・日付のデータ」
  • AIチャットボット
    • 入力:「質問」
    • 指示:「質問に回答して」
      • 出力:「回答文」

【前提補足】今回の勉強会で主に扱うのは
「汎用AI(LLM/LMM)」!専用AIとの違い

  • 今回扱うテーマ
    この連載では、人間がプロンプト(指示・対話)を与えることで柔軟に回答してくれる汎用的なAIモデルについて扱います。
  • 専用タイプのAI
    画像認識、自動運転、工場の検品AIなど。
    これらはあらかじめ決められた特定のタスクだけを実行する「専用AI」であり、チャットで指示を出して操作するタイプではないため、今回は切り離して考えてOKです。

あとがき

今回はいったんここまで。
いかがだったでしょうか?

Geminiなどの裏側がすこしでもイメージできれば幸いです。

次回予告

次回は、AIへ与える指示のコツ(プロンプト)について触れます!