AIを活用して研究を進めた場合、(本来はAIの提案を人が理解した上で、最終的な内容については人が責任を持つべきですが)AIの出力を理解せずに発表や提出してしまう危険性があります。また、チームでの取り組みでは、研究内容/発表内容についての理解度が、メンバー間でそろわず、ばらばらになりがちです。
理解せずにAIの出力を使ってしまうことが学習に及ぼす悪影響については、このスライドのpp. 4-7, pp. 16-18で紹介している研究を参照して下さい。
理解度の確認のためには、口頭試問や、AIなどを使わない制限の下での筆記試験が行われますが、これらは大変手間がかかる方法であり、理解度確認の自動化に向けての研究(最近の代表的なものとして、研究1,研究2)が行われています。
生成AIを活用すると、上記の研究1, 研究2で提案された理解度の自動評価システムを近似的に再現できる(下記の使い方参照)ので、ぜひこの模擬評価システムを使って、自分のレポートや論文に対する自分の理解度を確認し、理解の足らないところが見つかったら、そこの理解を深めておくことをぜひ実行して下さい。この方法は、普段の様々なレポートや論文提出の際に、自分の理解度を確認しておくことに使えるので、ぜひ活用してレポート課題や研究課題についての理解を深めて下さい。(課題を提出することではなく)理解を深めることが勉強の本来の目的ですので。
理解度確認の自動化に向けての研究(研究1,研究2)では、レポートや論文がAIで書かれたものかどうかの識別ではなく、著者が提出物を理解しているかどうかを自動評価することを目指しています。現状で、それなりの正しい評価ができる印象ですが、論文にも書かれているように、成績評価や論文の採否決定、採用などの人事評価を自動でできることを保証する段階には至っていません。自動評価の結果は、授業の改善や個別指導のための参考資料としてお役立て下さい。
関連ファイル一式が入ったフォルダの圧縮ファイル ← 今後も加筆修正すると思いますので、最新版は、都度、ダウンロードして下さい。
①↑ 上記のリンクをクリックして現れた画面左上部のダウンロードアイコンをクリック(または、上部メニューの「ファイル」をクリック → ②ドロップダウンメニューから「ダウンロード」をクリック) → ③ダウンロードした圧縮ファイルassessment.zipを解凍 → ④解凍したフォルダassessmentをPCの適切な場所(C:の直下など、できるだけ浅い階層が望ましい)に置く
公式クイックスタートに沿ってChatGPTデスクトップアプリをインストール(インストール済みの人は何もせず手順3へ)
アプリを開き、自分のChatGPTアカウントでサインイン
左上のメニュー(`ChatGPT`/`Codex` の切り替え)から`Codex`を選択
Codex の権限の設定(初めて使う人は必ず下記の通り設定して下さい;すでに使っている人は特に設定を変える必要はありません)
画面上部メニューから「編集」をクリック(または、画面左下隅のプロフィールアイコンをクリック)→ドロップダウンメニューから「設定」をクリック→「一般」の「権限」に2つのトグルスイッチがあります。慣れるまでは、「デフォルト権限」だけ ON、「フルアクセス」は OFF、と設定しておくのが安全です。
「設定」をクリック→「構成」をクリック→「エージェントのデフォルト」中の「承認ポリシー」と「サンドボックス設定」を選択。慣れるまでは、「承認ポリシー」は「リクエスト時」、「サンドボックス設定」は「読み取り専用」が適切だと思います。少し慣れてきたら「サンドボックス設定」を「ワークスペース内での書き込み」にするとよいでしょう。
左カラムメニューの`プロジェクト`にマウスオンして、現れた`+`をクリックし、新規プロジェクトを作成
プロジェクト名を適宜入力(例:理解度自動評価)
ソースフォルダとして、手順1で解凍して得た`assessment`を追加(ソースフォルダ内のファイルをCodexに読み書きさせます)
`プロジェクトを作成`をクリック
左側カラムのメニューから`新しいチャット`をクリック
対話窓の左上部の`プロジェクトを選択`をクリックして、先ほど作成したプロジェクトを選択(左上部に別のプロジェクト名が表示されているときは、それをクリックして、先ほど作成したプロジェクトを選択し直す;初めから所望のプロジェクト名が表示されている場合は、何もせずに次に進む)
自動評価の開始を依頼するプロンプトを入力する。プロンプトの例など、使い方については、 README_FOR_STUDENTS.md(または、README_FOR_EDUCATORS.md)を参照して下さい。
↑ Markdownファイル(.md)は、Windowsの「メモ帳」やMacの「テキストエディット」などの標準アプリで開くことができます。見出し、箇条書き、表などをきれいに見たい場合は、Visual Studio Code で開いてプレビューボタンを押すか、ブラウザにMarkdownを表示する拡張機能を入れて開くのが便利です。Markdown形式のファイルを使っている理由は、AIにも人にも分かりやすい形式だからです。特に無料の範囲でAIを使う場合、docx形式などを使用する場合と比べて必要なトークン数を抑えることができ、結果として無料でできることが増えます。
AI_Vivaフォルダ中のAGENTS.mdは、Codexへのカスタム指示(AI_Viva方式の理解度評価でAIがどのように振舞うべきかを指示したもの)です。一度内容を確認しておいて下さい。greCAPTCHAフォルダ中のAGENTS.mdはgreCAPTCHA方式用のカスタム指示です。こちらも一度内容を確認しておいて下さい。
referenceフォルダには、研究1,研究2の2つの論文が入っています。これらの論文に記載された内容に即して、AGENTS.mdを作成するようGPT-6 Astraに頼みました。これらの論文の内容を手早く把握したいときは、AIに論文の要約を頼んだり、質問したりすると便利です。
上記のCodex版評価システム用のソースファルダ内のAGENTS.mdやREADME.mdは以下のプロンプトによりGPT-6 Astraに作らせました。以下を参考に、必要に応じてAGENTS.mdやREADME.mdを変更してお使い下さい。
referenceフォルダー中の2つの論文で提案されている2つのアセスメントシステムを、Codexにおける対話でできるだけ再現できるように、AGENTS.mdを作成し、それぞれ、AI_VivaフォルダとgreCAPTCHAフォルダに置いて下さい。
greCAPTCHAについては、論文の付録A: Question Generation Promptsに、使用されたプロンプトが記載されているので、参考になると思います。
また、greCAPTCHAについては、研究のプロトタイプ実装のコードがGitHubで公開されている(https://github.com/justinpayan/greCAPTCHA)ので、それも参考にできると思います。
# 背景
referenceフォルダー中の2つの論文で提案されている2つの理解度自動評価トシステムを、Codexにおける対話でできるだけ再現できるように、AGENTS.mdを作成し、それぞれ、AI_VivaフォルダとgreCAPTCHAフォルダに置いてあります。
greCAPTCHAについては、論文の付録A: Question Generation Promptsに、使用されたプロンプトが記載されているので、参考にしました。
また、greCAPTCHAについては、研究のプロトタイプ実装のコードがGitHubで公開されている(https://github.com/justinpayan/greCAPTCHA)ので、それも参考にしました。
# タスク
これら2つのAGENTS.mdを吟味し、想定される欠点を挙げ、より適切な評価対話ができるように、AGENTS.mdの改良案を提示して下さい。
1. 「論文のプロトタイプを忠実に模倣するモード」は不要です。「論文の知見を踏まえて改善した推奨モード」で動作するようにして下さい。
2. 教員が成績評価用途や、AIの不適切利用の判定用途で使うのは危険だと思うので、「学生が自分の理解度を確認する目的で使うための対話」に用途を限定するのがよいと思いますが、どうでしょうか?。
3. 学生が以上の用途で対話するに際しての、注意事項をまとめて下さい。これはREADMEまたは何か適切なファイルを作成して下さい。README_FOR_STUDENTS.mdがよいでしょうか?
4. この用途で学生が対話した内容を、教員が、指導や教育内容を改善する目的等で参照することはできると思うので、その場合の注意事項を別途作成し、適切なファイルとして保存して下さい。
5.学生は、自分のレポートや論文を2種類のうち、どちらの評価対話で試してみるとよい、あるいは、両方試すべきか、の判断基準はありますか?
作成したスライドの理解度を評価する、という例で、Codexの応答を試してみました。気づいた点は以下の通りです。
- 出題時に、ヒントして、参照の目安:5~6枚目 のように表示されたのですが、このヒントは、素早く解答するためには役立ちますが、ない方が、スライドの構成を含めて理解できているかが評価できてよいかもしれません。しかし、この問で確認したい理解が、スライド構成ではないとしたら、これはヒントに含めた方が純粋に確認したい理解が確認できてよいのかもしれません。どうでしょうか?
- 最後の振り返りで、次のような出力がありました。「理解の目安は、第1・3問が「基礎」、第2・4問が「十分」です。」この「基礎」とか「十分」というのは学生にとっては、何のことか分からないと思います。どうでしょうか?