評価ジェネレーター:授業教材からクイズ、ルーブリック、診断テストを作成
評価ジェネレーターは、ノート、スライド、講義録音から診断テスト、形成的評価、クイズ、採点ルーブリックを直接生成します。その仕組みと、学習成果を実際に向上させるレビューループの構築方法をご紹介します。
評価ジェネレーターとは何か、クイズメーカーとどう違うのか
評価ジェネレーターは、クラスの教材(ノート、スライド、PDF、教科書の章、または講義録音)を読み込み、クラスが実際に必要とする確認テストの全範囲を生成するツールです。単元開始前の短い診断テスト、単元の途中の形成的クイズ、最後の総括的テスト、そしてオープンエンドの問題採点用のルーブリックです。一方、クイズメーカーやテストジェネレーターは、1つの出力形式を中心に構築されています。この狭いスコープは、必要なものが既に明確にわかっている場合には便利ですが、評価タイプが変わるたびにツールを切り替える必要があります。
この違いが重要な理由は、単一の授業や単元がめったに1種類のチェックだけを必要としないからです。新しいトピックを紹介する教師は、学生が既に何を知っているかを確認するために、短い診断テストが必要です。単元を通じて、短い形成的クイズは、現在のペースが機能しているかどうかを示します。最後に、総括的テストは、教えられた内容の全範囲に対する習熟度を測定します。複数選択肢以上のもの(エッセイ、プロジェクト、実験レポート)には、ルーブリックが何が「良い」かを定義します。採点の途中ではなく、採点を開始する前のことです。評価ジェネレーターは、各タスクを個別に処理するのではなく、同じソース資料からこれらの形式の間を移動するために構築されています。
基盤となるプロセスは、他のAI質問生成ツールと同様です。評価ジェネレーターはソースコンテンツを解析し、重要な概念、定義、関係を特定し、各概念を難度と質問タイプで分類します。異なる点は出力ステージです。固定形式を1つ組み立てるのではなく、ジェネレーターは概念をリクエストした評価タイプにマップします(5問の診断テスト、10問の形成的クイズ、完全な総括的テスト、またはパフォーマンスレベルの記述子を持つルーブリック)。科目固有の練習問題形式については、真偽問題生成ツールと空所補充問題生成ツールに関するガイドを参照してください。これらは評価ジェネレーターが生成できる特定の質問タイプのうち2つをカバーしています。
評価ジェネレーターは単一形式のツールではありません。同じソース資料を必要な確認テスト(診断テスト、形成的クイズ、総括的テスト、またはルーブリック)にマップします。
- 1
ソースのパース
ジェネレーターがノート、スライド、PDF、または講義トランスクリプトを読み取り、テストする価値のある概念、定義、関係を抽出します。
- 2
難度とタイプの分類
各概念は認知レベル(想起、理解、応用)でタグ付けされ、どの評価形式が最も適しているかを決定します。
- 3
形式マッピング
同じ分類された概念は、リクエストに応じて診断テスト、形成的クイズ、総括的テスト、またはルーブリックにマップされます。ソース資料を再処理する必要はありません。
評価ジェネレーターはどのような種類の評価を構築できるか
ほとんどのクラスルームは単元全体で4つの異なるタイプのチェックが必要であり、評価ジェネレーターは同じインポートされた資料からこれら4つをすべて生成するために構築されています。
診断的評価は指導が始まる前に実行されます。それは短い(5から10問)であり、その目的は学生を採点することではなく、学生が既に知っていること、そしてどこに欠落があるかを明らかにし、単元の教導を開始する前にペースや強調を調整できるようにすることです。形成的評価は指導中に実行されます。短い出口チケットクイズ、中単元チェック、または実時間で現在の説明が効果的かどうかを示す暖かい質問セットです。総括的評価は単元またはコースの終わりに実行され、ほとんどの人が「テスト」を意味しています。教えられた内容の全範囲をカバーしている包括的なセット、採点に使用されます。ルーブリックは他の3つとは異なります。質問を生成する代わりに、評価ジェネレーターはスコアリング構造(基準、パフォーマンスレベル、記述子)を構築します。これはエッセイ、プレゼンテーション、実験レポートなどの学生のオープンエンドの仕事を評価するために使用されます。
これらの出力のそれぞれは同じソース資料から引き出すことができます。なぜなら、基本的な概念は変わりません。形式と重要性だけが変わります。トピックの診断テストと同じトピックの総括的テストは同じ概念プールを共有でき、診断テストはより簡単で単一概念の質問を使用し、総括的テストは応用と多段階の推論を層状にします。単一の質問形式を大規模に必要とする場合、混合された評価ではなく、上記の練習テストジェネレーターに関するガイドと2つの質問タイプガイドはこれらのより狭いユースケースについてより詳しく説明しています。
クラスルームの使用ではなく自学用の場合、同じ4タイプの構造がまだ適用されます。診断テストは、開始する前に何をレビューするかを示し、学習セッションの途中の形成的チェックは、それが機能しているかどうかを示し、総括的な練習テストは実際の試験に対して準備ができているかどうかを示します。
同じ概念プールは診断テスト、形成的確認、総括的テストを生成できます。難度と重要性だけが変わります。評価ジェネレーターは、1つのインポートされたソースをこれら3つすべてで再利用できます。
- 1
診断テスト
事前の知識と欠落をどうやって計画するかを明らかにするために、指導前に実行される短い低リスク確認テスト。採点するためではなく、計画するために使用されます。
- 2
形成的確認
指導中に実行される簡潔なクイズまたは出口チケット。理解が教導の速度と一致していることを確認します。
- 3
総括的テスト
単元またはコースの終わりに実施される包括的な評価。教材の全範囲をカバーし、採点に使用されます。
- 4
ルーブリック
基準とパフォーマンスレベルを備えたスコアリング構造。エッセイ、プロジェクト、プレゼンテーションなどのオープンエンドの仕事を一貫して採点するために使用されます。
評価ジェネレーターはルーブリックの採点をどのように構築するのか
ルーブリックは質問ベースの評価とは異なる問題を解決します。複数選択肢テストは項目あたり1つの正解があります。エッセイ、実験レポート、またはプロジェクトは多くの可能な受け入れ可能な答えを持ち、30人のクラスにまたがる採点の一貫性、または採点されていない論文のスタックは、事後ではなく事前に定義された基準を持つことに依存します。
評価ジェネレーターは、最初にソース資料に組み込まれた学習目標(割り当てが実際に測定することを意味する技能または概念、トピックラベルではなく)を特定することにより、ルーブリックを構築します。その後、小さな基準セット(通常3~5個)を定義し、それぞれが仕事の1つの次元をカバーします。例えば、エッセイ割り当ての場合、議論の明確性、証拠の使用、組織化、および機械性です。各基準について、ジェネレーターはパフォーマンスレベルの記述子を書きます。通常は4レベル。曖昧なラベル(「良い」または「要改善」)ではなく、具体的で観察可能な用語で、トップスコアリング応答を発展途上国のレスポンスと区別するものを説明します。
ルーブリックのウィキペディアのエントリ)は、同じ構造(基準とパフォーマンスレベル)を、教育研究で使用される標準形式として説明しています。これは、ルーブリックベースの採点を採点者間で再現可能にし、1つの割り当てから次の割り当てまで一貫性があるため、ルーブリックベースの採点を再現可能にするものです。
生成されたルーブリックは最終文書ではなく出発点です。実際の割り当てプロンプトに対して確認し、生成された質問またはルーブリックの基準を確認し、必要な調整を加え、ジェネレーターが見逃したトピックのアイテムを追加します。採点後ではなく、学生に割り当てを開始する前にルーブリックを学生と共有することが、採点ツールから教導ツールに変わる理由です。学生は、あなたが何を探しているのかを推測する代わりに、見ることができる基準に向かって書きます。
割り当ての学習目標から生成されたルーブリックは、採点基準を学生の仕事を読んだ後ではなく、前に定義するものに変えます。
学習を実際に改善する評価レビューループをどのように実行するか
評価ジェネレーターは個別のチェックを生成しますが、学習を前進させるワークフローは、これらのチェックが形成するループです。診断、教導、確認、調整、再テスト。評価ジェネレーターを使用して1つのクイズを分離して生成することは、スナップショットを取得します。単元全体のループとして実行すると、評価は単にそれを測定するだけではなく、より良い成果を駆動するものに変わります。
ループは単元前の診断から始まります。結果は、どの概念がより多くの時間を必要とし、どのクラスが既に理解しているかを示します。すべてのトピックを同じ深さで教導するのではなく、学生が既に知っていることに関係なく、レッスン計画を調整してください。途中で、形成的なチェックは、調整されたペースが機能しているかどうかを確認します。クラスの大部分が同じ質問を見落とした場合、それは先に進む前に、その特定の概念を再教導するためのシグナルです。採点を記録するのではなく。単元の終わりに、総括的テストは全体の範囲に対する習熟度を測定し、その結果は次の単元の診断に直接供給されます。持続的なギャップのあるトピックは、新しい資料が上に構築される前に、レビューに折り込まれます。
このループは、教育研究者が形成的評価と呼ぶものを反映しています。最後だけではなく実時間で教導を調整するために評価データを使用します。形成的評価のウィキペディアの要約は、実質的な研究体を説明しています。最も顕著なのはBlackとWiliamのレビューであり、頻繁な低リスクチェックとフィードバックループを使用するクラスルームは、単元終了テストのみに依存する者よりも測定可能に良い成果を見ることを示しています。
このループを実行するための実用的な要件は、各チェックを生成することが、実際の教導時間と競合しない速度である必要があります。診断を構築することが、レッスン自体を書くのと同じくらい時間がかかる場合、ループは通常のワークロード下で1週間か2週間後に分解されます。これは評価ジェネレーターが各チェックを手で構築するよりも持つ主な利点です。診断、形成的クイズ、および総括的テストはすべて同じインポートされた資料から引き出されるため、ループの各新しいチェックは完全な計画セッションではなく数分かかります。
Black and Wiliam's の形成的評価に関する研究は、頻繁な低リスク確認とフィードバックループを使用するクラスルームが、単元終了テストのみに依存するものよりも大幅に良い成果を見たことを発見しました。
- 1
単元前に診断する
短い診断評価を実行し、教導が始まる前に、学生が既に何を知っているか、そしてどこにギャップがあるかを確認します。
- 2
レッスンプランを調整する
診断結果を使用して、実際に弱い領域でより多くの時間を費やし、学生が既に理解している資料をより速く移動します。
- 3
単元を通じて理解度を確認する
単元の途中で簡潔な形成的評価を実行します。クラス全体での共有の間違った答えは、即座に再教導するための概念を示唆しています。
- 4
テストと習熟度の測定
単元の終わりに総括的評価を実行し、教えられた内容の全範囲をカバーします。
- 5
次の診断にギャップを引き継ぐ
持続的なエラーのあるトピックを次の単元の診断に折り込み、新しい資料が上に構築される前に強化されるようにします。
Notelynの評価ジェネレーターはどのように機能するのか
Notelynの評価ジェネレーターは、ワークスペースにインポートするものから機能します。入力したノート、PDF章、スライドデッキ、講義オーディオまたはビデオ、または手書き資料の画像です。インポートステップはプラットフォーム全体で共有されるため、AI要約とフラッシュカードを生成するのと同じソースは、評価ジェネレーターが引き出すものでもあります。評価タイプごとの個別のアップロードステップはありません。
マテリアルをインポートした後、そのソースから診断テスト、形成的クイズ、完全な総括的テスト、またはルーブリックを直接生成できます。質問形式には複数選択肢、真偽問題、短い答え、および空所補充が含まれます。生成前にミックスと長さを調整できるので、5問のウォームアップと40問の最終試験の両方が同じ基本的な概念プールから得られます。ルーブリックの場合、ジェネレーターは資料に組み込まれた目標に結びついた基準とパフォーマンスレベルの記述子を生成します。これは学生と共有する前に編集できます。
生成されたすべての評価には、各項目の短い説明が含まれた解答キーが含まれており、ソース コンテンツに結びついています。結果をレビューすると、個別の学習ステップではなく、ターゲット化された再読みとして二重に機能します。学生または自分が評価をクイズモードで完了した後、トピックレベルの結果分解は、エラーがどこにクラスタ化されたかを示します。これは、レビューループの次の診断が必要とするまさにその入力です。
Notelynはすべてのもの(ノート、要約、フラッシュカード、および生成したすべての評価)を1つのワークスペースに保持しているため、前のガイドから診断-教導-確認-再テストループを実行するには、毎回資料を再度アップロードする必要はありません。一度インポートし、ユニットの次のステージが必要とするあらゆる評価タイプを生成します。
Notelynの評価ジェネレーターは、すべての形式(診断テスト、形成的、総括的、ルーブリック)にわたって同じインポートされたノート、PDF、および記録から引き出されるため、何もアップロードする必要はありません。
- 1
クラスマテリアルをインポートする
ノート、PDF、スライド、講義記録、または画像をアップロードします。Notelynはすべての形式を処理し、基本的な概念を自動的に抽出します。
- 2
評価タイプを選択する
診断テスト、形成的クイズ、総括的テスト、またはルーブリックを選択します。Notelynは、どの形式を選択するかに関係なく、同じインポートされた概念から引き出します。
- 3
長さと質問ミックスを設定する
質問の数と形式のミックス(複数選択肢、真偽問題、短い答え、空所補充)を調整して、評価の目的に合わせます。
- 4
共有する前に確認して編集する
生成された質問またはルーブリック基準を確認し、調整が必要な場合は何でも編集し、ジェネレーターが見逃したトピックのアイテムを追加します。
- 5
結果を使用して次のチェックを計画する
評価が完了した後、トピックレベルの分解を確認し、ループの次の評価が焦点を当てるべき内容を決定するために使用します。
評価ジェネレーターの使用を開始する
評価ジェネレーターは、単一のクイズを生成するためのツールと考えるのをやめ、単元が実際に必要とするフルの評価サイクルを実行するのを開始するときに最も有用です。教導する前の診断テスト、途中の形成的確認、最後の総括的テスト、そして複数選択肢ではないすべてのルーブリック。これらのそれぞれは異なる目的を持ち、4つの別々のタスクではなく1つの接続されたループとして扱うことが、評価を単にそれを測定するだけでなく、その瞬間に教導を改善するものに変わる理由です。
評価ジェネレーターを使用したことがない場合は、小さく始めます。単一の今後の単元のマテリアルをインポートし、診断テストだけを生成します。それが明らかにしたものを使用して最初のレッスンを調整し、次に単元を通じて形成的なチェックを生成し、最後に達したときに総括的テストを生成します。完全なループを一度実行したことがあり、その後の各単元は、パターンが確立されているため、より速くなります。
自学用では、同じ構造が小さいスケールで適用されます。トピックのレビューを開始する前の短い診断テスト、学習セッション途中の短い形成的チェック、そして試験前の完全な練習テストです。Notelynの評価ジェネレーターは同じインポートされたコンテンツからクラスルームと自学用ワークフローをサポートしているため、ループは30人のクラスを教導しているか、自分の最終試験に向けて準備しているかに関係なく機能します。
評価ジェネレーターを単一のツールではなく、ループとして扱う:診断、教導、確認、テスト、そしてギャップを次の単元に持ち込みます。