評估生成器:將課堂資料轉換為測驗、評分標準和診斷評估
評估生成器能從您的筆記、投影片和講座錄音中直接生成診斷評估、形成性檢查、測驗和評分標準。了解它的運作方式,以及如何建立真正改善學習成效的檢討循環。
什麼是評估生成器,它與測驗製造器有何不同?
評估生成器是一種工具,可讀取您的課堂資料——筆記、投影片、PDF、教科書章節或講座錄音——並生成課堂實際需要的所有檢查類型:單元開始前的簡短診斷、單元進行中的形成性測驗、結尾的總結性測驗,以及用於評分開放式作業的評分標準。相比之下,測驗製造器或測驗生成器是圍繞一種輸出格式構建的。當您已經準確知道需要什麼時,這種較窄的範圍很有用,但這意味著每次評估類型改變時都要切換工具。
這種區分之所以重要,是因為單一課程或單元很少只需要一種檢查類型。介紹新主題的教師希望進行快速診斷,以瞭解學生已經掌握的內容。在單元進行中,簡短的形成性測驗可告訴您目前的進度是否有效。在結尾,總結性測驗衡量學生對所有教授內容的掌握程度。對於多選題以外的任何內容——論文、項目、實驗報告——評分標準在學生開始前定義「優秀」的樣子,而不是在您已經閱讀到一半的評分時才定義。評估生成器的設計是從相同的源材料在這些格式之間移動,而不是將每種格式視為單獨任務。
基本過程與任何 AI 問題生成工具類似:評估生成器解析您的源內容,識別關鍵概念、定義和關係,並按難度和問題類型對每一個進行分類。不同之處在於輸出階段。生成器不是組合一個固定格式,而是將概念映射到您請求的任何評估類型——五問診斷、十問形成性測驗、完整總結性測驗或帶有表現水平描述符的評分標準。對於特定學科的實踐問題格式,請參閱我們關於真假題生成器和填空題生成器的指南,這些指南涵蓋評估生成器可以生成的兩種特定問題類型。
評估生成器不是單一格式工具。它將相同的源材料映射到您接下來需要的任何檢查——診斷評估、形成性測驗、總結性測驗或評分標準。
- 1
源解析
生成器讀取您的筆記、投影片、PDF或講座文字稿,並提取值得測試的概念、定義和關係。
- 2
難度和類型分類
每個概念按認知水平——回憶、理解或應用——進行標記,這決定了哪種評估格式最適合它。
- 3
格式映射
根據您的請求,相同的分類概念被映射到診斷評估、形成性測驗、總結性測驗或評分標準,無需重新處理源材料。
評估生成器可以構建哪些類型的評估?
大多數課堂在一個單元中需要四種不同類型的檢查,評估生成器的設計是從相同的導入資料生成這四種檢查的。
診斷性評估在教學開始前進行。它很短——五到十個問題——其目的不是評分學生,而是揭示他們已經知道的內容和知識缺陷在哪裡,以便您可以在教授單元前調整進度或重點。形成性評估在教學期間進行:快速出口票測驗、單元中期檢查或熱身問題集,可以即時告訴您當前的解釋是否有效。總結性評估在單元或課程結束時進行,是大多數人所說的「測試」——涵蓋所有教授內容範圍的綜合集合,用於評分。評分標準在本質上不同於其他三種:評估生成器不是生成問題,而是構建評分結構——標準、表現水平和描述符——用於評估開放式學生作業,如論文、演示或實驗報告。
這些輸出中的每一個都可以從相同的源材料中提取,因為基礎概念不變——只有格式和利害關係不同。關於某主題的診斷評估和同一主題的總結性測驗可以共享相同的概念池,診斷使用更容易的單概念問題,而總結性測驗則加入應用和多步推理。如果您特別需要大規模的單一問題格式,而不是混合評估,我們關於練習測驗生成器的指南和上面的兩個問題類型指南以更深入的方式涵蓋這些更窄的用例。
對於自習而非課堂使用,相同的四類型結構仍然適用:診斷評估告訴您在開始前要複習什麼,在自習課程進行中途的形成性檢查告訴您它是否有效,總結性練習測驗告訴您您是否準備好參加實際考試。
相同的概念池可以生成診斷評估、形成性檢查和總結性測驗——只有難度和利害關係改變。評估生成器讓您可以在所有三個中重複使用一個導入的源。
- 1
診斷評估
在教學前進行的簡短低風險檢查,以表明先驗知識和缺陷。用於規劃,而非評分。
- 2
形成性檢查
在教學期間進行的簡短測驗或出口票,以確認理解能力與教學進度保持一致。
- 3
總結性測驗
在單元或課程結束時進行的綜合評估,涵蓋資料的完整範圍,用於評分。
- 4
評分標準
包含標準和表現水平的評分結構,用於一致地評分開放式作業,如論文、項目或演示。
評估生成器如何構建用於評分的評分標準?
評分標準解決的問題與基於問題的評估不同。多選測驗每項有一個正確答案;但論文、實驗報告或項目有許多可能可接受的答案,而跨一個有三十名學生的班級或一堆未評分論文的評分一致性取決於事先定義標準,而不是事後應用。
評估生成器通過首先識別源材料中嵌入的學習目標來構建評分標準——作業實際旨在衡量的技能或概念,而不只是主題標籤。然後它定義一小組標準,通常三到五個,每個涵蓋工作的一個維度:例如,論文作業的論點清晰度、證據使用、組織和機制。對於每個標準,生成器編寫表現水平描述符,通常四個水平,用具體、可觀察的術語描述頂級回答與發展中回答的區別,而不是模糊的標籤如「優秀」或「需要改進」。
維基百科上的評分標準條目)描述了這種相同的結構——標準加表現水平——作為教育研究中使用的標準格式,因為它使基於評分標準的評分在評分者之間可重現,並且在一項作業到下一項作業之間保持一致。
生成的評分標準是一個起點,而不是最終文件。在將其分發給學生之前,根據實際的作業提示審查它,並調整每個表現水平的語言,使其與您如何大聲描述工作相匹配。在學生開始作業後而不是在您評分後與學生分享評分標準,是將其從評分工具轉變為教學工具的原因——學生朝著他們可以看到的標準寫作,而不是猜測您在尋找什麼。
從您的作業學習目標生成的評分標準將評分標準變成您在閱讀學生作業前定義的內容,而不是您在每份論文中即興創作的內容。
您如何執行真正改善學習的評估檢討循環?
評估生成器生成個別檢查,但真正推動學習向前的工作流是這些檢查形成的循環:診斷、教學、檢查、調整、重新測試。使用評估生成器生成一個孤立的測驗會給您一個快照。在一個單元中將其作為重複循環執行,是將評估從只測量成效的東西變成即時改進教學的驅動力的原因。
循環從單元前的診斷開始。結果告訴您哪些概念需要更多時間,哪些班級已經能夠掌握——相應調整您的課程計劃,而不是以相同的深度教授每個主題,無論學生已經知道什麼。在進行中途,形成性檢查確認調整後的進度是否有效;如果大部分班級都在同一問題上出錯,這表示在繼續之前重新教授該特定概念的信號,而不是要記錄的成績。在單元結束時,總結性測驗衡量對完整範圍的掌握,其結果直接進入下一個單元的診斷——持續存在缺陷的主題在新材料建立在其基礎上之前被納入複習中。
這個循環反映了教育研究人員所說的形成性評估:使用評估數據即時調整教學,而不是僅在結尾調整。形成性評估的維基百科摘要描述了大量研究,最值得注意的是 Black 和 Wiliam 的評論,表明使用具有反饋循環的頻繁低風險檢查的課堂比那些僅依靠單元結束測試的課堂看到明顯更好的成效。
執行此循環的實際要求是生成每個檢查需要足夠快速,使其不會與實際教學時間競爭。如果構建診斷需要與編寫課程本身相同的時間,那麼在正常工作量下,循環在一兩週後會崩潰。這是評估生成器相對於手工構建每個檢查的主要優勢:診斷、形成性測驗和總結性測驗都來自相同的導入材料,所以循環中的每個新檢查需要數分鐘而不是完整的規劃課程。
Black 和 Wiliam 關於形成性評估的研究發現,使用頻繁低風險檢查和反饋循環的課堂看到的成效明顯優於那些僅依靠單元結束測試的課堂。
- 1
在單元前診斷
進行簡短的診斷性評估,以查看學生在教學開始前已經知道什麼以及知識缺陷在哪裡。
- 2
調整課程計劃
使用診斷結果在真正薄弱的區域花費更多時間,並通過學生已經理解的材料更快地前進。
- 3
在單元中期檢查理解
在進行中途進行簡短的形成性評估。班級中跨越的共同錯誤答案表示要立即重新教授的概念。
- 4
測試並測量掌握情況
在單元結束時進行總結性評估,涵蓋所有教授的內容。
- 5
將缺陷納入下一個診斷
將持續存在錯誤的主題納入下一個單元的診斷中,以便在新材料建立在其基礎上之前進行強化。
Notelyn 的評估生成器如何運作?
Notelyn 的評估生成器從您導入工作區的任何內容中工作:打字筆記、PDF 章節、投影片、講座音頻或視頻,或手寫材料的圖像。因為導入步驟在整個平台中共享,所以生成 AI 摘要和閃卡的同一源也是評估生成器從中提取的內容——每個評估類型沒有單獨的上傳步驟。
導入您的材料後,您可以直接從該源生成診斷評估、形成性測驗、完整總結性測驗或評分標準。問題格式包括多選、真假、簡答和填空,您可以在生成前調整組合和長度,以便五問熱身和四十問期末考試都來自相同的基礎概念池。對於評分標準,生成器生成與您材料中嵌入的目標相關的標準和表現水平描述符,您可以在與學生分享前編輯。
每個生成的評估都包括答案鑰匙,帶有每項的簡短解釋,與源內容相關聯,以便查看結果可以同時作為有針對性的重新閱讀,而不是單獨的學習步驟。在學生或您在測驗模式中完成評估後,主題級結果分解會標記錯誤的聚集位置,這正是您檢討循環中下一個診斷所需的輸入。
因為 Notelyn 將所有內容——筆記、摘要、閃卡和您生成的每個評估——保存在一個工作區中,從本指南早期執行診斷-教學-檢查-重新測試循環不需要每次都重新上傳材料。只需導入一次,並生成您的單元下一階段所需的任何評估類型。
Notelyn 的評估生成器從相同的導入筆記、PDF 和錄音中跨每種格式提取——診斷評估、形成性測驗、總結性測驗和評分標準——所以無需上傳任何東西兩次。
- 1
導入您的課堂材料
上傳筆記、PDF、投影片、講座錄音或圖像。Notelyn 處理所有格式並自動提取基礎概念。
- 2
選擇評估類型
選擇診斷評估、形成性測驗、總結性測驗或評分標準。Notelyn 無論您選擇哪種格式,都從相同的導入概念中提取。
- 3
設置長度和問題組合
調整問題數量和格式組合——多選、真假、簡答、填空——以匹配評估的目的。
- 4
在分享前檢查和編輯
檢查生成的問題或評分標準標準,編輯任何需要調整的內容,並為生成器遺漏的主題添加項目。
- 5
使用結果規劃下一個檢查
評估完成後,查看主題級分解並使用它來決定循環中下一個評估應該重點關注什麼。
開始使用評估生成器
評估生成器最有用的時候是當您停止將其視為生成一個測驗的工具,並開始使用它執行單元實際需要的完整評估循環時:在您教授之前的診斷、進行中途的形成性檢查、結尾的總結性測驗,以及任何不是多選題的評分標準。每個都有不同的目的,將它們視為一個連接的循環而不是四個單獨的任務是將評估變成改進教學時刻的東西,而不只是衡量它的原因。
如果您以前沒有使用過評估生成器,請先從小開始。導入單個即將到來的單元的材料,並僅生成診斷評估。使用它揭示的內容調整您的第一堂課,然後為進行中途生成形成性檢查,在您到達結尾時生成總結性測驗。您將已經執行一次完整循環,每個後續單元都會變得更快,因為模式已經建立。
對於自習使用,相同的結構以更小的規模適用:在您開始複習主題前的簡短診斷、在您的自習課程進行中途的快速形成性檢查,以及在考試前的完整練習測驗。Notelyn 的評估生成器支持課堂和自習工作流,從相同的導入內容,所以無論您是教有三十名學生的班級還是準備您自己的期末考試,循環都有效。
將評估生成器視為循環,而不是單一工具:診斷、教學、檢查、測試,並將缺陷進入下一個單元。