Software

Software

phần mềm giảng dạy di động, cục bộ

phần mềm được thiết kế để soạn và trình chiếu bài học, nói chuyện với AI, ghi âm lời nói, tạo và phân tích bản ghi chép lời, và mang lại giá trị cho học viên, giáo viên, phụ huynh và nhà trường.

Quy trình làm việc vẽ như bản đồ tàu điện: soạn, trình chiếu, ghi âm, chép lời, gán người nói, phân tích, in báo cáo trên tuyến chính; nhánh Verbi nối vào ở bước ghi âm; nhánh phụ đề, chỉnh sửa, tạo video tách ra từ bước chép lời.

Ba quy trình, hai khối

Ứng dụng có ba quy trình, được chia thành hai khối: A và B. Hãy để ý rằng quy trình chính bị chia làm đôi.

Phần còn lại của tài liệu đi theo đường ranh giới A/B này. Ranh giới đó cũng giải thích cách bố trí giao diện, cách cấp giấy phép, và sức mạnh máy tính mà mỗi khối cần.

KHỐI A

Soạn, trình chiếu, ghi âm

cùng với giọng nói sang giọng nói

Khối A chủ yếu là soạn và trình chiếu bài học.

Giới thiệu giao diện

Việc soạn và trình chiếu diễn ra ở thẻ Bài học, qua ba màn hình:

Bài học

Tất cả bài học được liệt kê ở một nơi. Bảng lọc giúp bạn tìm trong danh sách, và bảng tự động phát cũng nằm ở đây.

Phần

Bấm vào một bài học để mở màn hình phần. Tại đây bạn xem và sửa toàn bộ nội dung của một phần. Phần lớn công việc soạn bài diễn ra ở đây.

Trình chiếu

Bấm Trình chiếu từ màn hình phần, hoặc Tự động phát từ bảng tự động phát. Đây là bài trình chiếu, được tạo tức thì từ dữ liệu của các phần.

Thẻ Bài học: bảng lọc bên trái, danh sách bài học ở giữa, bảng tự động phát bên phải
Màn hình bài học. Bảng lọc bên trái, danh sách bài học ở giữa, tự động phát bên phải.

Bảng lọc thu hẹp danh sách theo từ khóa, ngày, thẻ hoặc danh sách phát. Bạn cũng có thể tạo danh sách phát ngay tại đó.

Bảng lọc đang mở ô tìm theo từ khóa
Từ khóa
Bảng lọc theo ngày, hiện năm và các tháng
Ngày
Bảng lọc với danh sách thẻ
Thẻ
Bảng lọc với các danh sách phát và ô để thêm danh sách mới
Danh sách phát

Ở màn hình phần, bạn sửa từng phần một: ảnh, chú thích, âm thanh ảnh, câu hỏi đọc hiểu, câu hỏi suy ngẫm, âm thanh câu hỏi, từ vựng và thẻ. Dùng Trước và Sau để chuyển giữa các phần.

Màn hình phần: ảnh, chú thích và câu hỏi suy ngẫm
1Ảnh, chú thích và câu hỏi suy ngẫm
Màn hình phần: âm thanh ảnh và âm thanh câu hỏi, đã được chép lời
2Âm thanh ảnh và âm thanh câu hỏi
Màn hình phần: câu hỏi đọc hiểu, các thẻ từ vựng và thẻ phân loại
3Câu hỏi đọc hiểu, từ vựng và thẻ

Âm thanh ảnh và âm thanh câu hỏi có thể được chép lời, để lời nói hiện ra dưới mỗi đoạn. Ở màn hình bài học, chọn một hoặc nhiều bài rồi chọn Chép lời thuyết minh trong danh sách thao tác. Giống như Verbi, đây là khối A và miễn phí: chạy bằng mô hình trên máy, hoặc bằng nhà cung cấp đám mây bạn chọn trong trang Cài đặt.

Nội dung bài học

Bài học được chia thành các phần. Ở màn hình phần, người soạn viết nội dung cho từng phần, và nội dung đó được lưu trong các bảng của cơ sở dữ liệu. Khi trình chiếu, nội dung được lấy ra ngay lập tức và slide được tạo từ đó.

Sơ đồ quan hệ thực thể: segments có nhiều dòng seg_photos, comprehension_q, questions, q_voice_audio và seg_vocabulary. Mỗi dòng seg_photos trỏ đến một ảnh và có nhiều dòng p_voice_audio; seg_vocabulary nối segments với vocabulary.
Các bảng đứng sau một phần. Ảnh và từ vựng được lưu một lần và dùng chung giữa các phần thông qua hai bảng nối seg_photos và seg_vocabulary. Bấm để phóng to.

Tại sao lại lưu bài học dưới dạng dữ liệu có cấu trúc và tạo slide tức thì? Cách này hơn gì so với PDF, PowerPoint hay Google Slides?

Đúng là giáo viên thường giữ bài giảng trong các tệp PDF, PPT hoặc Google Slides và sắp xếp chúng trong thư mục. Nhưng đó là những tệp tĩnh, không có cấu trúc và rời rạc. Giữ cho chúng ngăn nắp và nhất quán tốn rất nhiều công sức. Ngược lại, một cơ sở dữ liệu có thể chứa 10 hay 1.000.000 bài học trong cùng những bảng, theo cùng một cách, và chương trình có thể truy vấn chúng ngay lập tức.

Cấu trúc bài học

Chuỗi slide được tạo từ một phần đi theo mô hình PPP. Trình bày, Luyện tập, Vận dụng (Present, Practice, Produce, gọi tắt là PPP) là một phương pháp dạy ngoại ngữ. Trong một lớp giao tiếp hoặc hội thoại tiếng Anh, PPP có thể diễn ra như sau:

Màn hình trình chiếu: ảnh hai chú chó, khung bên cạnh còn trống
1 · TRÌNH BÀY

Một bức ảnh mới

Giáo viên đưa ra một bức ảnh mới. Học viên có thể nói bất cứ từ nào nảy ra trong đầu. Bức ảnh khơi gợi ngôn ngữ một cách thụ động.

Màn hình trình chiếu: ảnh kèm chú thích và từ vựng, câu hỏi đọc hiểu ở khung bên cạnh
2 · LUYỆN TẬP

Nghe và trả lời

Học viên nghe lời thuyết minh của người soạn về bức ảnh, rồi trả lời câu hỏi đọc hiểu bằng thông tin trong đó.

Màn hình trình chiếu: một câu hỏi suy ngẫm hiện màu đỏ ở khung bên cạnh
3 · VẬN DỤNG

Thảo luận

Giáo viên đặt câu hỏi suy ngẫm mở rộng từ nội dung của phần. Học viên thảo luận, tự tạo ra ngôn ngữ một cách độc lập.

Học viên xem ảnh, nghe và hiểu, rồi nói. Đó là hình dạng sư phạm của chuỗi slide. Cách này dùng được cho cả lớp một kèm một lẫn nhóm nhỏ.

Màn hình trình chiếu hiện ảnh bên trái, có chú thích đè lên ảnh và từ vựng của phần ở góc. Câu hỏi hiện bên phải: câu hỏi đọc hiểu màu đen, rồi đến câu hỏi suy ngẫm màu đỏ.

Tự động phát và quy trình giọng nói sang giọng nói

Tự động phát và Verbi được thiết kế cho việc luyện tập một mình hoặc theo nhóm khi không có giáo viên.

Tự động phát lần lượt chạy các bài học trong hàng đợi. Bài trình chiếu đi qua từng ảnh và chú thích, phát lời thuyết minh của mỗi ảnh, và dừng lại một số giây định trước ở mỗi câu hỏi thảo luận. Hàng đợi được phát một lượt, rồi dừng ở trang cuối. Đôi khi tôi phát tự động vào một phòng học trực tuyến để học viên cùng nghe, xem và trao đổi với nhau.

Bảng tự động phát với hàng đợi trống và phần tùy chọn đang thu gọn
1Hàng đợi
Tùy chọn tự động phát: thời gian thảo luận tính bằng giây và ô Dùng Verbi
2Thời gian thảo luận và Dùng Verbi
Tùy chọn tự động phát: đã chọn Ghi âm buổi thảo luận, với ô tối thiểu và tối đa cho số người nói
3Ghi âm buổi thảo luận và số người nói

Hẹn giờ bắt đầu. Để tự động phát bắt đầu vào một giờ định sẵn, ví dụ khi bạn không thể ngồi ở máy tính lúc lớp bắt đầu, hãy chọn Hẹn giờ trong phần Tùy chọn và nhập giờ. Nút sẽ đổi thành Hẹn giờ phát. Bấm nút, màn hình trình chiếu sẽ mở ở trang đầu tiên và chờ ở đó. Đến giờ, hàng đợi sẽ tự phát một lượt. Nếu bạn dạy trực tuyến, hãy mở buổi họp và chia sẻ thẻ LessonSlides kèm âm thanh trước khi rời đi. Giữ thẻ luôn mở, vì đóng thẻ hoặc bấm Esc sẽ hủy lịch hẹn. Trong phần Cài đặt của Windows, hãy để máy không bao giờ ngủ khi đang cắm sạc.

Dùng Verbi để làm gì? Nếu ô này được chọn khi tự động phát, mỗi lượt thảo luận sẽ khởi động một trợ lý giọng nói AI đã nạp sẵn ngữ cảnh của phần. Trợ lý sẽ thảo luận các câu hỏi cùng học viên. Có học viên thấy cách tự luyện này vui hơn hoặc thoải mái hơn, và nó cũng tiện cho những học viên không đến lớp được.

Verbi hoạt động thế nào? Verbi là một quy trình giọng nói sang giọng nói:

micro→ stt→ llm→ tts→ loa

Khi học viên nói vào micro, một đoạn âm thanh ngắn được ghi lại. Mô hình chuyển giọng nói thành văn bản (STT) chép lời đoạn âm thanh và chuyển văn bản cho mô hình ngôn ngữ lớn (LLM). LLM đọc văn bản và viết câu trả lời. Câu trả lời được chuyển sang mô hình chuyển văn bản thành giọng nói (TTS), tạo ra một tệp âm thanh giọng nói tổng hợp. Âm thanh phát ra loa, và học viên nghe được câu trả lời.

Tôi chọn Verbi vì nó là bán song công và đồng bộ. Quy trình chỉ chạy theo một chiều tại mỗi thời điểm, và mỗi bước chờ bước trước hoàn tất. Nhờ vậy cuộc trò chuyện diễn ra đều đặn, dễ đoán và theo lượt, điều rất có ích cho người học ngoại ngữ.

Tôi cũng chọn Verbi vì chất lượng và khả năng kiểm soát. Nó cho phép chuyển đổi giữa các nhà cung cấp AI trên đám mây và AI chạy trên máy:

  • Nếu máy tính của bạn không có nhiều RAM, bạn có thể chỉ dùng nhà cung cấp đám mây.
  • Nếu bạn muốn giữ dữ liệu riêng tư và không gửi giọng nói đến máy chủ bên thứ ba, bạn có thể chỉ dùng mô hình chạy trên máy.
  • Bạn cũng có thể thử các mô hình khác nhau để so sánh chất lượng.

Ghi âm lời nói trong lớp

Bạn có thể ghi âm lớp học cả khi tự trình chiếu lẫn khi tự động phát.

  • Tự trình chiếu: nhấn R để bắt đầu hoặc dừng ghi âm bất cứ lúc nào.
  • Tự động phát: chọn Ghi âm buổi thảo luận trong bảng tự động phát, các lượt thảo luận sẽ được ghi âm tự động, kể cả Verbi nếu đang dùng.

Trong cả hai trường hợp, bạn có thể nhập số người nói dưới dạng tối thiểu và tối đa (xem bước 3 trong ảnh tự động phát ở trên). Hãy tính cả Verbi và chính bạn. Việc này không bắt buộc, nhưng giúp chép lời chính xác hơn nếu bản ghi sẽ được chép lời sau này. Để trống cả hai ô thì máy sẽ tự đoán.

Dạy trực tuyến? Nếu bạn chia sẻ màn hình trong lớp trực tuyến, trình ghi âm của Lessonslides chỉ thu được giọng của bạn, vì nó nghe qua micro của máy bạn. Hãy ghi âm bằng tính năng ghi của phòng học trực tuyến, rồi nhập tệp âm thanh vào bảng Bản ghi.

Như vậy là xong phần soạn bài, trình chiếu, giọng nói sang giọng nói và ghi âm, cũng là hết khối A. Khối B giải thích điều gì xảy ra với các bản ghi đó ở nửa sau của quy trình chính, và cách làm video phụ đề tiếng Việt.

KHỐI B

Chép lời, phân tích, báo cáo

cùng với quy trình video phụ đề tiếng Việt

Khối B nói về phân tích và sản phẩm đầu ra.

Sản phẩm đầu ra là gì, và vì sao chúng quan trọng

Ở một trường mẫu giáo tại Hàn Quốc, giai đoạn “vận dụng” của PPP thường là một tiết mục biểu diễn có kịch bản. Các bé học ngôn ngữ mới, luyện tập có hướng dẫn, rồi chia nhóm diễn một vở kịch ngắn hoặc hát một bài hát. Các bé được mặc trang phục cho vui, và chúng tôi còn có cả phông xanh để ghép nền ảo. Tiết mục của mỗi nhóm được quay lại và tự động gửi đến phụ huynh của từng bé trong nhóm. Những video ngắn này rất dễ thương, phụ huynh rất thích xem và chia sẻ. Nội dung như vậy có giá trị với cả phụ huynh lẫn việc quảng bá.

Ở khối B, chúng ta làm ra hai sản phẩm: video phụ đề tiếng Việt và báo cáo học viên. Cả hai đều có giá trị với học viên, giáo viên, phụ huynh và nhà trường.

Yêu cầu

Bạn cần hai thứ để dùng khối B.

1Giấy phép

Khác với khối A, khối B cần mua thẻ giấy phép. Một thẻ kích hoạt được tối đa 3 máy tính. Trong trang Cài đặt, mở mục Giấy phép và bấm Kích hoạt trực tuyến….

2Phần cứng

Máy tính của bạn phải tải và chạy được một mô hình AI trên máy. Chọn mô hình base, small hoặc medium tùy theo sức máy. Mô hình small cần ít nhất 8 GB RAM và 1 GB dung lượng trống. Chi tiết có trong trang Cài đặt.

Từ bản ghi đến báo cáo học viên

Mỗi bản ghi bạn thu ở khối A xuất hiện thành một dòng mới trong bảng ở thẻ Bản ghi. Bấm mở để xem trang bản chép lời và nghe lại âm thanh. Lúc này chưa có bản chép lời: một mô hình chép lời chạy trên máy sẽ chuyển lời nói thành văn bản, và văn bản đó được dùng cho cả báo cáo lẫn video phụ đề.

  1. Chép lời

    Nhập số người nói nếu bạn chưa nhập. Trong bảng Bản ghi, chọn một hoặc nhiều bản ghi rồi chọn Chép lời trong danh sách thao tác. Nên chép lời theo lô, vì mỗi lần nạp mô hình Whisper vào bộ nhớ đều mất thời gian.

  2. Gán người nói

    Khi xử lý xong, bấm mở ở bản ghi. Văn bản được gắn nhãn người nói chung chung như speaker_00 và speaker_01. Gán một người cho mỗi nhãn, rồi lưu. Nếu người đó chưa có, hãy tạo trước ở thẻ Thành viên.

    Trang bản chép lời, mục Người nói: SPEAKER_00 được gán cho Verbi và SPEAKER_01 cho yoshua, mỗi nhãn có các câu mẫu để nghe
    Nghe một câu mẫu để nhận ra giọng, rồi chọn người trong danh sách thả xuống.
  3. Xem phân tích bản chép lời

    Khi bản chép lời đã có văn bản kèm người nói, nó sẽ được phân tích. Các biểu đồ xuất hiện bên dưới khu vực gán người nói, đo thời lượng và số lượt nói của từng người trong bản chép lời đó.

    Biểu đồ theo bản chép lời

    Biểu đồ cột thời lượng nói của từng người so với đường trung vị đứt nét
    Thời lượng nói so với trung vị
    Biểu đồ phân tán tỉ lệ lượt nói so với tỉ lệ số từ, có đường chéo cân bằng
    Tỉ lệ lượt nói so với tỉ lệ số từ
    Biểu đồ độ dốc thời lượng nói của từng người ở nửa đầu và nửa sau
    Nửa đầu so với nửa sau
  4. Mở hồ sơ của một học viên

    Ở thẻ Thành viên, bấm vào tên một người. Trang hồ sơ hiện số liệu nói của người đó trên tất cả các bản ghi lớp học mà họ được gán.

    Biểu đồ theo học viên

    Vốn từ tăng dần: số từ khác nhau cộng dồn tăng từ khoảng 30 lên 360 trong khoảng từ 2026-08-08 đến 2026-09-19
    Vốn từ tăng dần: tổng số từ khác nhau cộng dồn qua tất cả bản ghi của học viên
    Từ mới mỗi bản ghi: các cột từ khoảng 20 đến 64
    Từ mới mỗi bản ghi: số từ khác nhau chưa từng xuất hiện ở bản ghi nào trước đó
    Đa dạng từ vựng: chỉ số Guiraud của từng bản ghi với đường xu hướng đi lên
    Đa dạng từ vựng: chỉ số Guiraud (số từ khác nhau ÷ √tổng số từ). Bản ghi dưới 50 từ được đánh dấu là không đáng tin cậy.
    Tham gia: tỉ lệ lượt nói so với mức chia đều, khoảng 0,92 đến 1,20
    Tham gia: số lượt nói của học viên ÷ mức chia đều lượt nói. 1,00× nghĩa là chia đều.

    Bên dưới các biểu đồ là bảng liệt kê mọi bản ghi mà học viên được gán, kèm số từ, số từ khác nhau, số từ mới, số lượt nói và số phút.

    Bảng bản ghi trong hồ sơ với các cột ngày, bài học, số từ, từ khác nhau, từ mới, lượt nói và số phút
  5. Xuất báo cáo học viên

    Quay lại thẻ Thành viên, chọn một hoặc nhiều người rồi chọn Báo cáo học viên (PDF) trong danh sách thao tác. Một tệp PDF duy nhất sẽ được tải về, có nội dung giống trang hồ sơ. In ra và gửi về nhà để học viên chia sẻ sự tiến bộ của mình với phụ huynh.

    Báo cáo học viên một trang: tên học viên, tổng số từ, bốn biểu đồ hồ sơ và bảng bản ghi
    Một báo cáo học viên: mỗi học viên một trang A4

Từ bản chép lời đến video phụ đề tiếng Việt

Quay lại trang bản chép lời. Ở mục Phụ đề, chỉ một cú bấm là bản chép lời được định dạng lại thành phụ đề. Mỗi dòng phụ đề trông như sau:

1Số thứ tự: vị trí của dòng phụ đề trong chuỗi 00:00:01,430 –> 00:00:01,950Mốc thời gian: chính xác lúc phụ đề hiện ra và biến mất Hello.Nội dung: chữ hiện trên màn hình
  1. Xem lại và sửa

    Đây là bước cần con người tham gia. Tệp phụ đề sửa được ngay trong mục Phụ đề. Đọc lại một lượt và sửa lỗi. Chưa có gì được ghi xuống ổ đĩa cho đến khi bạn bấm Lưu.

    Trang bản chép lời, mục Phụ đề: nút Tạo và Lưu phía trên ô văn bản SRT có thể chỉnh sửa
    Trình sửa phụ đề trên trang bản chép lời
  2. Dịch và lưu

    Tự dịch, hoặc sao chép toàn bộ tệp vào Google Dịch, dán bản dịch đè lên bản gốc, rồi lưu.

  3. Tạo video

    Ở mục Video, bấm Tạo video. Âm thanh của bản ghi, ảnh của phần bài học lúc ghi âm và phụ đề đã dịch được ghép thành một video để bạn tải về và chia sẻ.

    Một khung hình từ video hoàn chỉnh: ảnh của phần bài học là một chú chó đang ngủ, với phụ đề đã dịch trên dải đen bên dưới
    Một khung hình từ video hoàn chỉnh: ảnh của phần bài học, phụ đề đã dịch ở bên dưới

portable, local teaching software

software that is designed to build and present lessons, talk to ai, record speech, create and analyze transcripts, and deliver value to students, teachers, parents and schools.

The workflow drawn as a transit map: author, present, record, transcribe, label speakers, analyze, print report on the main line; a Verbi branch joins at record; a subtitles, edit, create video branch leaves from transcribe.

Three pipelines, two parts

The app contains three pipelines. They’re organized into two parts, A and B. Notice that the main pipeline is split in half.

The rest of this document follows the A/B line. That line also explains the UI, the shape of the licence, and the different computing power each part needs.

PART A

Author, present, record

plus speech-to-speech

Part A is mainly about authoring and presenting lessons.

UI tour

Authoring and presenting happen on the Lessons tab, in three views:

Lessons

All lessons listed in one place. A filter panel helps you explore the list, and the autoplay panel lives here too.

Segments

Click an individual lesson to reach the segment view. Here you view and edit all the content of a single segment. Most of the authoring work happens here.

Present

Click Present from the segment view, or Autoplay from the autoplay panel. This is the presentation, generated on the fly from segment data into lesson slides.

The Lessons tab: filter panel on the left, lesson list in the middle, autoplay panel on the right
The lessons view. Filter on the left, the lesson list in the middle, autoplay on the right.

The filter panel narrows the list by keyword, date, tag or playlist. You can also create playlists from it.

Filter panel with keyword search open
Keyword
Filter panel with date filter showing year and months
Date
Filter panel with tag list
Tag
Filter panel with playlist list and a field to add a playlist
Playlist

In the segment view you edit one segment at a time: its photos, caption, photo audio, comprehension questions, reflection questions, question audio, vocabulary and tags. Use Prev and Next to move between segments.

Segment view: photos, caption and reflection questions
1Photos, caption and reflection questions
Segment view: photo audio and question audio, each transcribed
2Photo audio and question audio
Segment view: comprehension questions, vocabulary chips and tags
3Comprehension questions, vocabulary and tags

Photo audio and question audio can be transcribed, so the words appear under each clip. In the lessons view, select one or more lessons and choose Transcribe narration from the action dropdown. Like Verbi, this is part A and free: it runs on a local model, or on a cloud provider you choose in Settings.

Lesson content

Lessons are divided into segments. In the segment view, the author writes content for each segment, and it’s stored in tables in the database. When the author presents the lesson, this content is retrieved instantly and the slides are generated from it.

Entity-relationship diagram: segments has many seg_photos, comprehension_q, questions, q_voice_audio and seg_vocabulary rows. Each seg_photos row points to one photo and has many p_voice_audio rows; seg_vocabulary links segments to vocabulary.
The tables behind a segment. Photos and vocabulary are stored once and shared between segments through the seg_photos and seg_vocabulary link tables. Click to enlarge.

Why store lessons as structured data and generate slides on the fly? Why is this better than PDF, PowerPoint or Google Slides?

It’s true that teachers most often keep their lessons in PDF, PPT or Google Slides files and organize them in a folder. But these are static, unstructured, separate files. They take a lot of work to keep organized and consistent. A database, on the other hand, holds 10 lessons or 1,000,000 lessons in the same tables, the same way, and a program can query them instantly.

Lesson structure

The sequence of slides built from a single segment follows a PPP pattern. Present, Practice, Produce (PPP for short) is a method used in foreign language teaching. In an English communication or conversation lesson, PPP might look like this:

Present view: a photo of two dogs, with the side panel still empty
1 · PRESENT

A new photo

The teacher shows a new photo. Students may say whatever words come to mind. The photo activates language passively.

Present view: photo with caption and vocabulary, comprehension questions in the side panel
2 · PRACTICE

Listen and answer

Students listen to the author’s spoken narration of the photo, then answer comprehension questions using information from it.

Present view: a reflection question shown in red in the side panel
3 · PRODUCE

Discuss

The teacher asks reflection questions that extend from the segment’s content. Students discuss them, producing language independently.

Students see a photo, listen and comprehend, then talk. That is the teaching shape of the slide sequence. It works for one-on-one lessons as well as small groups.

The present view shows the photo on the left, with the caption over it and the segment’s vocabulary in the corner. The questions appear on the right: comprehension questions in black, then the reflection question in red.

Autoplay and the speech-to-speech pipeline

Autoplay and Verbi are designed for solo and group practice when the teacher isn’t present.

Autoplay plays the lessons in the queue automatically. The presentation moves through every photo and caption, plays each photo’s narration, and pauses for a preset number of seconds at each discussion question. The queue plays through once, then stops on its last slide. Sometimes I broadcast autoplay into a live room so students can listen, watch and interact with each other.

Autoplay panel with an empty queue and options collapsed
1The queue
Autoplay options: discussion time in seconds and a Use Verbi checkbox
2Discussion time and Use Verbi
Autoplay options: Record discussions checked, with min and max fields for speakers in recording
3Record discussions and speaker count

Scheduling a start. To have autoplay start at a set time, for example when you can’t be at your computer when class begins, check Schedule under Options and enter a time. The button changes to Arm. Click it, and the present view opens on the first slide and waits there. At that time, the queue plays once by itself. If you’re presenting online, start your meeting and share the LessonSlides tab with audio before you leave. Keep the tab open, because closing it or pressing Esc cancels the schedule. In Windows Settings, set the computer to never sleep while it’s plugged in.

What does Use Verbi do? If it’s checked during autoplay, each discussion starts a voice AI loaded with context from the segment. The agent discusses the questions with the student. Some students find this self-practice fun or more comfortable, and it’s convenient for students who can’t join class.

How does Verbi work? Verbi is a speech-to-speech pipeline:

microphone→ stt→ llm→ tts→ speakers

When the student speaks into the microphone, a short audio clip is recorded. The speech-to-text (STT) model transcribes the clip and passes the text to the large language model (LLM). The LLM reads the text and writes a response. The response goes to the text-to-speech (TTS) model, which creates a synthetic voice audio file. The audio plays through the speakers, and the student hears the reply.

I chose Verbi because it’s half-duplex and synchronous. The pipeline runs in one direction at a time, and each step waits for the previous one to finish. This makes a predictable, steady, turn-based conversation, which helps language learners.

I also chose Verbi for quality and control. It lets you switch between cloud inference providers and local AI:

  • If your computer doesn’t have much RAM, you can use cloud providers only.
  • If you want to keep data private and not send speech to third-party servers, you can use local models only.
  • You can also try different models and compare their quality.

Recording speech in class

You can record class audio during both manual presenting and autoplay.

  • Manual present: press R to start or stop recording at any time.
  • Autoplay: check Record discussions in the autoplay panel, and the discussion windows are recorded automatically, including Verbi if it’s in use.

In both cases you can enter the number of speakers, as a minimum and maximum (see step 3 of the autoplay screenshots above). Count Verbi and yourself too. This is optional, but it improves accuracy if the recording will be transcribed later. Leave both fields blank to let the computer guess.

Teaching online? If you share your screen in an online class, Lessonslides’ own recorder only picks up your voice, because it listens on your device’s microphone. Record with the live room’s recording feature instead, then import the audio file into the Recordings table.

That covers authoring, presenting, speech-to-speech and recording audio, and it’s the end of part A. Part B explains what happens to those recordings in the second half of the main pipeline, and how the Viet-subtitle videos are produced.

PART B

Transcribe, analyze, report

plus the Viet-subtitle video pipeline

Part B is about analysis and deliverables.

What deliverables are, and why they matter

At a kindergarten in South Korea, the PPP “produce” stage was often a scripted performance. The children learned new language, did guided practice, then put on a short play or sang a song in groups. They made it fun with costumes, and there was even a green screen we used for virtual backgrounds. Each group’s performance was recorded and sent automatically to the parents of every student in the group. The shorts were cute, and parents loved watching and sharing them. That content is valuable to parents and to marketing alike.

In part B we produce two deliverables: Viet-subtitle videos and speaker reports. Both are valuable to students, teachers, parents and schools.

Requirements

You need two things to use part B.

1A licence

Unlike part A, part B needs a purchased licence card. One card activates up to 3 computers. In Settings, open the Licence tab and press Activate online….

2Hardware

Your computer must be able to load and run a local AI model. Choose the base, small or medium model to suit your device. The small model needs at least 8 GB of RAM and 1 GB of free disk space. Details are on the Settings page.

From recording to speaker report

Each recording you captured in part A appears as a new row in the Recordings table on the Recordings tab. Click Open to see its transcript page and play the audio. There’s no transcript yet: a local transcription model turns the speech into text, and that text feeds both the reports and the subtitled videos.

  1. Transcribe

    Set the speaker count if you haven’t yet. In the Recordings table, select one or more recordings and choose Transcribe from the action dropdown. Batching helps, because loading the Whisper model into memory takes time on every run.

  2. Assign speakers

    Once processing finishes, click Open on the recording. The text is labeled with generic speaker labels such as speaker_00 and speaker_01. Assign a speaker to each label, then save. If a speaker doesn’t exist yet, create them on the Speakers tab first.

    Transcript page, Speakers section: SPEAKER_00 assigned to Verbi and SPEAKER_01 assigned to yoshua, each with sample lines to play
    Play a sample line to recognise the voice, then pick the person from the dropdown.
  3. Read the transcript analysis

    Now the transcript has text with speaker IDs, it’s analyzed. Charts appear below the speaker assignment area, measuring time and turns across speakers in that one transcript.

    Per-transcript charts

    Bar chart of talk time per speaker against a dashed median line
    Talk time vs median
    Scatter plot of share of turns against share of words, with a diagonal parity line
    Turn share vs word share
    Slope chart of each speaker's talk time in the first and second half
    First half vs second half
  4. Open a speaker’s profile

    On the Speakers tab, click a speaker’s name. The profile page shows speaking analytics across every class recording that speaker is assigned to.

    Per-speaker charts

    Vocabulary growth: cumulative distinct words rising from about 30 to 360 between 2026-08-08 and 2026-09-19
    Vocabulary growth: cumulative distinct words across all of the speaker’s recordings
    New words per recording: bars between about 20 and 64
    New words per recording: distinct words not seen in any earlier recording
    Word variety: Guiraud index per recording with a rising trend line
    Word variety: the Guiraud index (distinct words ÷ √total words). Recordings under 50 words are marked as unreliable.
    Participation: turn share relative to an even split, around 0.92 to 1.20
    Participation: the speaker’s turns ÷ an even split of the floor. 1.00× means an even share.

    Below the charts, a table lists every recording the speaker is assigned to, with their words, distinct words, new words, turns and minutes.

    Profile recordings table with date, lesson, words, distinct, new, turns and minutes columns
  5. Export a speaker report

    Back on the Speakers tab, select one or more speakers and choose Speaker report from the action dropdown. A single PDF downloads, mirroring the profile page. Print it and send it home so students can share their progress with their parents.

    A one-page speaker report: the speaker's name, total words, the four profile charts and the recordings table
    A speaker report: one A4 page per speaker

From transcript to Viet-subtitle video

Go back to the transcript page. In the Subtitles section, one click reformats the transcript as subtitles. Each caption looks like this:

1Sequence number: the caption’s place in the order 00:00:01,430 –> 00:00:01,950Timecodes: exactly when the caption appears and disappears Hello.Text: what shows on screen
  1. Review and correct

    This is the human-in-the-loop step. The subtitle file is editable in the Subtitles section. Read it through and fix any mistakes. Nothing is written to disk until you press Save.

    Transcript page, Subtitles section: Create and Save buttons above an editable SRT text box
    The subtitle editor on the transcript page
  2. Translate and save

    Translate it by hand, or copy the whole file into Google Translate, paste the translation back over the original, and save.

  3. Create the video

    In the Video section, click Create video. The recording’s audio, the image of the lesson segment it was recorded on, and the translated subtitles are combined into a video you can download and share.

    A frame from a finished video: the segment photo of a sleeping dog, with a translated subtitle on a black band below
    A frame from a finished video: the segment photo, with the translated subtitle underneath