PROJECT 003 · AI LANGUAGE LEARNING
卡咔英语
AI 学习平台
围绕英语口语练习构建的 AI 学习后端。系统需要在文字、语音和多轮上下文之间流转,同时保证高频学习内容的响应效率。
- JAVA 21 · SPRING BOOT 3.2.5
- TTS · STT · JAVE
- SSE · GPT
- REDIS · DYNAMIC DATASOURCE
DATABASE TABLES31
AUDIO PIPELINETTS + STT
STREAMINGSSE
ARCHITECTURE多模块
学习场景
口语学习并不是一次普通的问答。用户需要听到标准语音、提交自己的发音、得到识别和反馈,并在连续练习中保留上下文。
后端因此同时承担音频转换、模型交互、学习内容读取和 Token 成本统计。
一次流畅的口语练习,背后是文字、音频、模型和学习状态的连续协作。
语音流水线
- 集成 TTS 文本转语音,为学习内容生成可播放的标准语音。
- 集成 STT 语音转文本,将用户录音转成后续评测与对话可使用的文本。
- 通过 JAVE 完成音频编解码,统一处理不同格式与播放需求。
- 将语音能力组织成清晰的处理流程,支撑口语跟读和评测场景。
对话与性能
- 抽象可插拔 AI 对话引擎接入 GPT,支持系统提示词和多轮上下文管理。
- 以 SSE 流式返回模型内容,并记录每次请求的 Token 用量。
- 使用 DynamicDataSource 完成读写分离,降低高频学习内容对主库的压力。
- 通过 Redis 自定义缓存注解,将重复的缓存逻辑收敛成通用能力。
技术目标不仅是“能听、能说”,还要让连续学习过程足够快、足够稳定。