把考官的判断力,
变成可复用的能力
智阅雅思 致力于把教育评估的严肃性与现代 NLP 的精度结合在一起。我们不替代老师,也不制造“押题神话”。目标是让每一次写作训练都能获得超深度、有据可依的反馈,而非等待一周或拿到几句泛泛而谈的评语。
我们想解决的事
The Problem
写作训练的真正成本,不是写一篇作文的时间,而是反馈链路:等老师批改、读不懂红字、被给出 6.5 却说不清为什么是 6.5。
Our Approach
我们把考官的判断流程拆解为一系列可计算的子任务:句法解析、词汇召回、衔接评估、错误分类、回归打分,再用同一套 rubric 重新拼回学生看得懂的诊断报告。
批阅引擎里跑的是什么
下面六个模块共同拼装成一次完整的批阅,每一个都对应学生看得见的一类反馈
四维独立打分
TA / CC / LR / GRA 四个维度由独立通道分别打分,再聚合为总分,避免某一维度的强弱拖动整体判断,每一项都对应官方评分细则的明确含义。
句内 + 篇章双层分析
句内层面看主谓宾搭配、从句嵌套与时态一致;篇章层面看段落之间的承接、对比与结论收束,连贯衔接的判断不依赖关键词数量。
可解释错误标注
按冠词、介词、时态、可数性、搭配、平行结构等 30+ 类型对错误分类,每条标注都给出改写建议与简短依据,方便对照学习。
上下文同义替换
不是同义词表查表,而是结合原句语境推荐学术词替换并做二次重排,保证候选词放回句中真的合用,避免“看起来高级实际不通”的硬塞。
评分稳定性校准
0~9 分天然是有序的等级而非独立类别。我们对输出分布做校准,避免训练样本偏移把所有作文都推向平均分,保证 5.5 和 7.0 之间的差距真实可信。
题目无关泛化
将题目特征与写作质量特征解耦,使评分对题型变化保持稳健。面对陌生新题,写作质量本身仍是唯一衡量基准。
与官方 rubric 的对齐方式
IELTS Public Band Descriptor 是基线,模型不引入任何额外加分项
论点完整度、立场清晰度、字数充分性逐项判断后聚合为分数;超过 50 词的延展段落额外做主题一致性检测,避免“越写越偏”的情况被忽视。
看段落与段落之间的衔接是否自然,识别递进、转折、因果、举例、收束五类常见衔接模式,并评估其覆盖度与重复使用率。
关注学术词覆盖率、词汇多样性、搭配自然度三个角度,并把这三项与人工评分的偏序关系做联合校准,避免“用了大词就高分”。
看句式复杂度、从句类型分布与错误密度三个维度,每一项独立校准,避免“错得多就直接低分”的粗糙启发式。
模型表现指标
基于近期内部评测集(n ≈ 2,400 篇人工双盲评分作文)的统计值
高
与考官评分一致性
基于内部双盲评测集的整体匹配率
≤ 0.5
总分平均偏差
与认证考官人工评分的平均绝对误差
稳定
错误检出准确率
更看重“判错就一定错”的稳健性
~ 8s
首字响应
完整深度报告的端到端响应时延
指标会随模型迭代变动,最新一次评测时间见模型版本更新日志
我们的边界
智能老师应该做哪些事、不应该做哪些事,我们想得很清楚
不替老师,让老师更轻
机器负责批量的客观判断(错词、错搭配、错时态),把节省下来的时间留给老师做内容指导与思维启发。这是智能老师在教育中最合理的位置。
数据不进训练集
用户提交的作文仅用于本次批阅与历史归档,默认不进入任何训练样本池;模型迭代使用的语料来源公开且授权可追溯。
评分以官方为准
我们对齐 IELTS Public Band Descriptor 而不创造私有标准;任何会让分数偏离官方语义的“讨好型加分”都被明确禁止。