About Smart IELTS Review

把考官的判断力,变成可复用的能力

智阅雅思 致力于把教育评估的严肃性与现代 NLP 的精度结合在一起。我们不替代老师,也不制造“押题神话”。目标是让每一次写作训练都能获得超深度、有据可依的反馈,而非等待一周或拿到几句泛泛而谈的评语。

我们想解决的事

The Problem

写作训练的真正成本,不是写一篇作文的时间,而是反馈链路:等老师批改、读不懂红字、被给出 6.5 却说不清为什么是 6.5。

Our Approach

我们把考官的判断流程拆解为一系列可计算的子任务:句法解析、词汇召回、衔接评估、错误分类、回归打分,再用同一套 rubric 重新拼回学生看得懂的诊断报告。

Engine Internals

批阅引擎里跑的是什么

下面六个模块共同拼装成一次完整的批阅,每一个都对应学生看得见的一类反馈

Four-Dimension Scoring

四维独立打分

TA / CC / LR / GRA 四个维度由独立通道分别打分,再聚合为总分,避免某一维度的强弱拖动整体判断,每一项都对应官方评分细则的明确含义。

Sentence & Discourse

句内 + 篇章双层分析

句内层面看主谓宾搭配、从句嵌套与时态一致;篇章层面看段落之间的承接、对比与结论收束,连贯衔接的判断不依赖关键词数量。

Explainable Annotation

可解释错误标注

按冠词、介词、时态、可数性、搭配、平行结构等 30+ 类型对错误分类,每条标注都给出改写建议与简短依据,方便对照学习。

Contextual Substitution

上下文同义替换

不是同义词表查表,而是结合原句语境推荐学术词替换并做二次重排,保证候选词放回句中真的合用,避免“看起来高级实际不通”的硬塞。

Score Calibration

评分稳定性校准

0~9 分天然是有序的等级而非独立类别。我们对输出分布做校准,避免训练样本偏移把所有作文都推向平均分,保证 5.5 和 7.0 之间的差距真实可信。

Cross-prompt Generalization

题目无关泛化

将题目特征与写作质量特征解耦,使评分对题型变化保持稳健。面对陌生新题,写作质量本身仍是唯一衡量基准。

与官方 rubric 的对齐方式

IELTS Public Band Descriptor 是基线,模型不引入任何额外加分项

TATask Response

论点完整度、立场清晰度、字数充分性逐项判断后聚合为分数;超过 50 词的延展段落额外做主题一致性检测,避免“越写越偏”的情况被忽视。

CCCoherence & Cohesion

看段落与段落之间的衔接是否自然,识别递进、转折、因果、举例、收束五类常见衔接模式,并评估其覆盖度与重复使用率。

LRLexical Resource

关注学术词覆盖率、词汇多样性、搭配自然度三个角度,并把这三项与人工评分的偏序关系做联合校准,避免“用了大词就高分”。

GRAGrammatical Range & Accuracy

看句式复杂度、从句类型分布与错误密度三个维度,每一项独立校准,避免“错得多就直接低分”的粗糙启发式。

模型表现指标

基于近期内部评测集(n ≈ 2,400 篇人工双盲评分作文)的统计值

高

与考官评分一致性

基于内部双盲评测集的整体匹配率

≤ 0.5

总分平均偏差

与认证考官人工评分的平均绝对误差

稳定

错误检出准确率

更看重“判错就一定错”的稳健性

~ 8s

首字响应

完整深度报告的端到端响应时延

指标会随模型迭代变动,最新一次评测时间见模型版本更新日志

我们的边界

智能老师应该做哪些事、不应该做哪些事,我们想得很清楚

不替老师,让老师更轻

机器负责批量的客观判断(错词、错搭配、错时态),把节省下来的时间留给老师做内容指导与思维启发。这是智能老师在教育中最合理的位置。

数据不进训练集

用户提交的作文仅用于本次批阅与历史归档,默认不进入任何训练样本池;模型迭代使用的语料来源公开且授权可追溯。

评分以官方为准

我们对齐 IELTS Public Band Descriptor 而不创造私有标准;任何会让分数偏离官方语义的“讨好型加分”都被明确禁止。

想看看一篇真实作文是怎么被拆开的?

打开样例报告,逐句标注 + 错误分类 + 同义改写建议一目了然