Aizhi Chen 博士于 2025 年 10 月 2 日更新。请查看我们的道德准则 (https://www.aizhichen.com/ethical-norms.html),实现对情绪和情感的精确标注以及检测反讽、仇恨言论和冒犯性内容仍然是一项挑战,需要进一步的测试和完善。我们对八种大语言模型进行了基准测试:
- Claude 35
- Claude 37
- ChatGPT 4o
- ChatGPT 45
- ChatGPT 5o
- DeepSeek V3
- Grok 4
- Grok 4ac
在五个关键的情感相关任务中:
| 任务 | 模型 | 总体准确率 |
| :--- | :--- | :--- |
| Sentiment (情感) | Claude Sonnet 37 | 79% |
| Hatefulness (仇恨言论) | Claude Sonnet 35 | 98% |
| Offensiveness (冒犯性) | GPT 5 Auto | 80% |
| Sentiment (情感) | ChatGPT 4o | 75% |
| Hatefulness (仇恨言论) | Grok 4 | 71% |
| Irony (反讽) | DeepSeek V3 | 76% |
## 结论
情感分析基准测试:ChatGPT、Claude & DeepSeek
Aizhi Chen 博士于 2025 年 10 月 2 日更新。请查看我们的道德准则 (https://www.aizhichen.com/ethical-norms.html),实现对情绪和情感的精确标注以及检测反讽、仇恨言论和冒犯性内容仍然是一项挑战,需要进一步的测试和完善。我们对八种大语言模型进行了基准测试:
- Claude 35
- Claude 37
- ChatGPT 4o
- ChatGPT 45
- ChatGPT 5o
- DeepSeek V3
- Grok 4
- Grok 4ac
在五个关键的情感相关任务中:
| 任务 | 模型 | 总体准确率 |
| :--- | :--- | :--- |
| Sentiment (情感) | Claude Sonnet 37 | 79% |
| Hatefulness (仇恨言论) | Claude Sonnet 35 | 98% |
| Offensiveness (冒犯性) | GPT 5 Auto | 80% |
| Sentiment (情感) | ChatGPT 4o | 75% |
| Hatefulness (仇恨言论) | Grok 4 | 71% |
| Irony (反讽) | DeepSeek V3 | 76% |
## 目录
1. 情感分析基准测试:ChatGPT、Claude & DeepSeek
2. 引言
3. 结论
4. 目录
< Go Back