Tren
dar
대시보드
논문
뉴스
GitHub
AI 소식
KO
EN
로그인
AI 소식
논문
대시보드
뉴스
GitHub
“evaluation”
이 키워드와 관련된 논문 · GitHub · 뉴스를 한곳에 모았습니다.
논문
12
전체 →
Semantic Scholar
자연어·LLM
인용 927
의사 수준의 의료 질문 답변을 위한 대규모 언어 모델
Toward expert-level medical question answering with large language models
Semantic Scholar
자연어·LLM
인용 269
진단 대화를 위한 AI 시스템 AMIE 개발
Towards conversational diagnostic artificial intelligence
OpenAlex
자연어·LLM
인용 1.4K
대규모 언어 모델의 발전과 활용에 대한 종합적 조사
A Survey of Large Language Models
Semantic Scholar
자연어·LLM
인용 1.7K
지속적 수집으로 오염 없는 코드 LLM 평가 벤치마크
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
Semantic Scholar
자연어·LLM
인용 1.6K
ChatGLM-4, GPT-4에 필적하는 중국어·영어 LLM 시리즈
ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools
Semantic Scholar
자연어·LLM
인용 554
LLM의 수학적 추론 능력 한계를 밝힌 GSM-Symbolic 벤치마크
GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models
Semantic Scholar
자연어·LLM
인용 500
LLM 탈옥 공격 평가를 위한 개방형 벤치마크
JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models
Semantic Scholar
멀티모달
인용 489
멀티모달 LLM은 보지만 인지하지는 못한다는 것을 밝힌 벤치마크
BLINK: Multimodal Large Language Models Can See but Not Perceive
Semantic Scholar
자연어·LLM
인용 395
LLM 추론 효율화를 위한 오버싱킹 문제와 해결 방안 종합 분석
Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models
Semantic Scholar
자연어·LLM
인용 288
LLM의 의료 성능과 안전성을 평가하는 오픈소스 벤치마크
HealthBench: Evaluating Large Language Models Towards Improved Human Health
Semantic Scholar
멀티모달
인용 170
비전 기반 임베디드 에이전트를 위한 멀티모달 LLM 종합 평가 벤치마크
EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents
Semantic Scholar
멀티모달
인용 159
3차원 의료 영상 분석을 위한 멀티모달 거대 언어 모델
M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models
GitHub
2
전체 →
AI인프라
Python
★ 2K
월드모델 연구의 재현 가능한 학습·평가를 위한 통합 플랫폼
galilai-group/stable-worldmodel
AI인프라
Python
★ 20.2K
LLM 애플리케이션의 트레이싱, 평가, 모니터링을 위한 오픈소스 플랫폼
comet-ml/opik
뉴스
12
전체 →
Hacker News
에이전트
▲ 4
상태 유지 에이전트 평가에 Deterministic한 LLM-as-Judge 대안 제안
A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation
OpenAI
안전·보안
▲ 0
배포 전 AI 모델 행동 예측하는 시뮬레이션 기법
Predicting model behavior before release by simulating deployment
Hacker News
생성모델
▲ 41
DiffusionBench: 확산 트랜스포머의 종합적인 평가 벤치마크 제안
DiffusionBench: Towards Holistic Evaluation of Generative Diffusion Transformers
OpenAI
정책·규제
▲ 0
OpenAI, 첨단 AI를 위한 공유 표준 구축 지원
Helping build shared standards for advanced AI
OpenAI
제품·출시
▲ 0
ChatGPT 건강 정보 응답에 추론·맥락·명확성 강화
Improving health intelligence in ChatGPT
Hacker News
▲ 52
Third-party cyber evaluations involving OpenAI models
OpenAI
▲ 0
Responding to the next frontier of critical cyber capabilities
OpenAI
▲ 0
Third-party cyber evaluations involving OpenAI models
techcrunch
▲ 0
Design Arena creators raise $7.9 million to bring taste to AI models
Anthropic
▲ 0
Investigating three real-world incidents in our cybersecurity evaluations - Anthropic
venturebeat
▲ 0
The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem — and most are shipping to production anyway
OpenAI
▲ 0
Separating signal from noise in coding evaluations