Engineering
Design
Product
구독하기
채용 바로가기
Engineering
Design
Product
구독하기
채용 바로가기
리더보드 1등 LLM, 토스에서도 1등일까?
Toss Benchmark 구축기
전체 아티클
Design
오주연
사용자를 위해 일부러 어렵게 만드는 경험, 어디까지 괜찮을까?
10대를 위한 잠금 저금통을 만들며 찾은 ‘좋은 불편함’의 기준을 공유합니다.
Engineering
박찬용/최기원/김태정/이민영
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
Toss의 AI 기반 서비스에 적합한 LLM이 무엇인지 평가하는 Toss Benchmark 구축기
Engineering
장재영/김진웅
토스증권이 GPU-aware를 넘어 GPU-native 클러스터를 구축한 방법
토스증권이 Kubernetes GPU 클러스터의 운영 한계를 해결한 방법
Engineering
이다용
App Router의 장점은 우리에게도 장점일까요?
App Router가 토스뱅크에도 좋은 선택일지, 직접 측정한 결과와 도입 여부를 판단한 기준을 공유해요.
Engineering
김경윤
AI가 팀 규칙을 지키도록 하는 방법
Coding Agent를 위한 Stylepack
1
2
3
4
5
인기 있는 글
1
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
박찬용/최기원/김태정/이민영
2
토스증권이 GPU-aware를 넘어 GPU-native 클러스터를 구축한 방법
장재영/김진웅
3
AI가 만든 코드가 어드민이 되기까지
이현재
최신 댓글
신나는바다사자
댓글에 Knowledge 평가에 대한 의문을 가지는 분들이 많은데, 대표적인 지식 벤치마크로 SimpleQA 같은 데이터셋도 있습니다. 검색 및 결과 활용 능력도 모델이 자체적으로 가지고 있는 지식에 의존적이라 도메인 지식을 평가할 충분해 보입니다. 글 인상깊게 읽었습니다. 감사합니다.
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
다정한북극곰
toss knowledge 평가한 이유가 외부 지식 없이 모델을 자체적으로 해결할 수있는 범위를 파악하는 것이라고 하신 것 같은데요. 그러면 지엽 지식 매핑하는 것 등의 태스크를 외부도구 없이 사용하는 것을 염두에 두고 있는 것 같은데 어떤 문제를 자체 지식으로하고 어떤 태스크를 외부지식을 끌고와야 할지 선택하는 것이 중요할 것 같은데 고려하시는 방안이 있나 궁금하네요. 이걸 잘 못 잡으면 자체모델이 해결하는 태스크들은 할루시네이션 관련 보장이 안될 것 같은데
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
유쾌한다람쥐
은행도 따뜻할 수 있는 거였군요,,,
사용자를 위해 일부러 어렵게 만드는 경험, 어디까지 괜찮을까?
쾌활한물개
시계
토스의 이모지 폰트, 토스페이스 제작기
아티클 시리즈
Quality at Toss
QA Platform 팀이 토스의 품질을 만들어가는 과정과, 그 안에서 탄생한 플랫폼과 기술 이야기를 소개합니다.
아티클 3개
언더커버 사일로
토스의 서바이벌 예능 <언더커버 사일로>의 비하인드 스토리
아티클 6개
토스페이먼츠 레거시 개편 이야기
멈춰있던 PG 시스템의 시간을 다시 흐르게 한 스토리
아티클 13개
토스증권 Tech Talk Talk
토스증권 엔지니어들의 기술적 고민과 성장의 여정을 공유해요.
아티클 3개